UniSpace:统一视觉表征与可扩展多模态建模
UniSpace: Unified Visual Representation and Scalable Multimodal Modeling
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究者提出 Patch Reparameterization,在保留预训练语义 ViT 原有语义通路的同时,加入重建感知的 patch embedding,使冻结的 ViT 块既能保持多模态理解,又能高保真重建图像。
来源:Hugging Face Daily Papers · arxiv.org