跳到正文
Hugging Face Daily Papers·· 2026-08-24AI 评分42

UniSpace:统一视觉表征与可扩展多模态建模

UniSpace: Unified Visual Representation and Scalable Multimodal Modeling

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究者提出 Patch Reparameterization,在保留预训练语义 ViT 原有语义通路的同时,加入重建感知的 patch embedding,使冻结的 ViT 块既能保持多模态理解,又能高保真重建图像。

来源:Hugging Face Daily Papers · arxiv.org