跳到正文
Hugging Face Daily Papers·· 25 天前AI 评分38

把图像 tokenizer 当作视觉语言来研究:统一多模态模型中的联合建模与下游表现

Studying Image Tokenizers as Visual Languages in Unified Multimodal Models

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究构建了一个纯自回归的受控测试平台,在多模态持续预训练中追踪文本、图像、T2I 与 I2T 四类任务的验证损失,以此考察图像 tokenizer 作为"视觉语言"与文本联合建模的效果。

来源:Hugging Face Daily Papers · arxiv.org