Pixel Linguist II:像素文本表示学习的设计基础
On the Design Fundamentals of Pixel Text Representation Learning
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究通过系统性消融实验确定鲁棒视觉文本表示学习的四个关键要素:可变图像分辨率与渲染字号、自然图文对、布局感知渲染、两阶段多语言课程。据此训练的 Pixel Linguist II 采用原生分辨率与实时渲染,在 2.8 亿训练样本上完成多语言课程训练,在英文、跨语言及多语言 Visual STS 与 ViDoRe 上取得新的 SOTA,并在 80% 视觉 token 压缩下保持稳健。
来源:Hugging Face Daily Papers · arxiv.org