跳到正文
量子位 · 微信公众号·· 2026-07-31AI 评分48

中科大与上海AI Lab提出视觉预训练新范式,让模型直接从文档图像学科学推理

只读文本的AI,科学推理能力只有“看图”AI的1/3丨中科大

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

中科大与上海人工智能实验室联合团队提出视觉预训练(VP)范式,在连续视觉表征空间中预测下一个视觉单元,让模型直接从图文交织的文档页面学习。实验显示,VP仅用约200亿视觉Token(约为解析文本800亿Token的四分之一),便在MMLU-Pro、GPQA Diamond等基准上全面优于纯文本预训练,且优势随训练量增加持续扩大。

来源:量子位 · 微信公众号 · mp.weixin.qq.com