中科大与上海AI Lab提出视觉预训练新范式,让模型直接从文档图像学科学推理
只读文本的AI,科学推理能力只有“看图”AI的1/3丨中科大
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
中科大与上海人工智能实验室联合团队提出视觉预训练(VP)范式,在连续视觉表征空间中预测下一个视觉单元,让模型直接从图文交织的文档页面学习。实验显示,VP仅用约200亿视觉Token(约为解析文本800亿Token的四分之一),便在MMLU-Pro、GPQA Diamond等基准上全面优于纯文本预训练,且优势随训练量增加持续扩大。
来源:量子位 · 微信公众号 · mp.weixin.qq.com