跳到正文
Apple Machine Learning Research·· 2026-08-24AI 评分29

超越 Visual CoT:面向主动视频推理的内部化视觉思考

Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究提出 Internalized Visual Thinking(IVT)后训练框架,通过联合优化文本预测与视觉思考,让多模态大模型在训练阶段学会视觉推理、推理时直接输出结果,从而规避 Visual CoT 生成中间推理图像带来的推理开销,尤其针对主动视频推理场景。

来源:Apple Machine Learning Research · machinelearning.apple.com