超越 Visual CoT:面向主动视频推理的内部化视觉思考
Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究提出 Internalized Visual Thinking(IVT)后训练框架,通过联合优化文本预测与视觉思考,让多模态大模型在训练阶段学会视觉推理、推理时直接输出结果,从而规避 Visual CoT 生成中间推理图像带来的推理开销,尤其针对主动视频推理场景。
来源:Apple Machine Learning Research · machinelearning.apple.com