快手可灵提出VLM-as-Teacher:用测试时在线优化,让视频生成模型学会按规则推理
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
城大与快手可灵提出 VLM-as-Teacher,让 VLM 不再先写答案,而是在测试时充当老师,自动生成 final-goal 查询和若干 process 查询,把 VLM 回答 Yes 的概率转成可微 VQA reward,再通过在线测试时优化只更新 VGM Reasoner 的轻量 LoRA 模块,冻结 VGM 主干和 VLM Teacher。
来源:量子位 · 微信公众号 · mp.weixin.qq.com