指令遵循媲美Seedance 2.0,复旦腾讯联合提出Baton,多说话人场景M-WER暴降76%
指令遵循媲美Seedance 2.0!复旦腾讯联合提出Baton,多说话人场景M-WER暴降76%
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
复旦与腾讯混元团队提出 Baton,一个基于显式语义蓝图引导的联合视频音频生成框架,先用可学习 MLLM 完成跨模态语义规划,再把 planned tokens 注入扩散模型指导生成。
来源:量子位 · 微信公众号 · mp.weixin.qq.com