Hugging Face Daily Papers·· 2 天前AI 评分38
Align Then Reason:面向配音的多模态唇形同步评判模型
Align Then Reason: A Multimodal Lip-Sync Judge for Dubbing
AI 导读
研究者提出多模态唇形同步评判模型 Align Then Reason(ATR),先在帧级唇部表征与候选台词的音素单元间建立单调对齐,再基于对齐结果推理内容与时间是否匹配。
来源:Hugging Face Daily Papers · arxiv.org