跳到正文
原文
Hugging Face Daily Papers·· 2 天前AI 评分38

Align Then Reason:面向配音的多模态唇形同步评判模型

Align Then Reason: A Multimodal Lip-Sync Judge for Dubbing

AI 导读

研究者提出多模态唇形同步评判模型 Align Then Reason(ATR),先在帧级唇部表征与候选台词的音素单元间建立单调对齐,再基于对齐结果推理内容与时间是否匹配。

来源:Hugging Face Daily Papers · arxiv.org