VA-Judger:面向联合视频-音频生成的人类偏好奖励模型
VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
针对现有奖励指标分开评估音频、视觉与同步性、易被 reward hacking 的问题,研究者构建了 VAPref-10K 人类偏好数据集(9K 提示词、10.3K 细粒度成对比较)与 VA-Judger-Bench 基准,并提出链式思维全模态奖励模型 VA-Judger。
来源:Hugging Face Daily Papers · arxiv.org