跳到正文
Hugging Face Daily Papers·· 2026-08-21AI 评分40

VA-Judger:面向联合视频-音频生成的人类偏好奖励模型

VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

针对现有奖励指标分开评估音频、视觉与同步性、易被 reward hacking 的问题,研究者构建了 VAPref-10K 人类偏好数据集(9K 提示词、10.3K 细粒度成对比较)与 VA-Judger-Bench 基准,并提出链式思维全模态奖励模型 VA-Judger。

来源:Hugging Face Daily Papers · arxiv.org