跳到正文
Hugging Face Daily Papers·· 7 天前AI 评分52

PlaylistEval:视频语言裁判在日长视频中还能被信任吗

PlaylistEval: Can Video-Language Judges Be Trusted at Day Scale and Beyond?

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究提出 PlaylistEval,一个无需人工标注、基于 100 小时播放列表自动构建视频语言裁判基准的智能体框架,覆盖七个领域共 630 对问答,在 152 对分层子集上与人类判断一致率为 93.0%(IAA 0.781)。

来源:Hugging Face Daily Papers · arxiv.org