PlaylistEval:视频语言裁判在日长视频中还能被信任吗
PlaylistEval: Can Video-Language Judges Be Trusted at Day Scale and Beyond?
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究提出 PlaylistEval,一个无需人工标注、基于 100 小时播放列表自动构建视频语言裁判基准的智能体框架,覆盖七个领域共 630 对问答,在 152 对分层子集上与人类判断一致率为 93.0%(IAA 0.781)。
来源:Hugging Face Daily Papers · arxiv.org