跳到正文
Hugging Face Daily Papers·· 1 天前AI 评分37

OmniCapBench:面向细粒度音视频描述评测的深度结构化框架

OmniCapBench: A Deep-Structured Evaluation Framework for Fine-Grained Audio-Visual Captioning

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

OmniCapBench 是一个将音视频描述评测重构为深度结构化诊断的基准,把预测目标从自由文本改为实体引用、视觉镜头和音频事件三类原子化可验证评测单元,包含 786 段密集标注视频,结合确定性约束检查与局部 LLM 语义比较。评测显示前沿 MLLM 局部感知强但长时序音视频推理弱,尤其在身份漂移和跨模态错位上表现不佳。该工作已被 NeurIPS 2026 接收。

来源:Hugging Face Daily Papers · arxiv.org