Hugging Face Daily Papers·· 2 天前AI 评分39
LEAP:面向长音视频感知的学习式分块证据检索框架
LEAP: Learned Block-wise Evidence Retrieval for Long Audio-Video Perception
AI 导读
LEAP 通过将录音切分为固定时长块、用轻量定位阶段为每块候选窗口打分,再把高分窗口汇聚后单次有界重编码作答,使答案输入与峰值上下文不随录音时长增长。在多个 AVQA 基准上,LEAP 较 Qwen3-Omni-30B-A3B 基线提升 4.5-16.8%,迁移到 MiniCPM-o 4.5 后超出其已发表结果 3.1-13.0%。
来源:Hugging Face Daily Papers · arxiv.org