跳到正文
原文
Hugging Face Daily Papers·· 2 天前AI 评分39

LEAP:面向长音视频感知的学习式分块证据检索框架

LEAP: Learned Block-wise Evidence Retrieval for Long Audio-Video Perception

AI 导读

LEAP 通过将录音切分为固定时长块、用轻量定位阶段为每块候选窗口打分,再把高分窗口汇聚后单次有界重编码作答,使答案输入与峰值上下文不随录音时长增长。在多个 AVQA 基准上,LEAP 较 Qwen3-Omni-30B-A3B 基线提升 4.5-16.8%,迁移到 MiniCPM-o 4.5 后超出其已发表结果 3.1-13.0%。

来源:Hugging Face Daily Papers · arxiv.org