跳到正文
原文
Hugging Face Daily Papers·· 1 天前AI 评分43

视频大模型时序推理为何在输出层“褪色”:TAI 方法无需训练即可增强时序表征

Before It Fades: Reinforcing Temporal Representations at Inference Time in VideoLLMs

AI 导读

视频大语言模型(VideoLLMs)的时序推理能力在中间层达到峰值,却随层数加深逐渐衰减至输出层,导致反转帧序后预测结果往往不变。研究者据此提出 Temporal Activation Injection(TAI),在峰值层提取时序表征并注入后续层,无需训练即可在三个 VideoLLM 和四个基准上稳定提升时序推理,且对非时序任务影响极小。该研究已被 NeurIPS 2026 接收。

来源:Hugging Face Daily Papers · arxiv.org