Hugging Face Daily Papers·· 1 天前AI 评分43
视频大模型时序推理为何在输出层“褪色”:TAI 方法无需训练即可增强时序表征
Before It Fades: Reinforcing Temporal Representations at Inference Time in VideoLLMs
AI 导读
视频大语言模型(VideoLLMs)的时序推理能力在中间层达到峰值,却随层数加深逐渐衰减至输出层,导致反转帧序后预测结果往往不变。研究者据此提出 Temporal Activation Injection(TAI),在峰值层提取时序表征并注入后续层,无需训练即可在三个 VideoLLM 和四个基准上稳定提升时序推理,且对非时序任务影响极小。该研究已被 NeurIPS 2026 接收。
来源:Hugging Face Daily Papers · arxiv.org