LoHi:重新思考长视频效率,联合分配帧、像素与前端延迟
Rethinking Long-Video Efficiency: A Joint Allocation Perspective on Frames, Pixels, and Front-End Latency
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究提出免训练单遍框架 LoHi,将密集低分辨率视频流与稀疏高分辨率图像帧通过 VLM 原生视频和图像通路结合,LoHi-Anchor 用编解码 I-frame 元数据选帧,LoHi-SemDiv 基于 CLIP 特征做查询相关性与视觉多样性选帧。
来源:Hugging Face Daily Papers · arxiv.org