跳到正文
Hugging Face Daily Papers·· 2026-08-31AI 评分34

视频中定位一切:重新思考高效生成式时空视频定位

Locate Anything in Videos: Rethinking Efficient Generative Spatio-Temporal Video Grounding

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究提出 Parallel Tube Decoding(PTD),将时空视频定位分解为一个时间块加多个时间条件空间块并行解码,把顺序解码深度固定为 1+1 轮,与 tube 长度无关。

来源:Hugging Face Daily Papers · arxiv.org