视频中定位一切:重新思考高效生成式时空视频定位
Locate Anything in Videos: Rethinking Efficient Generative Spatio-Temporal Video Grounding
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究提出 Parallel Tube Decoding(PTD),将时空视频定位分解为一个时间块加多个时间条件空间块并行解码,把顺序解码深度固定为 1+1 轮,与 tube 长度无关。
来源:Hugging Face Daily Papers · arxiv.org