ByteDance Seed Papers· Qifeng Zhang, Kaixiang Huang, Heng Dong, Huang Fang, Junting Chen, Junjie Zhu, Yonghang Chen, Zhiyu Zhang, Wei Li·· 2026-08-06AI 评分43
GST-Bench:VLM 能否从视频中发展出全局空间感知?
GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
字节跳动 Seed 提出 GST-Bench,一个面向视频全局空间智能的 VQA 基准,题目由 6790 分钟合成视频生成并经人工核验,要求模型从视频中未出现的新视角做空间推理,并将第一人称观测映射到全局俯视图。
来源:ByteDance Seed Papers · arxiv.org