跳到正文
ByteDance Seed Papers· Qifeng Zhang, Kaixiang Huang, Heng Dong, Huang Fang, Junting Chen, Junjie Zhu, Yonghang Chen, Zhiyu Zhang, Wei Li·· 2026-08-06AI 评分43

GST-Bench:VLM 能否从视频中发展出全局空间感知?

GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

字节跳动 Seed 提出 GST-Bench,一个面向视频全局空间智能的 VQA 基准,题目由 6790 分钟合成视频生成并经人工核验,要求模型从视频中未出现的新视角做空间推理,并将第一人称观测映射到全局俯视图。

来源:ByteDance Seed Papers · arxiv.org