热点事件持续更新
VA-Bench评测揭示大模型空间智能执行断层
1 篇报道1 个报道来源5 小时前更新
先了解这件事
AI 综述
2026年10月5日,机器之心报道,VA-Bench以“观察—推理—行动—修正”闭环测试12个多模态模型的空间智能。结果显示,模型在目标识别与定位(TL)上达到100%,操作语义理解(MS)达99.6%—100%,但完整任务成功率仅约一半,其中Qwen3.8-max为53.93%、Opus-5为52.86%、GPT-5.6-sol为51.55%。报道指出,这暴露出多模态大模型“看懂不等于做对”的执行断层。
AI 根据报道生成 · 1 小时前更新
最新进展10月5日 11:43
VA-Bench测试显示多模态模型理解强但执行弱,完整任务成功率仅约一半。报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- 机器之心VA-Bench 测出多模态大模型空间智能的执行断层:看懂不等于做对
机器之心报道,VA-Bench 以"观察—推理—行动—修正"闭环测试 12 个多模态模型,目标识别与定位(TL)达 100%、操作语义理解(MS)达 99.6%—100%,但完整任务成功率仅约一半,Qwen3.8-max、Opus-5、GPT-5.6-sol 分别为 53.93%、52.86%、51.55%。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。