跳到正文
热点事件持续更新

VA-Bench评测揭示大模型空间智能执行断层

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

2026年10月5日,机器之心报道,VA-Bench以“观察—推理—行动—修正”闭环测试12个多模态模型的空间智能。结果显示,模型在目标识别与定位(TL)上达到100%,操作语义理解(MS)达99.6%—100%,但完整任务成功率仅约一半,其中Qwen3.8-max为53.93%、Opus-5为52.86%、GPT-5.6-sol为51.55%。报道指出,这暴露出多模态大模型“看懂不等于做对”的执行断层。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. 机器之心
    VA-Bench 测出多模态大模型空间智能的执行断层:看懂不等于做对

    机器之心报道,VA-Bench 以"观察—推理—行动—修正"闭环测试 12 个多模态模型,目标识别与定位(TL)达 100%、操作语义理解(MS)达 99.6%—100%,但完整任务成功率仅约一半,Qwen3.8-max、Opus-5、GPT-5.6-sol 分别为 53.93%、52.86%、51.55%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。