机器之心· 机器之心·· 6 小时前AI 评分46
VA-Bench 测出多模态大模型空间智能的执行断层:看懂不等于做对
看懂不等于做对:VA-Bench测出大模型空间智能的执行断层
AI 导读
机器之心报道,VA-Bench 以"观察—推理—行动—修正"闭环测试 12 个多模态模型,目标识别与定位(TL)达 100%、操作语义理解(MS)达 99.6%—100%,但完整任务成功率仅约一半,Qwen3.8-max、Opus-5、GPT-5.6-sol 分别为 53.93%、52.86%、51.55%。
来源:机器之心 · mp.weixin.qq.com