ClawBench 测评:Claude、GPT、Gemini 真实网站任务完成率最高仅 33%
33%!Claude、GPT、Gemini 在真实网站上集体翻车,ClawBench 把 AI agent 打回原形
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
ClawBench 让 AI agent 在 144 个真实生产网站执行 153 个日常写操作任务,最强 Claude Sonnet 4.6 完成率约 33%,GPT-5.4 仅 6.5%。153 个任务中有 68 个(44.4%)没有任何模型能完成,失败集中在反爬验证、登录卡关和已到确认页却未提交。Qwen 3.5 以 26.1% 排名第二,GLM-5 为 24.2%。
来源:机器之心 · 微信公众号 · mp.weixin.qq.com