热点事件观察中
研究称长周期AI任务表现远逊人类
1 篇报道1 个报道来源2 天前更新
先了解这件事
AI 综述
2026年10月2日,一项针对长周期决策任务的测试结果公布:包括 GPT-5.6 Sol 和 Claude Opus 4.8 在内的八款领先模型表现均远逊于人类。报道称,表现最好的 Qwen3.7-Max 搭配 Hermes 最终仅获得人类平均参与者 27.3% 的收益。研究者据此认为,仅达人类四分之一水平的系统远不足以可靠执行长周期任务。目前该测试的具体任务设置、参与者规模等细节尚未在报道中披露,事件仍处于该结果公布后的讨论阶段。
AI 根据报道生成 · 2 小时前更新
最新进展10月2日 10:16
测试显示八款领先模型长周期任务表现远逊人类,最佳组合收益仅人类27.3%。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- X:Rohan Paul长周期任务测试:AI 智能体表现远逊人类
一项针对长周期决策任务的测试显示,包括 GPT-5.6 Sol 和 Claude Opus 4.8 在内的八款领先模型表现均远逊于人类。表现最好的 Qwen3.7-Max 搭配 Hermes 最终仅获得人类平均参与者 27.3% 的收益。研究者认为,仅达人类四分之一水平的系统远不足以可靠执行长周期任务。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。