跳到正文
热点事件观察中

研究称长周期AI任务表现远逊人类

1 篇报道1 个报道来源2 天前更新

先了解这件事

AI 综述

2026年10月2日,一项针对长周期决策任务的测试结果公布:包括 GPT-5.6 Sol 和 Claude Opus 4.8 在内的八款领先模型表现均远逊于人类。报道称,表现最好的 Qwen3.7-Max 搭配 Hermes 最终仅获得人类平均参与者 27.3% 的收益。研究者据此认为,仅达人类四分之一水平的系统远不足以可靠执行长周期任务。目前该测试的具体任务设置、参与者规模等细节尚未在报道中披露,事件仍处于该结果公布后的讨论阶段。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. X:Rohan Paul
    长周期任务测试:AI 智能体表现远逊人类

    一项针对长周期决策任务的测试显示,包括 GPT-5.6 Sol 和 Claude Opus 4.8 在内的八款领先模型表现均远逊于人类。表现最好的 Qwen3.7-Max 搭配 Hermes 最终仅获得人类平均参与者 27.3% 的收益。研究者认为,仅达人类四分之一水平的系统远不足以可靠执行长周期任务。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。