Redwood Research 论文测算前沿模型无 CoT 任务完成时间跨度
Estimating No-CoT Task-Completion Time Horizons of Frontier AI Models
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
Redwood Research 等机构在新论文中测量 14 个前沿模型(GPT-2 至 GPT-5.5)在 43 个基准上无任何思维链完成任务的能力。GPT-5.5 的 50% 无 CoT 时间跨度约为人类 3 分钟,自 2019 年起约每年翻倍(373 天),远慢于 METR 报告的有 CoT 时间跨度 182 天翻倍的速度。
来源:Redwood Research Blog · blog.redwoodresearch.org