跳到正文
AI前线 · 微信公众号·· 2026-07-06AI 评分62

Karpathy 700 次 Loop 实验揭示 Agent 最大误区:性能提升多来自 Harness

76%的性能提升与模型无关?Karpathy 700次 Loop 实验揭开 Agent 最大误区

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

Hugging Face 工程师 Joel Niklaus 的实验显示,冻结 DeepSeek-V4-Pro 权重、只优化模型外层执行机制 Harness,同一模型在不同 Harness 下的 pooled score 在 3.5% 到 80.1% 之间波动。

来源:AI前线 · 微信公众号 · mp.weixin.qq.com