Karpathy 700 次 Loop 实验揭示 Agent 最大误区:性能提升多来自 Harness
76%的性能提升与模型无关?Karpathy 700次 Loop 实验揭开 Agent 最大误区
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
Hugging Face 工程师 Joel Niklaus 的实验显示,冻结 DeepSeek-V4-Pro 权重、只优化模型外层执行机制 Harness,同一模型在不同 Harness 下的 pooled score 在 3.5% 到 80.1% 之间波动。
来源:AI前线 · 微信公众号 · mp.weixin.qq.com