Anthropic 发布一篇评测设计与自动调优的方法论文章,并在 Claude Code 官方技能库上线 build-eval 和 hillclimb 两个指令。
原文把评测集构建与自动爬坡的流程写成可复用指令,读者能据此把提示词调优从靠感觉变成有标尺的迭代。
世界上最顶级的几个 AI 大模型公司官方放出来的深度文章,大家一定要看,
这是 @AnthropicAI 第一次把他们内部是怎么做 Prompt 优化、Agent 评测和自动调优的底层方法论,毫无保留地全盘分享出来了,
同时在 Claude Code 的官方 Skill 里直接上线了两个神级指令:
一个叫 build-eval,一个叫 hillclimb。
一句话概括它干的事:
让 AI 在你的项目代码库里,自动建真实验收测试集,然后自己改代码、自己跑分、自己去重和防过拟合,直到把准确率拉上去、把 Token 账单砍到原来的五分之一。
做过 Agent 和重度提示词的人,应该都懂那种想砸键盘的绝望感:
改了一句 Prompt,这里好像变聪明了,那里又莫名其妙崩了;
或者自己写了几个测试用例自嗨,一上线遇到真实用户直接翻车。
以前我们调优全靠肉眼瞎试和玄学,
现在 Anthropic 直接把这套工业级的自动化调优流水线开源了。
我把这篇万字干货里的核心精髓,拆成三个最值钱的维度给大家讲透:
第一个,什么是真正能打的评测(Eval)?
Anthropic 给出了四条铁律,直接打碎了很多人的认知误区:
1. 别拿今天模型的短板去建题库:
大模型的能力表面是参差不齐的。如果你专门挑它今天答错的题去考它,你测出来的根本不是任务本身的难度,而是这个特定版本的指纹缺陷。下一代模型一出,你的题库全作废。
2. 顶尖模型在最强思考档下,跑分也必须远低于 100 分:
如果你的测试集让最强模型轻松拿满分,说明题目太简单,你根本测不出后续改动到底是变好了还是变差了。
3. 裁判优先用程序,其次才是大模型:
能用代码跑单元测试、校验 JSON Schema 的,坚决不用大模型当裁判;必须用大模型当裁判时,不要打 1 到 5 分这种模糊分数,而是写成可逐条核对的事实验证清单,或者做盲测 A/B 对比。
4. 必须能区分真变好和随机波动:
如果跑分每次都不一样,说明题目有歧义,或者环境残留了上次测试的文件让 AI 抄了近道。
第二个,神级指令 `/claude-api build-eval`
你在终端里敲下这行命令,Claude 会像个资深架构师一样采访你,在你的代码库里现场搭评测系统:
先抽你生产环境的真实对话记录,再翻 Bug 报告和工单,最后才补少量合成数据。
搞定后直接在本地生成一个极简的可视化网页,把每个测试用例、评分理由、调用链路 Trace 摆在你面前,你点个确认,基线就立住了。
第三个,全自动刷分爬坡 `/claude-api hillclimb`
这是整篇文章最炸裂的部分。
有了评测集之后,你只要告诉它你的目标是提高性能还是降低成本,它就会自动把数据切成训练集和测试集,开始自动迭代:
每次只改一个最小补丁,绝不大拆大改;
如果训练集分数涨了,但独立的测试集没动,它立刻判定为过拟合,秒级回滚;
如果改动有退步,立刻撤销重来;
只有训练集和测试集双双上涨,这个改动才会被正式保留下来。
当跑分卡住两三轮不涨的时候,它不会瞎猜,而是停下来把所有失败用例拉个清单做归因分析:到底是指南写漏了,还是裁判自己判错了。
官方在文章里放了两个真实实测战报,数据非常硬核:
第一个案例:客服 Agent 极限降本
原本用 Opus 4.8 跑高思考档,准确率 74.4%,单次成本 4.6 美分。
跑完 hillclimb 后,系统自动帮它删除了冗余的思维链和冲突规则,把模型换成低思考档的 Sonnet 5,
最终在未见过的测试集上,准确率从 78.6% 飙升到了 90.5%,而单次成本直接降到了 1 美分。
准确率大涨的同时,账单直接砍掉了近 80%。
第二个案例:修复 AI 脑子里的旧时代记忆
他们在优化官方 claude-api 技能时,发现评分一直卡在 77 分。
AI 复盘后发现:模型本身其实懂新接口,但由于预训练时期的习惯,总是下意识去写老旧废弃的 API 格式。
于是自动在规则最上方补了一张新旧 API 对照表,准确率瞬间冲到了 88%。
过去我们做 AI 应用,90% 的精力都在当人肉测试员和 Prompt 缝合怪;
现在顶尖大厂的解法是把玄学变成工程:用真实的业务数据立住标尺,剩下的调优和降本,让 AI 坐在工位上自己给自己爬坡。
这套工具已经集成在 Claude Code 的官方技能库里了,终端里装上 claude-api 就能跑。
做 Agent、写提示词、或者被 API 账单卡脖子的兄弟,强烈建议去啃一遍原文。
你们平时在业务里调优 Prompt,最头疼的是改完后测不准,还是跑分很高上线就翻车?评论区交流交流~
Claude can now help you build evaluations and hillclimb on them. In this article, we share guidance on eval design & skills that Claude Code can use to improve your applications. https://t.co/PgKFC2DWth在 X 查看被引用的帖子
来源:@AYi_AInotes · x.com