斯坦福 LLM-as-a-Verifier 框架让 DeepSeek V4 Flash 在 Terminal-Bench 2.1 反超 Claude Fable 5
「自验证」框架让开源模型反超 Fable 5,冲上 GitHub 热榜
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
斯坦福团队提出无需额外训练的通用验证框架 LLM-as-a-Verifier,让 DeepSeek V4 Flash 对同一任务生成 5 条候选 Agent 轨迹。
来源:机器之心 · 微信公众号 · mp.weixin.qq.com