跳到正文
机器之心 · 微信公众号·· 2026-08-27AI 评分72

斯坦福 LLM-as-a-Verifier 框架让 DeepSeek V4 Flash 在 Terminal-Bench 2.1 反超 Claude Fable 5

「自验证」框架让开源模型反超 Fable 5,冲上 GitHub 热榜

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

斯坦福团队提出无需额外训练的通用验证框架 LLM-as-a-Verifier,让 DeepSeek V4 Flash 对同一任务生成 5 条候选 Agent 轨迹。

来源:机器之心 · 微信公众号 · mp.weixin.qq.com