跳到正文
Hugging Face Daily Papers·· 5 天前AI 评分46

VeriHarness:为长时程任务扩展智能体验证能力

VeriHarness: Scaling Agentic Verification for Long-Horizon Tasks

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

VeriHarness 将生成用的 LLM 变为智能体验证器,通过工作区、证据工具和可复用验证技能,对多次采样结果做分歧消解与共识挑战。在五个长时程工作区基准和两个前沿模型上,它取得最高选择分数,证据支撑的修订让 Gemini 3.5 Flash 和 Claude Opus 4.8 相比单次 rollout 分别提升 6.2 和 6.4 分。

来源:Hugging Face Daily Papers · arxiv.org