跳到正文
Hugging Face Daily Papers·· 1 天前AI 评分42

VeriFine:通过扩展验证实现具身推理的自我改进

VeriFine: Scaling Verification for Self-Improvement in Embodied Reasoning

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

VeriFine 是一个 agent harness 框架,通过策略、训练课程与评判器的协同演化来扩展验证能力。其 Policy Improvement Loop 用评分标准评判器诊断反复出现的失败并构建自适应课程,当验证成为瓶颈时,Judge Improvement Loop 针对信息量高的失败案例选择性引入人工指导,通过协同校准优化评判器。

来源:Hugging Face Daily Papers · arxiv.org