跳到正文
Hugging Face Daily Papers·· 25 天前AI 评分39

超越求解器判定:面向自动形式化的生成式奖励模型

Beyond Solver Verdicts: Generative Reward Models for Autoformalization

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究提出 Verdict-Preserving-Unfaithfulness(VPU)失效模式:错误形式化编码仍能通过求解器验证并得到预期判定,并证明仅凭判定的结构化验证启发式检测能力在数学上被限制在随机水平。

来源:Hugging Face Daily Papers · arxiv.org