跳到正文
Hugging Face Daily Papers·· 29 天前AI 评分49

研究揭示 LLM 代码修复过度编辑问题:GPT-5.5 等模型高 Pass@1 伴随冗余改动

When Models Edit Too Much: On the Fidelity of Minimal Code Edits

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究构建了基于 400 个 BigCodeBench 问题的评测框架,通过注入 AST 级损坏为每个修复任务提供已知最小补丁,发现 GPT-5.5 等前沿 LLM 普遍存在过度编辑,高 Pass@1 常伴随不必要的大幅改动。

来源:Hugging Face Daily Papers · arxiv.org