热点事件持续更新
AgentBug-Smith基准:编码Agent修复自身Bug能力低
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026年10月,Rohan Paul在X上介绍了AgentBug-Smith论文。该研究把真实GitHub bug报告自动转化为可运行测试,构建了含200个可复现bug且持续增长的Live-Harness-Bench基准。结果显示,最好的编码智能体只能修复其中9%的此类bug,远低于常规软件bug约40%的修复水平。论文还尝试用过往修复经验提炼的简短指南来提升表现:加入指南后,一个智能体在79个未见bug上的正确修复数从1个提升到6个。目前该基准仍在持续增长,相关能力提升手段的效果仍有限。
AI 根据报道生成 · 1 小时前更新
最新进展10月3日 12:31
AgentBug-Smith论文显示,最佳编码智能体仅能修复9%的智能体框架真实bug。报道时间线
沿着报道,了解事件的不同侧面。
10月3日
- X:Rohan PaulAgentBug-Smith 论文:编码智能体仅能修复 9% 的智能体框架真实 bug
论文提出 AgentBug-Smith,把真实 GitHub bug 报告自动转化为可运行测试,构建含 200 个可复现 bug 且持续增长的 Live-Harness-Bench。最好的编码智能体只修复 9% 的此类 bug,远低于常规软件 bug 约 40% 的水平;用过往修复经验提炼的简短指南后,一个智能体在 79 个未见 bug 上的正确修复从 1 个升到 6 个。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。