跳到正文
热点事件持续更新

AgentBug-Smith基准:编码Agent修复自身Bug能力低

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月,Rohan Paul在X上介绍了AgentBug-Smith论文。该研究把真实GitHub bug报告自动转化为可运行测试,构建了含200个可复现bug且持续增长的Live-Harness-Bench基准。结果显示,最好的编码智能体只能修复其中9%的此类bug,远低于常规软件bug约40%的修复水平。论文还尝试用过往修复经验提炼的简短指南来提升表现:加入指南后,一个智能体在79个未见bug上的正确修复数从1个提升到6个。目前该基准仍在持续增长,相关能力提升手段的效果仍有限。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月3日
  1. X:Rohan Paul
    AgentBug-Smith 论文:编码智能体仅能修复 9% 的智能体框架真实 bug

    论文提出 AgentBug-Smith,把真实 GitHub bug 报告自动转化为可运行测试,构建含 200 个可复现 bug 且持续增长的 Live-Harness-Bench。最好的编码智能体只修复 9% 的此类 bug,远低于常规软件 bug 约 40% 的水平;用过往修复经验提炼的简短指南后,一个智能体在 79 个未见 bug 上的正确修复从 1 个升到 6 个。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。