CheckerBench:长程智能体能否合成静态分析检查器?
CheckerBench: Can Long-Horizon Agents Synthesize Static-Analysis Checkers?
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究者推出 CheckerBench,一个由 297 个 CVE 衍生出 300 项任务的可执行基准,覆盖 167 个代码仓库、85 个 CWE 和五种语言生态,用于评估智能体能否从零完成静态分析检查器的开发。
来源:Hugging Face Daily Papers · arxiv.org