跳到正文
Hugging Face Daily Papers·· 2 天前AI 评分38

CheckerBench:长程智能体能否合成静态分析检查器?

CheckerBench: Can Long-Horizon Agents Synthesize Static-Analysis Checkers?

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究者推出 CheckerBench,一个由 297 个 CVE 衍生出 300 项任务的可执行基准,覆盖 167 个代码仓库、85 个 CWE 和五种语言生态,用于评估智能体能否从零完成静态分析检查器的开发。

来源:Hugging Face Daily Papers · arxiv.org