跳到正文
Hugging Face Daily Papers·· 1 天前AI 评分38

TestPrism:重新思考超越单一参考解的测试评估

TestPrism: Rethinking Test Evaluation Beyond a Single Reference

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

LLM 编程智能体的测试生成通常只对照单一参考解评估,会高估测试质量。TestPrism 包含来自 17 个来源的 300 个测试任务和 3000 个候选实现,其 Joint Success Function 指标要求测试在初始程序状态失败、接受所有有效实现并拒绝所有无效实现,14 种基线配置下仅达 28.00%,而单一参考解成功率高达 59.67%。

来源:Hugging Face Daily Papers · arxiv.org