ExecRetrieval:衡量代码嵌入检索中的功能正确性差距
ExecRetrieval: Measuring the Functional-Correctness Gap in Code-Embedding Retrieval
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
论文提出 ExecRetrieval 代码检索基准,包含 939 个 Python 任务,每个任务配有一个经执行验证的规范实现和最多四个执行验证的缺陷干扰项。在评测 23 种稠密嵌入配置与 BM25 后,检索池含近似克隆反事实时头部托管系统的 exec@10 达到 1.00,但 exec@1 仅 0.331。
来源:Hugging Face Daily Papers · arxiv.org