SciCode-Verified:基准缺陷如何低估了 LLM 科学编程能力
SciCode-Verified: How Benchmark Defects Underestimated LLM Scientific-Coding
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
SciCode-Verified 指出 SciCode 基准存在缺陷,导致 LLM 的科学编程能力被低估。该工作针对基准本身的问题展开分析,而非发布新模型或新工具。
来源:arxiv.org(经 Hacker News) · arxiv.org