跳到正文
arxiv.org(经 Hacker News)·· 2026-08-07AI 评分29

SciCode-Verified:基准缺陷如何低估了 LLM 科学编程能力

SciCode-Verified: How Benchmark Defects Underestimated LLM Scientific-Coding

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

SciCode-Verified 指出 SciCode 基准存在缺陷,导致 LLM 的科学编程能力被低估。该工作针对基准本身的问题展开分析,而非发布新模型或新工具。

来源:arxiv.org(经 Hacker News) · arxiv.org