跳到正文
Hugging Face Daily Papers·· 2026-09-03AI 评分51

RealSWE:真实用户请求下的编码智能体组合式评测基准

RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

RealSWE 提出由 SWE-bench Verified 与 Pro 衍生的 381 个多变量任务族,用于评测真实用户请求风格下的编码智能体。对真实提示词与基准问题的对比显示,只含问题陈述的请求占真实提示词的 88%,在基准问题中仅占 7%;87% 的真实提示词为随意书写,而 94% 的基准问题为正式书写。

来源:Hugging Face Daily Papers · arxiv.org