RealSWE:真实用户请求下的编码智能体组合式评测基准
RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
RealSWE 提出由 SWE-bench Verified 与 Pro 衍生的 381 个多变量任务族,用于评测真实用户请求风格下的编码智能体。对真实提示词与基准问题的对比显示,只含问题陈述的请求占真实提示词的 88%,在基准问题中仅占 7%;87% 的真实提示词为随意书写,而 94% 的基准问题为正式书写。
来源:Hugging Face Daily Papers · arxiv.org