LangChain 推出 ReviewBench:用真实 PR 评审数据评测代码审查智能体
Evaluating code review agents with ReviewBench
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
LangChain 发布 ReviewBench,一个基于 LangSmith 单体仓库真实 PR 评审意见构建的代码审查智能体评测基准,目前包含 59 个任务、覆盖 64 个基线问题,采用 Harbor 任务格式并以 F1 为综合得分。在统一 Deep Agents 基础框架下,最强模型仅能找回约 30% 的基线问题;对 Luna 改用高推理强度与结构化评审提示词后,其表现出现变化。
来源:LangChain Blog · langchain.com