跳到正文
Factory 研究 / 产品·· 2026-04-29精选AI 评分69

Factory 评测 13 个模型的代码评审能力与成本,GPT-5.2 综合最优

Which Model Reviews Code Best?

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

Factory 用 50 个真实 PR、统一提示词和 LLM judge 评测 13 个模型的代码评审表现,GPT-5.2 以 60.5% F1、$1.25/PR 排第一,Opus 4.6 达 59.8% 但需 $3.11/PR。

推荐理由

原文给出 13 个模型在 50 个真实 PR 上的 F1 与成本数据,读者可以据此为自己的代码评审挑选性价比模型。

来源:Factory 研究 / 产品 · factory.com