Factory 评测 13 个模型的代码评审能力与成本,GPT-5.2 综合最优
Which Model Reviews Code Best?
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
Factory 用 50 个真实 PR、统一提示词和 LLM judge 评测 13 个模型的代码评审表现,GPT-5.2 以 60.5% F1、$1.25/PR 排第一,Opus 4.6 达 59.8% 但需 $3.11/PR。
推荐理由
原文给出 13 个模型在 50 个真实 PR 上的 F1 与成本数据,读者可以据此为自己的代码评审挑选性价比模型。
来源:Factory 研究 / 产品 · factory.com