跳到正文
原文
LangChain Blog·· 13 天前AI 评分51

LangChain 实测 Jev 作智能体评测器:与 GPT-5.6 Luna、Terra 和 Claude Sonnet 4.6 对比

Jev-as-a-Judge for Agent Evals

AI 导读

LangChain 团队测试了 TypeSafe AI 的 Jev 作为智能体评测器的表现。Jev 是不生成文本的 System One 决策模型,支持 Choice、Score 和布尔三类问题,官方称在分类任务上推理最快达 200 倍、成本最低至 1/400。

来源:LangChain Blog · langchain.com