跳到正文
Hugging Face Daily Papers·· 2026-09-03AI 评分53

AgentJudgeBench:评估智能体工具调用中 LLM 裁判可靠性的多难度基准

AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

论文提出 AgentJudgeBench,称其为首个系统研究 LLM-as-a-judge 在智能体工具调用工作流 DAG 上可靠性的基准,包含 3,808 个实例、六种 DAG 拓扑和三个难度层级,用五个生成模型与六个裁判模型在有无真值条件下配对评测。

来源:Hugging Face Daily Papers · arxiv.org