AgentJudgeBench:评估智能体工具调用中 LLM 裁判可靠性的多难度基准
AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
论文提出 AgentJudgeBench,称其为首个系统研究 LLM-as-a-judge 在智能体工具调用工作流 DAG 上可靠性的基准,包含 3,808 个实例、六种 DAG 拓扑和三个难度层级,用五个生成模型与六个裁判模型在有无真值条件下配对评测。
来源:Hugging Face Daily Papers · arxiv.org