跳到正文
原文
Hugging Face Blog·· 2026-06-18精选AI 评分69

Hugging Face 发布 agent-eval,评测开放模型在自有工具上的智能体表现

Is it agentic enough? Benchmarking open models on your own tooling

AI 导读

Hugging Face 发布开源评测工具 agent-eval,用于衡量开放模型驱动智能体使用某个库完成任务时的过程成本,而不只看最终答案。

推荐理由

这篇评测以 transformers 为样本,把智能体完成任务的过程成本拆成可量化指标,方法可迁移到其他库。

来源:Hugging Face Blog · huggingface.co