跳到正文
原文
Hugging Face Blog·· 2026-06-12精选AI 评分61

AllenAI 开源 olmo-eval 模型开发评测工作台

olmo-eval: An evaluation workbench for the model development loop

AI 导读

AllenAI 发布 olmo-eval,一个面向模型开发循环的开源评测工作台,在其 OLMES 评测标准基础上扩展。它把任务、套件与 harness 解耦,支持智能体与多轮评测,并可按需选择直接运行或容器沙箱执行,以控制成本。除整体分数外,它还给出标准误和最小可检测效应,并能将两个模型 checkpoint 逐题对齐比较,以区分真实改进与噪声。代码已在 GitHub 开放。

推荐理由

它把评测从一次性跑分挪进持续训练循环,逐题对比 checkpoint 能看出被平均分掩盖的真实变化。

来源:Hugging Face Blog · huggingface.co