Hugging Face Blog·· 2026-06-12精选AI 评分61
AllenAI 开源 olmo-eval 模型开发评测工作台
olmo-eval: An evaluation workbench for the model development loop
AI 导读
AllenAI 发布 olmo-eval,一个面向模型开发循环的开源评测工作台,在其 OLMES 评测标准基础上扩展。它把任务、套件与 harness 解耦,支持智能体与多轮评测,并可按需选择直接运行或容器沙箱执行,以控制成本。除整体分数外,它还给出标准误和最小可检测效应,并能将两个模型 checkpoint 逐题对齐比较,以区分真实改进与噪声。代码已在 GitHub 开放。
推荐理由
它把评测从一次性跑分挪进持续训练循环,逐题对比 checkpoint 能看出被平均分掩盖的真实变化。
来源:Hugging Face Blog · huggingface.co