Hugging Face Blog·· 2026-09-02AI 评分52
Allen AI 发布 BenchMIRT:在题目层面审计 LLM 基准实际测量的能力
BenchMIRT: What are LLM benchmarks actually measuring?
AI 导读
Allen AI 发布 BenchMIRT,一种基于多维 IRT 的方法,用于在单个题目层面审计 LLM 基准实际测量的能力。方法基于 100 个 LLM 在 16 个基准、超 34K 题目上的结果训练,未事先告知标签即独立恢复出安全与通用推理两个维度;分析发现 BBQ 和 WMDP 与通用推理的关联强于安全,HarmBench 的版权题也更接近推理。
来源:Hugging Face Blog · huggingface.co