跳到正文
原文
Hugging Face Daily Papers·· 2 天前AI 评分35

泛化即稳定性而非准确性:LLM 的多轴评估

Generalization Is Stability, Not Accuracy: Multi-Axis Evaluation of LLMs

AI 导读

一项研究提出以稳定性为核心的泛化评估框架 SAGO,在单样本层面、多输入变体及多行为维度上衡量 LLM 对同一输入的行为变化,而非仅看基准准确率。结果显示,许多常用模型存在统计显著的泛化不稳定:没有模型能均匀泛化,行为轴捕捉到独立失败模式,跨数据集变化甚至可能逆转模型排名。该论文已被 NeurIPS 2026 的 TAE 研讨会接收。

来源:Hugging Face Daily Papers · arxiv.org