ElephantBench:探测 LLM 在长尾分歧知识下的认知短视
Blind Men and the Elephant: Probing the Epistemic Myopia of LLMs under Long-Tail Divergent Knowledge
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究者提出 ElephantBench,一个包含 1,094 道题目的闭卷知识探针,通过可审计的图流程从低曝光网络语料中挖掘自然分歧并转为多答案 QA 记录。在 32 个模型上,最强模型也仅在 52.4% 的题目上同时召回两种说法,其余题目几乎都只答出一种而遗漏另一种。扩大模型规模和增加推理时推理可提升召回,但无法消除这种不完整性。
来源:Hugging Face Daily Papers · arxiv.org