SAEScientist-Bench:AI 智能体能否自主开展 SAE 可解释性研究?
SAEScientist-Bench: Can AI Agents Conduct Autonomous SAE Interpretability Research?
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究者提出 SAEScientist-Bench,用于评估 AI 智能体能否像科学家一样使用 SAE 工具自主完成机制可解释性发现。任务要求智能体在 Gemma-2-9B-IT 的 Gemma Scope 词典中检索 131K+ 特征,并与 Neuronpedia 上的专家参考特征对比激活排名、对比文本上的概念选择性和因果引导效果。
来源:Hugging Face Daily Papers · arxiv.org