Anthropic 论文提出 NLA,隐藏动机发现率提升 4 倍以上
Anthropic最新论文撬开大模型黑箱:隐藏动机发现率提升 4 倍以上
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
Anthropic 发布论文《Natural Language Autoencoders Produce Unsupervised Explanations of LLM Activations》,提出自然语言自动编码器 NLA,把模型内部高维激活值压缩成自然语言解释,再由这段文字反向重建原始激活,形成回环验证。
来源:AI前线 · 微信公众号 · mp.weixin.qq.com