Anthropic 与 AE Studio 提出 GRAM,为模型双用途知识加装可移除开关
Jul 8, 2026 Alignment An off switch for dual-use knowledge in AI models
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
Anthropic 与 AE Studio 合作提出 GRAM(Gradient-Routed Auxiliary Modules)方法,在 Transformer 每层加入按双用途类别分组的额外神经元,训练中遇到该类文本时只更新对应模块、冻结通用权重,删除模块即可移除相应能力。
来源:Anthropic Research · anthropic.com