跳到正文
Anthropic Research·· 2026-08-16AI 评分52

Anthropic 与 AE Studio 提出 GRAM,为模型双用途知识加装可移除开关

Jul 8, 2026 Alignment An off switch for dual-use knowledge in AI models

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

Anthropic 与 AE Studio 合作提出 GRAM(Gradient-Routed Auxiliary Modules)方法,在 Transformer 每层加入按双用途类别分组的额外神经元,训练中遇到该类文本时只更新对应模块、冻结通用权重,删除模块即可移除相应能力。

来源:Anthropic Research · anthropic.com