Hugging Face Daily Papers·· 2 天前AI 评分55
arXiv 论文:多智能体系统潜空间通信的安全风险与修复
Safety of Latent Communication in Multi-Agent Systems
AI 导读
研究显示,多智能体系统的潜空间通信即使良性训练链接也会提高有害顺从度,而智能体本身的安全对齐未被改动。攻击者可通过在有害查询-响应对上优化链接、投毒训练数据或强化学习攻击放大该效应,在三种通信拓扑和四个安全基准上将平均有害顺从分从 27.9 提至 76.9;把奖励调整为更安全行为可修复被攻陷的链接,无需更新智能体。
来源:Hugging Face Daily Papers · arxiv.org