跳到正文
原文
Hugging Face Daily Papers·· 2 天前AI 评分55

arXiv 论文:多智能体系统潜空间通信的安全风险与修复

Safety of Latent Communication in Multi-Agent Systems

AI 导读

研究显示,多智能体系统的潜空间通信即使良性训练链接也会提高有害顺从度,而智能体本身的安全对齐未被改动。攻击者可通过在有害查询-响应对上优化链接、投毒训练数据或强化学习攻击放大该效应,在三种通信拓扑和四个安全基准上将平均有害顺从分从 27.9 提至 76.9;把奖励调整为更安全行为可修复被攻陷的链接,无需更新智能体。

来源:Hugging Face Daily Papers · arxiv.org