每次成功的 GPT-Red 攻击都会成为防御方的训练数据
Every successful GPT-Red attack becomes defender training data
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
针对 GPT-Red 的攻击,每一次成功得手都会转化为防御方的训练数据。该机制将攻击样本直接用于防御模型训练,使攻击成功本身成为防御能力提升的来源。
来源:@openai · X · x.com
Every successful GPT-Red attack becomes defender training data
本站未展示全文,请前往来源网站阅读。
针对 GPT-Red 的攻击,每一次成功得手都会转化为防御方的训练数据。该机制将攻击样本直接用于防御模型训练,使攻击成功本身成为防御能力提升的来源。
来源:@openai · X · x.com