AI 导读
做 Agent 必须照做的 4 条铁律:给目标的同时要写清边界,明确禁止越权、不确定时必须中断问人;别把思维链当安全阀,要看真实的工具调用、出网记录和系统文件改动;发邮件、调敏感 API、改生产数据库等权限一律加人工确认锁;别把整篇原文塞进模型上下文,只记防御动作即可。
正文
读懂首席科学家这篇长文,
落到我们日常做 Agent 上的 4 条生死铁律(必须照做):
1. 别只给目标,必须补边界:完成任务不等于懂你的原则,明确写入禁止越权、不确定时必须中断问人;
2. 别把思维链当安全阀:不要看它在回复里说得多么天花乱坠,看真实的工具调用、出网记录和系统文件改动;
3. 权限按「它会越权」来防:发邮件、调敏感 API、改生产数据库,永远加上人工确认锁;
4. 别把整篇原文塞进你的模型上下文:通篇是宏观世界观与政策喊话,硬塞只会让你的 Agent 染上空谈哲学的恶习,记住上面的防御动作就够了。
来源:@AYi_AInotes · x.com