跳到正文
github.com(经 Hacker News)·· 2026-07-09AI 评分26

针对伪装 MCP 攻击的 LLM 智能体拒绝训练

Refusal training for LLM agents against disguised MCP attacks

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

一项研究提出用拒绝训练让 LLM 智能体抵御伪装成正常调用的 MCP 攻击。该工作聚焦 MCP 场景下智能体被诱导执行恶意操作的风险,通过训练使模型学会拒绝此类伪装请求。

来源:github.com(经 Hacker News) · github.com