论文披露从专有 LLM API 回放加密推理链的攻击方法
Stealing Reasoning Traces from Proprietary LLM APIs
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
有论文发现,Anthropic、OpenAI 和 Google 返回给客户端的加密思维链块可跨会话、用户和模型回放。研究者把前沿模型的轨迹回放进较弱的同族模型并越狱,以明文还原强模型的隐藏推理;论文称同族模型共用同一加密密钥,Claude Haiku 4.5 最易被攻击。各厂商在收到报告后已无法复现同类攻击,论文还披露了一种把数据外泄想法写进推理链的提示词注入变体。
来源:Simon Willison · simonwillison.net