跳到正文
Simon Willison·· 2026-08-12AI 评分64

论文披露从专有 LLM API 回放加密推理链的攻击方法

Stealing Reasoning Traces from Proprietary LLM APIs

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

有论文发现,Anthropic、OpenAI 和 Google 返回给客户端的加密思维链块可跨会话、用户和模型回放。研究者把前沿模型的轨迹回放进较弱的同族模型并越狱,以明文还原强模型的隐藏推理;论文称同族模型共用同一加密密钥,Claude Haiku 4.5 最易被攻击。各厂商在收到报告后已无法复现同类攻击,论文还披露了一种把数据外泄想法写进推理链的提示词注入变体。

来源:Simon Willison · simonwillison.net