跳到正文
原文
微信公众号(Mp2RSS 合集)· 机器之心·· 2026-08-12精选AI 评分76

论文揭示前沿模型 API 漏洞:可用弱模型提取 Claude、GPT-5.6 的隐藏思维链

116页论文教你「蒸馏」Claude、GPT-5.6:AI社区今天炸了

AI 导读

一篇论文指出 OpenAI、Anthropic、Google 的前沿模型 API 存在设计缺陷,加密返回的完整思维链可以被转移到同系列较弱模型中复述为明文。研究者拿不到服务器端明文,只能用 API 计费的思考 Token 数做长度校验,在 120 道 Codeforces 题目上提取文本的 Token 数与源模型报告高度接近。

推荐理由

论文给出了跨模型提取隐藏思维链的完整攻击链,读者可据此了解推理模型 API 的设计缺陷与修复方向。

来源:微信公众号(Mp2RSS 合集) · mp.weixin.qq.com