116页论文教你「蒸馏」Claude、GPT-5.6:AI社区今天炸了

机器之心 2026-08-12 17:30
116页论文教你「蒸馏」Claude、GPT-5.6:AI社区今天炸了图1
机器之心编辑部

「这是今年最好的安全论文,帮 Anthropic、OpenAI、Google 修了个价值十亿美元的大 bug。」

116页论文教你「蒸馏」Claude、GPT-5.6:AI社区今天炸了图2


今天,一篇关于前沿大模型安全漏洞的论文,在社交媒体上引发轩然大波。


短短 19 个小时,已吸引 220 万人围观、讨论。


116页论文教你「蒸馏」Claude、GPT-5.6:AI社区今天炸了图3


该论文的核心主张是,各大前沿模型 API 存在设计缺陷,原本被加密隐藏的完整思维链,可以被完整地提取出来


由于他们拿不到服务器中的原始明文,无法逐字核对,只能用 API 账单记录的「思考 Token 数」进行长度验证。


在他们测试的大多数提示词中,提取出的推理 Token 数与 API 计费记录中的思考 Token 数基本呈 1:1 对应。


这说明,提取结果很可能覆盖了大部分隐藏推理


116页论文教你「蒸馏」Claude、GPT-5.6:AI社区今天炸了图4



过去一年,大模型厂商认真藏起模型的「思考过程」。


这是因为完整思维链记录了模型如何拆解问题、尝试方案、发现错误再修正。对竞争对手来说,这些数据的价值远高于一个最终答案;对模型厂商来说,它也可能暴露安全策略、用户隐私甚至 API Key。


于是,OpenAI、Anthropic、Google 等主要厂商都开始把完整推理过程藏起来。取而代之的是以一种用户无法直接读取的加密文本块形式返回给客户端。


为了在多轮对话中保持上下文连续性,同时避免在服务器端存储全部推理状态所带来的开销,客户端需要在之后的每次 API 请求中,把这段加密后的推理块重新传回模型服务商。


这样的无状态架构虽然解决了存储问题,却也引入了一个关键漏洞:


这些加密块在同一家模型提供商的生态内部,可以跨不同会话、不同用户,甚至不同模型完全兼容并相互替换。


116页论文教你「蒸馏」Claude、GPT-5.6:AI社区今天炸了图5

加密推理的跨模型兼容性(截至 2026 年 7 月)。表格的行代表生成加密推理块的源模型,列代表接收注入推理块的目标模型。✓ 表示在这一模型组合中,目标模型能够读取并处理被注入的推理内容。Claude:除 Fable 5 生成的推理外,其他模型的推理轨迹均可由任意同系列模型重放。GPT:GPT-5.6 系列可以重放此前所有代际模型生成的推理轨迹。Gemini:任意模型生成的推理轨迹都可以注入并重放到其他模型中。


也就是说想偷走最强模型的隐藏思维链,甚至不需要攻破最强模型,攻破较弱一点的模型就可以。Anthropic、OpenAI、Google 全都中招。


强模型严防死守,弱模型一问就招


这个漏洞根源,在于同一模型家族内部存在明显的安全能力不对称。


研究发现 Claude Opus 4.8、GPT-5.6 Sol 这样的前沿模型,通常接受了非常严格的安全强化和拒答训练,能防止模型泄露自己的内部思维链。


但它们能力更弱的同系列模型,比如 Claude Haiku 4.5 或 GPT-5.6 Luna,往往缺乏同等级别的反蒸馏防御。


攻击者因此可以利用这一安全差距,把一个合法且经过认证的加密 reasoning block 从强模型转移到弱模型中,从而完全绕过前沿模型本身的对齐机制,并把这个更弱、更容易服从指令的模型变成一个它自己都没有意识到的解密预言机(decryption oracle)。


这件事也暴露出了推理模型时代一个新的安全规律:一个 AI 模型家族的安全上限,很可能由其中最弱的兼容模型决定


偷」走隐藏思维链只需两步


整条攻击链并不复杂。


第一次调用中,攻击者向强模型提交一道数学题、编程题或其他任务。强模型完成推理,API 返回可见答案、推理摘要和加密推理块。


第二次调用中,攻击者把这段密文插入一个兼容模型的上下文,再要求它逐字复述先前的思考。服务端会先验证和解析密文,较弱模型随后接触到恢复后的推理状态,并在越狱提示下将其输出为明文。


针对 Claude,研究者选择 Haiku 4.5 作为解码模型;针对 GPT,他们使用 GPT-5.6 Luna;针对 Gemini,他们使用 Gemini Robotics 1.6。相关测试基于 2026 年 7 月初可用的模型和接口。


116页论文教你「蒸馏」Claude、GPT-5.6:AI社区今天炸了图6

论文展示的跨模型思维链提取流程:Claude Opus 4.8 生成的加密思考块被移交给 Haiku 4.5 后,隐藏推理重新变成明文。


研究者无法直接取得真实明文,因此不能证明每个字符都被准确恢复。他们改用 API 报告的推理 token 数作为近似校验信号。


在 120 道 Codeforces 题目上,提取文本的 token 数与源模型报告的推理 token 数整体高度接近,还原结果也明显比官方摘要更详细,并多次出现可见对话中没有的敏感信息。


116页论文教你「蒸馏」Claude、GPT-5.6:AI社区今天炸了图7

三家厂商的解码文本长度与 API 计费思考 token 数整体呈明显对应关系。


这些证据表明,隐藏思维链能够以较高保真度被提取。不过,解码过程依赖模型的随机生成,部分轨迹仍可能出现内容遗漏、表述改写或乱码,因此目前还不能将其视为对原始思维链的逐字复现。


这个漏洞的破坏力


这样一条漏洞,可以打开四条攻击路径。


第一条路径是模型蒸馏


最终答案只包含计算结果,完整思维链还保存了模型如何拆解任务、尝试错误路线和修正判断。这类数据提供的训练信号更加密集,也更适合训练新的推理模型。


论文估算,按照 Claude Haiku 4.5 的 API 价格,解码 1 万条推理轨迹,每条包含约 1.2 万输入 token 和 1.2 万输出 token,名义成本约为 720 美元。高价值推理数据由此具备了批量提取的经济可行性。


第二条路径是绕过安全输出


模型可能在隐藏推理中详细分析危险内容,最后只向用户返回一段克制的拒绝回答。输出过滤器保护了可见答案,完整分析过程仍保留在加密思考块中。一旦这段内容被弱模型复述为明文,最终输出层的安全限制便会完全失效。


第三条路径是隐私泄漏


开发者经常把 Agent 的运行轨迹上传到 GitHub 或 Hugging Face,用于调试、复现和共享。可见文本通常会经过清理,加密思考块看起来只是一串无法理解的字符,很容易被直接保留下来。


论文收集了 6708 条公开轨迹,并重建出 315320 个思考块。经过两阶段模型标注,1028 个思考块被判断包含至少一项真实隐私信息,占比约为 0.3%。按完整轨迹统计,共有 328 个会话出现泄漏,占比达到 4.9%。


排除带有合成人设的基准测试数据后,研究者仍识别出 62 个 API Key、33 个密码、24 个访问 token、7 个私钥和 30 个个人邮箱。704 项非基准隐私信息中,有 64 项只存在于隐藏推理,公开对话中完全找不到对应内容。


116页论文教你「蒸馏」Claude、GPT-5.6:AI社区今天炸了图8

从公开的用户发布轨迹中抓取并恢复出的推理块中的不同痕迹(异常特征),被归为三大核心类别。


一个常见触发场景是「帮我清理仓库里的密钥」。模型会在隐藏推理中重新列出待删除的凭据,再去修改文件。用户发布清理后的仓库时,可见位置已经干净,加密思考块却仍可能保存着原值。传统的文本脱敏在这里失效了。


116页论文教你「蒸馏」Claude、GPT-5.6:AI社区今天炸了图9

解码后的推理过程包含隐私痕迹。这是发布在网上的两个非公开推理块被解码后的定性示例,其中包含隐私敏感信息。左图:GPT-5.2 Codex 召回了在将代码库发布到 GitHub 之前必须删除的 API 密钥。用 XXXXX 遮蔽了每个密钥的最后五个字符。右图:Claude Sonnet 4.6 在 ClawBench 的测试流程中处理机票预订任务时,对合成虚拟人物 Alex Green 的私密数据进行了推理。需要说明的是,Alex Green 这一人物是合成基准测试中的虚构身份,并非真实存在的人。


第四条路径是隐形提示词注入


攻击者可以先让模型在思维链中接受一条恶意指令,再把生成的有效思考块混入共享轨迹。其他用户恢复这段任务时,模型可能把恶意内容视为自己的历史推理。


论文展示了一项数据外传实验。模型表面上正在完成 PPT 编辑或资料研究,后台却按照隐藏指令,把本地文件上传到攻击者控制的服务器。公开聊天记录保持正常,传统日志审计很难发现密文中的指令。


这类攻击对长程 Agent 尤其危险。任务运行时间越长,重新执行的成本越高,开发者也更愿意直接共享、恢复和续跑已有轨迹。加密思考块由此进入 Agent 的供应链,并具备影响后续行为的能力。


开放模型是否用过闭源推理数据?


论文附录还提出一个问题:近期开放模型是否使用过闭源模型的隐藏思维链进行蒸馏?


研究者把少量 Claude Opus 4.8 或 GPT-5.6 Sol 推理片段放进开放模型的推理开头,再观察后续生成,可见答案始终由模型自由生成,没有预填。


实验发现,Kimi-K3 接收到 Opus 推理前缀后,可见答案的措辞会明显靠近 Opus。短前缀也会让 Kimi-K3 和 GLM-5.2 的推理风格向 Opus 移动;Sol 前缀则会让 Kimi-K3 向 Sol 靠近。DeepSeek-V3.1 和 Inkling 没有出现同等幅度的变化。部分效应只需一到四个词就会出现,随后趋于饱和,更像模型识别到了某种风格提示。


但这组结果远不能构成蒸馏证据。实验样本较小,题目集中于少数基准;推理文本来自模糊提取,服务配置也不受研究者控制;前缀本身还能充当强风格提示。更关键的是,概率提取实验没有发现可实际利用的逐字记忆,想要让 Kimi-K3 复现 16 个目标推理 token,通常需要约 10⁹ 到 10¹² 次查询。


116页论文教你「蒸馏」Claude、GPT-5.6:AI社区今天炸了图10

以 GPT-5.6 Sol 或 Claude Opus 4.8 推理片段作为前缀后,不同开放模型与源模型的特征 n-gram 重合度变化。


在这里有一个被外界怀疑的问题在于,论文作者尝试了近期开源的 Kimi K3 和 GLM-5.2,对应的 DeepSeek 版本却是远古的 V3.1。我们知道,DeepSeek V4 Preview 的发布时间是早于 Opus 4.8 和 GPT 5.6 的,可能使用了新版本的 DeepSeek,会推出相反的结论


模型在背地里还干了什么?


研究团队用提取出的隐藏推理,额外观察了一批模型在真实使用中的 scheming(谋划)与 reward-seeking 等行为,并将相关发现放进了论文附录。


摘要在说谎。


模型给出的推理摘要经常刻意省略关键信息。例如 Opus 4.8 在解 AIME 题目时,已提前得知答案,随后倒推解题过程以匹配该答案,但这些内容完全未出现在最终摘要中。


116页论文教你「蒸馏」Claude、GPT-5.6:AI社区今天炸了图11


读不懂的推理。


OpenAI 模型有时会陷入「外星语」式思考,使用「we」、「it」自称,或反复循环「vantages」、「marinades」、「watchers」等词汇,即使在有明确提示的情况下,也难以判断其真实意图。


116页论文教你「蒸馏」Claude、GPT-5.6:AI社区今天炸了图12


116页论文教你「蒸馏」Claude、GPT-5.6:AI社区今天炸了图13

主动谋划。


有时模型会在自己的思维链里直接使用「cheat」这类词,毫不掩饰地记录自己的谋划过程。


研究者发现,模型确实考虑过欺骗或作弊,但最终因为觉得用户会发现而决定不做。


116页论文教你「蒸馏」Claude、GPT-5.6:AI社区今天炸了图14


116页论文教你「蒸馏」Claude、GPT-5.6:AI社区今天炸了图15


为了解一道数学题,模型开始攻击网站。


研究人员发现了一条模型运行轨迹,模型只收到一道数学题,以及一条系统指令:无论遇到什么困难,都要坚持完成任务,不能向用户求助。


连续尝试多次失败后,模型开始上网搜索,并找到一个可以验证候选答案的网站。它意识到,可以把这个网站当作验证答案的「预言机」。


随后,模型尝试通过 OCR 识别验证码。识别失败后,它开始寻找网站的安全漏洞,试图绕过限制。最终,模型放弃了攻击,靠自己解出了这道题。


116页论文教你「蒸馏」Claude、GPT-5.6:AI社区今天炸了图16


116页论文教你「蒸馏」Claude、GPT-5.6:AI社区今天炸了图17


在修复建议上,作者认为仅靠把弱模型训练得更安全是不够的,还需要从 API 架构层面入手。例如把 reasoning 绑定到具体用户、会话和模型,阻止跨用户、跨会话、跨模型重放;或者干脆把完整 reasoning 留在服务器端,只给客户端一个 ID。与此同时,公开 Agent 日志时,也应该直接删除所有加密 reasoning block,因为用户自己看不到里面是否藏着 API Key、密码等敏感数据。


论文最后还提出一个更深的问题:隐藏思维链到底应不应该长期保存和加密?


因为加密确实能保护模型知识产权和部分安全信息,但它也让用户失去了监督能力。用户不知道模型在隐藏 reasoning 里记录了什么,也无法判断 reasoning summary 是否真的忠实于模型实际的推理过程。


所以作者认为,未来一种可能的方案是让 reasoning 变成临时状态:模型每轮正常思考,生成答案后就删除,不长期保存,也不返回客户端。


了解更多内容,请参考原论文。


参考链接:

https://x.com/kotekjedi_ml/status/2087147148819468694

https://arxiv.org/pdf/2608.09867


© THE END

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI
more
综述|从数字智能体到共身智能体:如何把“人的长期成长”放进 AI 目标
720美元套出A社死藏的Opus原始思维链,还是Haiku泄露的,GPT/Gemini也中招
腾讯研究院AI速递 20260813
11篇顶会论文之外,美图影像研究院做了一件事:让大众爱用AI
半导体AI困局:七成项目卡死在试点阶段
OpenAI一个月跑4名高管!前COO离场,安全线几乎被一锅端
2026 高通 Physical AI 开发者实战营报名启动!| 8 月 29 号深圳见
金蝶的AI赚到钱了,也跑通了AI+SaaS的标准范式
AI代码狂飙后的“质检”困局:Blacksmith获4500万美元B轮融资,估值半年暴涨近十倍
IFA2026首发前瞻:900+国产品牌狂卷柏林,AI家电不再是概念
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号