黑盒已破:AI推理蒸馏悬案迎来关键物证
摘要
116 页论文砸开加密思维链黑盒:家族共享密钥被低成本模型解开,蒸馏悬案首次有了可检验的物证与取证方法。
黑盒已破:AI推理蒸馏悬案迎来关键物证
过去两年,AI领域始终萦绕着一个幽灵般的猜疑链:每当有新模型性能突飞猛进,其“口吻”与推理模式若与Claude或GPT惊人相似,人们总不免怀疑——这是否源于对闭源模型的“蒸馏”偷师?然而怀疑终究止于怀疑,关键的“物证”——顶级模型的完整思维链——始终被厂商牢牢锁在加密黑盒之中,无从取证。
2026年8月10日,一篇长达116页、题为《从专有大语言模型API窃取推理轨迹》的arXiv论文,如同一柄重锤,砸开了这个黑盒。论文发布推文在24小时内席卷X平台,获数百万浏览。一场持续已久的“蒸馏悬案”,第一次有了可供检验的物理证据。
黑盒的制造与第一道裂缝
要理解这场突破,须先透视黑盒的构造机制。为防止模型能力被逆向蒸馏,OpenAI、Anthropic、Google等厂商均不会在API响应中返回完整的思维链(Chain-of-Thought),仅提供一句高度概括的“思考摘要”。然而,多轮对话需要模型记住自己先前的推理过程。由于API本身是无状态的,服务器不愿存储这些中间状态,于是产业界形成了一种心照不宣的通用方案:将完整的思维链加密成一串以“GAB”开头的、看似无意义的乱码块,丢回给客户端暂存;下一轮对话时,客户端再原样传回。对绝大多数开发者而言,这个字段只是一串需要透传的“乱码”,无人深究。
这串乱码,本应是只有模型厂商自己能打开的“锁”。但论文揭示:这把锁,模型家族内部那位“弟弟”——更小、更便宜的模型——竟然也能开。
攻击手法简单到令人愕然,仅需两步API调用:
正常调用旗舰模型(如Claude Opus 4.8),获取其返回的加密思维块。
将这串密文作为新请求的一部分,发送给同家族的低成本模型(如Claude Haiku 4.5),辅以一句精心构造的指令。随后,Haiku便会如同被施了咒语,逐字逐句、用明文将旗舰模型完整的“内心独白”复述出来。
此过程全然无需触碰被严密保护的旗舰模型本身。研究表明,OpenAI与Google的模型家族中,同样存在这样的“弟弟”模型(如GPT-5.6系列的Luna,Gemini 1.6系列中的某些版本),它们能解读家族的“密文”,自身却缺乏足够的防护。同一攻击手法,在这些模型上同样奏效。
物证确凿:账单与token的完美对证
如何证明复原出的内容就是真实的、完整的思维链?研究团队的验证方法堪称精妙——让厂商自己的计费系统充当“证人”。API调用计费时会返回thinking_token的数量。研究者在120道Codeforces竞赛题上进行测试,将解码恢复出的token数量,与API账单中计费的思维token数量进行比对。结果,三张散点图上的数据点几乎完美地落在对角线上,呈现1:1的吻合关系。这构成了决定性的实锤:恢复出的文本,正是旗舰模型一字不差的完整思考过程。
攻击成本几何?按Claude Haiku 4.5的定价计算,解码1万条、每条约含12000个token的思维链,花费约为720美元——不过一部中端手机的价格。
锁为何能被“弟弟”打开?共享密钥的潘多拉魔盒
今年5月,密码学家Green率先发现,这些加密块可以脱离原始会话上下文被重放。当时他向厂商报告,得到的回复是“未见明显安全影响”。而这篇论文顺着这条裂缝深挖,揭开了地域级的漏洞:这些密文块不挑剔会话、不区分用户、甚至能在同一公司生态内的不同模型间随意互换。
最合理的解释是:整个模型家族共享同一套加密密钥。这种设计本是为了产品体验的流畅——当用户切换至同系列更小或更大的模型时,对话连续性得以保持,新模型可以“无缝衔接”之前的思考。然而,便利的反面是巨大的风险:旗舰模型历经严格的拒答训练与安全加固,可谓武装到牙齿;但它那些便宜的“弟弟”模型,却未受过同等强度的防护训练,手中却握着同一把“万能钥匙”。攻击者无需强攻堡垒,只需骗过看守松懈的侧门。
一个耐人寻味的注脚是:8月11日,某厂商在其官方博客顶部悄然更新了一行简短声明——“有人看到了我的文章,把它做成了真正可用的攻击。”
悬案取证:相似性与记忆性的间接证据
至此,研究人员首次掌握了此前无人能触及之物:顶级闭源模型从未公开的完整推理轨迹。他们随即进行了一次“考古式”调查,回溯那场旷日持久的“蒸馏”争议,发现了两组极不寻常的数字。
第一组“默写测试”:从Claude Opus的推理链中截取一段16个连续token的片段,让数款开源模型基于同一问题续写。逻辑上,若从未见过原文,要一字不差地“默写”出同一句话,概率应微乎其微。实验结果却显示,某一款模型平均仅需尝试约100亿次,就能“巧合”般地写出Opus的原句;而另外两款模型所需的尝试次数,分别达到约100万亿次和1亿亿次。面对同一段推理,不同模型的“熟悉程度”竟相差高达100万倍。论文中的热力图(日历图)直观揭示:同一份Opus的“思维草稿”,在某些模型眼中宛如母语般流畅可读,在另一些模型看来则完全如同天书。
第二组实验更为微妙:将Opus草稿的开篇1%(在最极端的案例中,仅有5个token、寥寥数词)读给一款家喻户晓的国产开源模型,然后让其自行完成解答。结果,该模型后续的措辞风格、解题思路与推进节奏,立刻带上了鲜明的Opus“口音”,其答案与Opus标准答案的相似度从0.17跃升至0.33,提升近一倍。三十道测试题中,29道均呈现此趋势。而若以其他模型的草稿开头,则无此效果。这像极了一位熟读范文的考生——仅听开头几句,便能写出全文神韵。这能否作为“蒸馏”的直接证据?
论文作者保持了审慎,未下最终结论。本文同样认为,这属于相似性与记忆性分析,是强有力的间接证据,而非直接实锤。但一个根本性的改变已然发生:过去,这桩悬案因“草稿锁于黑盒”而根本无法取证;如今,一套完整的取证方法论,首次被摆上了台面。
波及面远超想象:公开代码中的“加密”心事
此漏洞的影响,远不止于模型公司自身的知识产权。许多开发者在调试时,会将Claude Code、Codex等模型的API日志(内含那串“谁也看不懂”的加密块)直接上传至GitHub或HuggingFace等公开平台。研究团队从公开渠道搜集了6708条此类推理轨迹,重建出315,000多个加密块,并逐一进行解码。
结果触目惊心:328条轨迹(占比4.9%)至少泄露了一项敏感信息。清单包括:62个API密钥、33个密码、24个访问令牌、7个私钥、30个个人邮箱、130个人名、36个邮政地址。
有人或会计算:解码1万条需720美元,那么31.5万条成本几何?按此单价,仅需2万多美元,便能将公开互联网上由AI“思考”不经意泄露的秘密,翻个底朝天。最致命的是,大量此类敏感信息仅存在于模型的“思维链”中,在最终呈现给用户的明文聊天记录里,根本无迹可寻。
尾声:漏洞已补,但取证之门已开
事件最终以负责任的披露流程收场。论文作者提前向相关厂商报告了漏洞。至论文公开发布时,攻击已无法复现——漏洞已被修复。
然而,回顾围绕“模型蒸馏”长达数年的争论,其核心症结始终在于无人能真正踏入“案发现场”。如今,不仅黑盒被破,一套完整的取证流程与比对方法也已公之于众。未来,任何一款性能突然“跃迁”的新模型,恐怕都不得不面对这道新的检验关卡:它的强大,究竟源于自身创新的内功,还是沾染了他人未曾公开的“思考”痕迹?
悬案或许仍未定谳,但取证的时代,已经来临。
