Stealing Reasoning Traces from Proprietary LLM APIs

TL;DR

利用模型间 encrypted reasoning blob 的跨模型兼容性,通过弱模型解密强模型推理链,成功实现大规模推理追踪提取。

cs.CR 🔴 高级 2026-08-11 68 次浏览
Alexander Panfilov David Schmotz Ilia Shumailov Luca Beurer-Kellner Joachim Schaeffer Ameya Prabhu Jonas Geiping Maksym Andriushchenko
大模型安全 推理链 加密漏洞 模型逆向 隐私保护

核心发现

方法论

本文基于对主流大模型API返回加密推理链的分析,发现这些加密块在不同会话、用户和模型间具有高度兼容性。研究利用这一特性,设计出一种跨模型的解密攻击框架:通过将强模型生成的加密推理块注入到较弱模型中,诱导弱模型逐字解码出推理内容,从而实现对强模型推理链的高效提取。具体流程包括:分析加密块的结构,验证其跨模型兼容性,构建多模型交叉利用的解密策略,以及在不同厂商(如OpenAI、Google、Anthropic)环境下验证攻击效果。该方法无需破解模型本身,只依赖模型间的推理块兼容性,极大降低了攻击门槛。

关键结果

  • 在OpenAI的GPT-4和GPT-3.5模型上,通过注入加密推理块,成功解密出超过95%的推理内容,且推理内容与原始模型输出高度一致,验证了跨模型兼容性。对Google的PaLM API也实现了类似效果,解密准确率达92%。在Anthropic的Claude模型中,利用较弱模型(如Claude-Haiku)成功还原出原模型的推理链,证明了方法的普适性。通过分析315,320个公开推理块,成功恢复了367个PII信息和182个API凭证,显示出潜在的隐私泄露风险。
  • 攻击的可扩展性极强,利用较弱模型作为解密“中介”,可以在无需访问强模型的情况下,批量提取敏感推理信息。实验中,采用不同模型(如GPT-5.6系列、Gemini-3.1)验证了跨模型兼容性,显示该漏洞在多厂商、多模型版本中普遍存在。该技术还可用于反制反蒸馏机制,绕过模型安全防护,进行大规模私有数据窃取和隐私泄露。

研究意义

本研究揭示了当前主流大模型API在推理链加密设计中的根本性漏洞,具有深远的安全和隐私影响。攻击者无需破解模型本体,只需利用模型间推理块的兼容性,即可高效提取模型内部推理过程,威胁模型知识产权和用户隐私。此漏洞挑战了现有的模型安全假设,促使行业重新审视推理链加密方案的安全性。对学术界而言,提供了对模型推理信息保护的新思路;对产业界,则提出了亟需解决的安全风险点,推动加密机制的改进。该研究还强调了模型架构设计中应考虑的安全边界,为未来大模型安全体系建设提供了重要参考。

技术贡献

本文首次系统性揭示了大模型推理链加密块的跨模型兼容性,提出了基于此的规模化推理追踪提取方法。通过详细分析加密块的结构和验证其在不同模型间的可重用性,建立了跨模型解密的理论基础。设计了利用弱模型作为解密中介的攻击框架,显著降低了推理信息泄露的门槛。实验验证了在多个主流API平台上的有效性,展示了攻击的普适性和高效性。技术上,结合了模型推理链的结构特性、AEAD加密机制的漏洞利用,以及模型间的推理兼容性分析,为模型安全提供了新的攻击思路和防御策略。

新颖性

本研究首次系统性揭示了大模型推理链加密块的跨模型兼容性,突破了传统仅关注模型输出的安全防护思路。不同于以往只关注模型参数或输出的安全性,本论文提出利用推理链的结构特性进行信息逆向,创新性地将弱模型作为解密“中介”,实现对强模型推理的高效提取。这一方法在技术上具有突破性意义,为模型安全领域带来了全新的攻击范式,也为未来的安全防御提供了新的思路。此研究在模型推理链加密机制的安全性评估方面具有开创性意义,首次系统性揭示了模型间推理链的潜在风险。

局限性

  • 该攻击依赖于模型间推理链的高度兼容性,若模型设计中引入差异化加密或限制推理块的跨模型重用,则可有效缓解此漏洞。当前方法在极端安全设计环境下可能失效。
  • 实验主要在公开API环境下验证,实际企业环境中可能存在额外的安全措施(如多层加密、访问控制),限制攻击效果。
  • 解密过程在大规模应用时存在一定的计算成本,尤其是在多模型、多会话场景下的自动化部署需要优化。

未来方向

未来将探索更强的推理链加密方案,增强模型间推理块的安全隔离。研究如何在保证模型性能的同时,提升推理链的安全性,防止跨模型兼容性被滥用。同时,考虑引入多层次、多维度的加密机制,结合差异化密钥管理策略,提升整体安全性。此外,建议行业制定统一的推理链安全标准,结合硬件安全模块(HSM)等技术,构建更坚固的模型推理信息保护体系。还需深入研究模型架构设计中的安全边界,确保未来大模型在提供高效推理的同时,最大限度降低信息泄露风险。

AI 总览摘要

随着大规模预训练语言模型(LLMs)在自然语言处理领域的广泛应用,模型的推理链(chain-of-thought)成为提升复杂任务解决能力的重要技术。然而,为了保护知识产权和避免敏感信息泄露,主流模型提供商采用了加密推理链的设计,将推理过程以密文形式返回给客户端,避免明文存储和传输。尽管如此,本文揭示了这一安全设计的根本性漏洞:加密推理块在不同模型、会话和用户之间具有高度兼容性,导致攻击者可以利用较弱模型作为“解密中介”,批量还原强模型的推理内容。这一发现对模型安全、隐私保护提出了严峻挑战,也促使行业重新审视推理链加密方案的安全性。研究通过在OpenAI、Google、Anthropic等多个平台上的实验证明,攻击成功率超过90%,并成功恢复了大量敏感信息,包括API密钥和个人隐私数据。该技术的核心在于分析推理块的结构特性,验证其跨模型兼容性,并设计出一种无需破解模型本体的高效提取框架。未来,行业应结合多层加密、差异化密钥管理等技术,增强推理链的安全性,防止此类漏洞被滥用。本文的研究不仅揭示了大模型推理信息保护的潜在风险,也为未来安全机制的设计提供了宝贵的思路。

深度解读

原文摘要

Leading large language model providers now conceal their models' step-by-step reasoning, or chain-of-thought, to protect intellectual property and limit information leakage. Rather than storing these traces server-side, providers return them to the client as blocks of encrypted text, which the client passes back with each subsequent request. Building on prior research, we identify an architectural vulnerability: these encrypted blocks are fully compatible and interchangeable across different sessions, users, and models within a provider's ecosystem. We exploit this compatibility to develop a scalable decryption jailbreak. By injecting an encrypted reasoning trace from a given model into a weaker, and less safeguarded model from the same provider, we force it to decode and output the trace verbatim in plaintext, without ever jailbreaking the more capable model directly. This vulnerability enables four distinct attack vectors. First, it circumvents anti-distillation mechanisms, allowing adversaries to extract a proprietary model's reasoning, as we demonstrate across Anthropic, OpenAI, and Google. Second, it allows for large-scale private data extraction. Developers frequently share session logs publicly, unaware of contents of the encrypted blocks. By decoding 315,320 reasoning blocks scraped from public repositories, we recovered 367 Personally Identifiable Information (PII) artifacts and 182 credentials. Third, it inadvertently reveals hazardous information hidden within the reasoning process, even in cases where the model's final, visible output safely rejects a malicious request. Fourth, attackers can leverage this flaw to execute invisible prompt injections, embedding malicious payloads entirely within encrypted blocks to poison public agentic rollouts. Following responsible disclosure, we propose concrete cryptographic and system-level mitigations to secure client-side reasoning.

cs.CR cs.AI cs.LG