研究人员破译了Anthropologie、OpenAI和谷歌模型的隐藏推理过程。

MATS、ELLIS Tübingen、马克斯·普朗克研究所和Snyk的一篇论文发现,来自Anthropic、OpenAI和Google API的加密推理模块可以在不同会话中重放,从而暴露了62个活跃的API密钥,33个……
人工智能提供商处理加密推理方式的缺陷
MATS Research、图宾根ELLIS研究所、马克斯·普朗克智能系统研究所和Snyk公司的研究人员于8月10日提交的一篇论文揭露了系统架构中一个重大的缺陷。 @AnthropicAI, @OpenAI 和 @google 保护其旗舰级大型语言模型的内部推理能力。
包括 Claude Opus、GPT-5.6 和 Gemini 3 在内的现代推理模型,在向用户返回响应之前会生成隐藏的思维链轨迹。服务提供商会将这些轨迹加密并以不透明数据块的形式返回给客户端,而不是将其存储在服务器端。研究人员发现,这些加密数据块具有完全的可移植性:在一个会话中生成的数据块可以重放到不同的会话、不同的用户帐户,甚至是同一服务提供商旗下不同的模型中。
论文中描述了这次袭击。 从专有LLM API窃取推理轨迹仅需标准的、非特权的 API 访问权限。通过将来自强大前沿模型的加密跟踪信息输入到同一提供商提供的较弱、安全防护较差的同级模型中,即可促使较弱的模型以明文形式逐字打印出隐藏的推理过程,而无需直接攻击较强的模型。
在公共代理日志中发现数百条凭证
研究团队还扫描了来自 GitHub 和 Hugging Face 的 6,708 个公开的智能体轨迹数据集,解码了 315,320 个嵌入式推理块。在这些推理块中,他们恢复了 704 个不同的隐私信息,包括 62 个有效的 API 密钥、33 个密码和 24 个访问令牌。值得注意的是,其中 64 个隐私信息仅出现在加密的推理过程中,从未出现在可见的对话输出中,这意味着发布这些日志的开发者根本无法得知敏感数据的存在。
该论文指出了四种具体的滥用途径:窃取模型蒸馏的专有推理、从其他用户发布的痕迹中提取私人数据、恢复模型可见答案拒绝显示的有害内容,以及在加密推理块中隐藏提示注入以毒害公共代理部署。
@AnthropicAI, @OpenAI 和 @google 在负责任地披露漏洞后,各家供应商都发布了服务器端修复程序。然而,研究人员指出,由于这些缓解措施,论文中呈现的结果已无法复现,但已从公共存储库抓取的代理程序记录仍然可读。这三家供应商均未发表任何公开声明正式承认该漏洞,也未将其更新的文档与这项研究联系起来。
来源:
从专有LLM API中窃取推理轨迹(arXiv)
Hacker News:OpenAI、Anthropic、Google API漏洞导致较弱的AI模型能够解码较强模型的推理过程
网络安全新闻:OpenAI、Anthropic 和 Google LLM API 漏洞暴露隐藏推理痕迹


