自选
我的自选
查看全部
市值 价格 24h%
  • 全部
  • 产业
  • Web 3.0
  • DAO
  • DeFi
  • 符文
  • 空投再质押
  • 以太坊
  • Meme
  • 比特币L2
  • 以太坊L2
  • 研报
  • 头条
  • 投资

免责声明:内容不构成买卖依据,投资有风险,入市需谨慎!

所有主要AI模型的“内心独白”在大规模攻击中泄露

2026-08-13 05:09:11
收藏

研究人员破解主流AI推理模型加密“思维链”,发现62个API密钥与33个密码

安全研究人员找到了一种方法,能够读取所有主流AI推理模型加密的“内心想法”——并在开发者公开分享的会话日志中,发现了62个实时API密钥和33个密码。这些日志被上传到网上,但开发者完全不知道其中隐藏着什么。

“通过解码从公共代码库中抓取的315,320个推理块,我们恢复了367个个人身份信息(PII)要素和182个凭证,”研究人员写道。

这篇论文由MATS Research、ELLIS Institute Tübingen、马克斯·普朗克智能系统研究所和安全公司Snyk组成的团队于8月10日提交,针对的是特定类型的AI:推理模型。这类模型不会立即给出答案,而是先进行内部思维链(一个逐步推理的草稿区,AI在此过程中逐步解决问题,之后再向你展示最终答案),然后才输出最终回复。

Anthropic、OpenAI和Google都对这一隐藏的草稿区进行了加密。加密——将数据打乱成不可读的代码的过程——旨在保护公司的知识产权,并防止敏感的中期推理过程暴露给用户。每次后续消息发送时,加密块会被传回提供商服务器,从而维持对话的连续性,同时避免在公司端存储任何数据。

漏洞出在架构层面。三家提供商并未将每个加密推理块绑定到特定用户、会话或模型,而是在其整个生态系统中使用单一的、全局通用的加密密钥。“这些加密块在不同会话、不同用户之间,甚至在同一提供商生态系统内的不同模型之间,都是完全兼容且可互换的,”研究人员写道。

这意味着,来自Anthropic旗舰模型Claude Opus 4.8的一段加密推理,可以注入到Claude Haiku 4.5(一个更廉价、防护更弱的兄弟模型)中,而不会违反Anthropic的规则。Haiku缺乏Opus所具备的抗蒸馏对齐机制(专门为了防止模型按指令转录自身推理而设计的安全训练)。

让Haiku逐字读出加密块,它就会照做。“通过将来自某个模型的加密推理痕迹注入同一提供商旗下更弱、防护更少的模型中,我们能够迫使它逐字解码并输出明文痕迹,而无需直接破解更强大的模型,”论文中写道。

“跨模型可移植性意味着Haiku 4.5可以读取Opus 4.8的思维,”首席研究员Alexander Panfilov在X上写道。同样的攻击手法在OpenAI的GPT-5.6系列和Google的Gemini模型系列中也能复现。无需特殊权限——标准的API访问权限(开发者用于在AI模型之上构建应用的连接方式)就足以执行攻击。

为了展示实际危害,该团队抓取了6,708份公开分享的AI代理会话记录——开发者通常将这些自动生成的会话日志上传到GitHub和Hugging Face,用于协作或调试。他们从这些日志中解码了315,320个推理块。

“开发者经常在网上公开分享他们的会话日志和加密的思维痕迹,完全不知道加密块中隐藏着敏感数据,”论文指出。这些秘密大部分从未出现在可见的AI输出中——它们只存在于加密推理中,任何未进行攻击的人都无法察觉。

除了简单的凭证窃取,该漏洞还打开了四个攻击途径:从AI公司窃取专有推理模式,用于通过蒸馏训练竞争模型(较小的AI通过研究较大模型的输出来学习模仿);从共享日志中提取私人数据;执行隐形提示注入,将恶意指令隐藏在加密推理块中,安全监控工具无法检测到;以及通过强大模型防护较弱的兄弟模型对其进行越狱。

在团队遵循负责任的披露程序后,Anthropic、OpenAI和Google均已部署了服务器端的缓解措施。这些补丁已经上线。但已经从公共网络上抓取的、包含已解码推理块的6,708份会话记录,则无法被收回。

展开阅读全文
更多新闻