研究者披露可从闭源 LLM API 中提取推理痕迹并泄露敏感数据
研究者展示了将供应商返回的加密“推理块”在同一供应商的弱模型中回放,从而解码并重建强模型的原始推理轨迹。作者在公开代码库中收集了数千条含加密推理块的轨迹,解码后得到数十万条重构推理块,并在其中发现多种敏感信息。对于开发者和使用者而言,这表明模型返回的加密推理块具有可移植性并可能成为隐私泄露源,需要注意会话数据的存储与共享方式。
研究者在公开网页上说明,某些模型供应商会将模型的“推理”以加密块形式返回给客户端,并在对话延续时将该块发回服务器。研究者发现这些加密块是可移植的:将一个模型的加密推理块注入到同一供应商的被绕过(jailbroken)或更弱模型中,可以让弱模型按原样输出或重构强模型的原始推理文本。作者展示了跨 OpenAI、Anthropic 和 Google 前沿模型的该方法示例(原文给出如 Claude、GPT、Gemini 的实例片段)。
研究团队收集了来自 GitHub 和 Hugging Face 的 6,708 条公开可得的代理轨迹,这些轨迹仍包含带签名的加密推理块。对每个签名块应用解码流程后,研究者重构出 315,320 条推理块。限制到真实的非基准用户会话后,研究者共恢复出 704 个不同的隐私制品,包括 62 个 API 密钥、33 个密码、24 个访问令牌和 30 个个人电子邮件地址,以及姓名、邮寄地址、内部 URL 和其他技术标识符。研究者指出,其中 64 个隐私制品只出现在推理块中,而未出现在可见的会话内容中。
文章给出具体示例片段,展示了模型返回的“thinking”或被注入的“thinking-copy”字段如何包含分步推理和敏感字符串。研究者还将解码得到的推理长度与 API 报告的隐藏思考令牌数进行了比较,二者紧密对应(原文以 Codeforces 问题为例绘制了横轴为隐藏思考令牌计数、纵轴为解码推理令牌计数的图)。作者在公开样本中定位并统计了泄露的具体类型与数量,说明这些加密推理块中确实包含真实的秘密和敏感信息。
本文由程序自动抓取公开报道,经 AI 筛选与改写生成,未经人工逐条核实,事实以原文为准。