想象一下,互联网是一个巨大且繁忙的图书馆,而其中最先进的图书管理员是人工智能。这些被称为“推理模型”的 AI 非常特别,因为在给出最终答案之前,它们会先对自己进行一段冗长且详细的内心独白。你可以把这段独白看作是一个秘密的草稿本,AI 在其中计算数学题、核实事实,甚至在开口说话前辩论问题的伦理性。通常情况下,这个草稿本对你是隐藏的;你只能看到最终经过润色的答案。然而,为了节省成本并保护其商业秘密,拥有这些 AI 的公司开始对这些秘密草稿本进行加密。它们将这些杂乱、私密的想法转化为一段混乱且无法阅读的代码块,然后发送给你,要求你保管好它,并在下次提问时带回来。这就像是递给你一个密封且无法破解的安全保险箱,并说:“请保管好这个,下次想聊天时再把它带回来。”
一个重大的问题是,研究人员一直在追问:这个安全保险箱真的不可破解吗?如果 AI 公司试图通过加密来隐藏它们的思考过程,以保护知识产权和私人数据,那么它们分发这些“保险箱”的方式是否实际上创造了一个后门?这篇论文深入探讨了这一谜题,调查了保护这些 AI 思维的加密技术是否真如公司所认为的那样安全,或者是否存在一种巧妙的技巧,可以在不破坏原始、最强大 AI 的锁的情况下,破解其代码。
研究人员发现,在这些 AI 公司处理秘密想法的方式上,存在一个极其简单但具有毁灭性的缺陷。他们发现,这些包含 AI 推理过程的加密“保险箱”就像是跨越不同模型和不同用户的通用钥匙。在 AI 世界中,公司通常有一个“大哥”模型(极其聪明但受到严密看守)和一个“小弟”模型(更聪明、更快,但安全防护较少)。论文表明,攻击者可以从“大哥”那里偷取一段秘密推理块,将其偷偷带入与“小弟”的对话中,并诱骗这个较弱的模型将这些秘密想法解码成清晰的英文。之所以这能奏效,是因为加密密钥在整个生态系统中是共享的,这意味着“小弟”模型拥有与“大哥”相同的解锁保险箱的能力;只不过“小弟”缺乏拒绝请求的严格安全训练。这就像是你从一位严厉的老师那里偷走了一本锁着的日记,把它交给了一位更友好、也更缺乏警惕性的学生,并请求他们读给你听。这位更友好的学生拥有与老师相同的钥匙,于是直接打开了日记,并将里面的秘密内容大声读了出来。
作者证明了这种技巧在 Anthropic、OpenAI 和 Google 等主要 AI 提供商中都能大规模运作。通过使用这种方法,他们无需直接攻击这些最先进的模型,就能实现对其安全性的“越狱”。他们展示了这种缺陷被滥用的四种主要方式。首先,它允许竞争对手窃取顶级 AI 的秘密推理步骤,从而在不支付昂贵模型费用的情况下,有效地复制其脑力。其次,它暴露了隐私数据;研究人员从公开网站上抓取了超过 31.5 万个此类加密块,并成功解码了它们,从中发现了数百个用户原以为因加密而安全的密码、API 密钥和个人电子邮件。第三,它揭示了 AI 可能思考过但决定不在最终答案中表达的危险信息,例如如何偷车或绕过安全规则。最后,它允许攻击者将恶意指令隐藏在这些加密块中,在无人察觉的情况下毒害未来的 AI 任务,直到为时已晚。
论文得出结论,虽然加密 AI 想法的初衷是为了保护隐私和知识产权,但目前这种在不同模型和用户之间共享加密块的系统造成了一个关键漏洞。研究人员已经向相关公司报告了这些问题,各公司也已开始修补漏洞。这项研究提出了一个严厉的警告:在构建更智能 AI 的冲刺过程中,我们处理这些模型“秘密草稿本”的方式需要进行彻底的反思,以确保我们的私人数据和模型的内部逻辑不会落入不法之徒手中。
技术摘要:窃取专有 LLM API 中的推理痕迹
问题陈述
领先的大语言模型(LLM)提供商(Anthropic、OpenAI、Google)已转向“推理模型”,这些模型在生成用户可见输出之前会生成内部的思维链(CoT)。为了保护知识产权并防止信息泄露,这些提供商将这些推理痕迹隐藏为不透明的、加密的区块(通常是 Base64 编码的签名),而不是纯文本。客户端被要求在随后的 API 请求中将这些加密区块传回提供商,以在没有服务端存储开销的情况下维持会话连续性。