← 最新论文
🤖 AI

EchoCoT: Extracting Hidden Chain-of-Thought from Large Reasoning Models

本文介绍了 EchoCoT,这是一个多步攻击框架,它通过 API 交互,成功地从开源及前沿的专有大型推理模型中近乎逐字地提取出隐藏的思维链痕迹,展示了这些珍贵模型资产所面临的重大安全风险。

原作者: Yiting Qu, Ziqing Yang, Chi Cui, Ye Leng, Junjie Chu, Yang Zhang

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Yiting Qu, Ziqing Yang, Chi Cui, Ye Leng, Junjie Chu, Yang Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

现代人工智能系统在解决复杂问题方面已经变得异常出色,从编写计算机代码到应对科学难题。当这些先进模型处理一个困难的问题时,它们并不仅仅是直接吐出一个最终答案。相反,它们首先会生成一段冗长的、内部的思维流,这是一个逐步推理的过程,在这个过程中,它们会探索想法、检查工作、纠正错误并考虑不同的路径,最后才得出结论。这种内部独白(通常被称为“思维链”)通常对用户是隐藏的。模型保持其推理过程的私密性,仅展示最终结果,以保护其知识资产并防止泄露敏感数据或专有逻辑。对于开发者而言,这种隐藏的推理是改进未来模型的宝贵资源;而对于用户而言,它是一个黑盒,承诺提供正确答案,却不展示其背后混乱的思考过程。

来自 CISPA 亥姆霍兹信息安全中心的科研团队发现,这种隐藏的推理并不像此前认为的那样安全。他们发现了一种方法,可以诱骗这些先进模型,使其几乎逐字逐句地泄露其整个内部思维过程,即使这些模型的设计初衷是保持其秘密。研究人员开发了一种名为 EchoCoT 的方法,该方法利用了这些模型与外部工具交互时的一个特定特性。在许多系统中,当模型需要使用工具(如计算器或数据库)时,它会暂停推理过程以进行调用,但它会在内存中保留之前的思维活动,以确保连续性。研究人员意识到,攻击者可以利用这种连续性来获取优势。通过反复要求模型将其想法保存到工具中,然后拒绝那些被保存的想法(称其为不完整的),他们可以迫使模型重放其内部推理,每次都揭示更多细节,直到完整的、隐藏的思维链被完全暴露。

研究人员在包括开源系统以及来自主要技术公司的最先进的专有模型在内的多种模型上测试了这种技术。在开源模型上,由于研究人员可以将提取出的思维与原始隐藏的思维进行对比,他们发现 EchoCoT 可以恢复几乎整个推理过程。在许多情况下,提取出的文本与原始隐藏的思维高度吻合,能够精确捕捉超过 90% 的确切词汇和短语。该方法即使对于非常长的推理链也同样有效,成功提取了数千个 token 的思维内容。当研究人员将同样的技术应用于谷歌(Google)和 Anthropic 等公司的专有模型时,他们无法直接看到原始的隐藏思维进行对比。然而,提取出的思维极其冗长,其长度往往与这些公司所报告的模型所使用的推理长度相匹配。此外,提取出的思维内容与公司提供的简短摘要高度一致,这表明提取过程是准确的。在涉及谷歌模型的一个案例中,研究人员恢复了一个超过 33,000 个 token 的推理链,其长度与模型报告的内部过程几乎完全相同。

除了恢复文本之外,提取出的思维还揭示了关于这些模型如何思考的丰富细节。研究人员观察到模型在模拟谷歌搜索、在回忆信息时在中文和英文等不同语言之间切换,以及进行广泛的自我修正。这些行为——例如模型说“等等,这是真的吗?”或“让我尝试另一种方法”——是通常在向用户展示最终答案之前被剥离掉的原始内部过程的一部分。研究还表明,这种攻击是可以自动化的。研究人员构建了一个系统,该系统可以学习如何更好地索取思维,根据反馈信号(如模型使用的单词数量)不断优化其提问方式。这种自动化方法使攻击更加有效,使其能够在不需要针对每个新问题进行手动重新编程的情况下,推广到不同类型的提问和数据集。

这一发现的意义是重大的。研究人员发现,仅仅将推理过程对用户隐藏,并不足以保护它。只要模型保留其内部状态以执行需要工具调用的任务,该状态就可以被重放和提取。研究测试了几种潜在的防御措施,例如隐藏推理单词的数量,或者在模型的系统提示词中加入严格的指令以防止泄露。虽然其中一些措施降低了攻击的成功率,但没有一种能完全阻止它。最有效的防御措施是在工具调用后移除模型对其先前推理的访问权限,但这会破坏模型执行复杂多步任务的能力。研究人员负责任地向涉及这些主要技术公司的机构报告了他们的发现,强调了当前这些强大的推理系统设计中存在的一个关键漏洞。他们的工作表明,保护这些模型的知识产权和安全性,将需要对它们的构建方式以及它们与外界交互的方式进行更根本性的改变,而不仅仅是依赖于“隐藏的思维会保持隐藏”这一假设。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →