← 最新论文
💻 computer science

Hidden APIs in Language Models: Discovering Reusable Causal Interfaces from Forked Futures

本文引入了“分叉未来”(forked futures),这是一种通过基于诱导出的未来响应分布来比较隐藏状态,从而识别语言模型中可重用因果接口的方法,并证明了“共享”(Shared)接口在多种模型架构中提供了最经济且最稳健的表示。

原作者: SiYuan Ma, Yiqin Luo, Zhangji, Canran Xiao, Albert Gao, Wei-Hsing Huang, Wei Wang, Qiwei Wu, Xinran Li, Jinfeng Wei, Qixin Zhang

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: SiYuan Ma, Yiqin Luo, Zhangji, Canran Xiao, Albert Gao, Wei-Hsing Huang, Wei Wang, Qiwei Wu, Xinran Li, Jinfeng Wei, Qixin Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图理解一个巨大的、超级聪明的机器人是如何思考的。你可以看到它在回答问题时所说的话,但你看不见它大脑内部齿轮转动的过程。长期以来,科学家们一直试图通过观察机器人的“隐藏状态”来窥探其内部——即在它输入答案之前存在的内部电信号模式。核心问题在于,这个机器人是使用一个特殊的、可重复使用的“控制面板”来处理所有的思考,还是在处理每一项任务时都手忙脚乱地构建一个全新的、一次性的工具?这就像是在问一位厨师是使用一把万能的主厨刀处理所有事情,还是每次切洋葱、切面包和片鱼时都去拿一个不同的、专门的工具。理解这一点至关重要,因为如果机器人拥有一个可重复使用的控制面板,我们或许就能更容易地与它交流、修复它的错误或理解它的秘密。如果它只是一个由一次性工具组成的混乱堆砌,那么弄清楚它的运作方式将会是一场噩梦。

这篇论文介绍了一种解决这个谜团的巧妙新方法,被称为“分叉未来”(forked futures)。研究人员并没有仅仅向机器人提问并观察它的回答,而是设计了一个时间旅行实验。他们让机器人根据故事目前为止的内容形成一个内部想法(隐藏状态),但在告诉它下一步要做什么之前,他们进行了“分叉”:他们要求机器人利用同一个想法去做许多不同的事情,比如比较事实、验证规则或组成一个新的句子。通过观察机器人的大脑对这些不同未来任务的反应,他们可以观察那个内部想法究竟是一个多功能的、可重复使用的工具,还是仅仅是一个死胡同。

研究人员在两个著名的语言模型 Qwen2.5-1.5B 和 Llama-3-8B 上测试了这个想法,让四种不同的理论展开对决:“共享”理论(一个主控制面板)、“局部”理论(每项工作都有独特的工具)、“混合”理论(有些工具是共享的,有些则不是)以及“分布式”理论(工作分散在各处,没有中央枢纽)。他们测量了哪种理论解释机器人行为的效率最高。结果表明,“共享”理论是获胜者。机器人似乎使用了一个紧凑的、可重复使用的“API”(一种内部接口)来节省精力。具体而言,共享模型在 Qwen 模型上需要 1.292 nats 的描述长度,在 Llama 模型上需要 1.187 nats,分别以 0.216 和 0.294 nats 的优势击败了次优选项。这意味着机器人正在使用一种“捷径”来复用其内部状态,而不是每次都重新发明轮子。

然而,论文非常谨慎,并未过度夸大其词。它明确排除了这种现象是一个处理机器人大脑中所有事务的完美、通用“全局工作空间”的可能性。证据显示,这种可重复使用的接口在特定的任务族(如逻辑谜题或代码)中表现最好,但当你尝试将完全不同类型的任务混合在一起时,它的效力就会减弱。事实上,当他们在已知答案的虚构简单机器人大脑上测试该方法时,发现该方法出错的概率为 8.3%(12 个非共享大脑中有 1 个被错误地标记为共享)。这意味着这一发现是真实的但也是有限的;它是一个理解机器人特定部分思考方式的强大工具,而不是开启其整个心智的魔力钥匙。论文总结道,虽然这些模型确实拥有一个紧凑的、可重复使用的因果接口,但这是一个特定的、有条件的特征,而非一个神奇的、全能的大脑中心。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →