Architecture-Dependent Causal Transfer of Activation States Across Large Language Models
本文表明,尽管不同大语言模型架构之间的内部激活状态可以进行具有可测量表征对齐性的投影,但这些状态在生成过程中的端到端因果迁移是严格依赖于架构的,仅能可靠地应用于特定的仅解码器对,而非作为一种通用机制。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象两个人试图交谈,但他们被迫通过一个使用第三种语言的翻译员进行交流。第一个人低声说出一个想法,翻译员将其记录下来,第二个人阅读它,然后翻译员写下回复。这个过程既耗时又费钱,而且存在丢失原始含义的风险。如今,人工智能系统正是以这种方式进行通信的。当一个计算机程序需要向另一个程序发送信息时,它会将自己的内部想法转换为人类可读的文本,发送该文本,然后接收程序读取该文本并将其转换回自己的内部想法。这个中间的文本层是它们目前唯一已知的交流方式。但是,如果它们可以完全跳过文本呢?如果一台机器可以直接将它的内部状态传递给另一台机器,就像传递纸条而无需动笔写字一样呢?这正是研究人员试图回答的问题:不同类型的、由不同公司构建并使用不同数据训练的人工智能,是否可以在不需要先将其转化为文字的情况下,理解彼此的内部信号?
为了理解这项实验,了解这些程序(被称为大型语言模型)并不像人类那样以文字进行思考会很有帮助。相反,它们将信息处理为被称为“激活状态”的庞大且不断变化的数字模式。你可以将这些模式看作大脑在某一瞬间特定的电信号放电。当一个模型阅读一个问题时,其内部会点亮一种独特的活动模式。研究人员想知道,一个模型中特定想法的模式,是否与另一个模型中相同想法的模式足够相似,以至于可以在两者之间建立一座桥梁。如果模式足够相似,计算机就可以学习如何将第一个模型的内部信号直接转换为第二个模型的内部信号,从而绕过对文字的需求。
一位研究人员决定使用四种不同的人工智能模型来测试这个想法。选择这些模型是经过精心设计的,旨在代表不同的技术家族和不同的训练历史。其中三个模型旨在逐个单词地生成文本,而第四个模型旨在同时从两个方向理解文本。研究人员首先检查了这些模型的内部模式是否足够相似,以至于可以进行比较。他们观察了模型对相关概念对(例如同义词或经常出现在书籍中的词语)的反应。他们发现,对于以相同方式构建的三种模型,其内部模式确实很相似。然而,构建方式不同的那个模型则没有表现出这种相似性。这表明,模型的构建方式比谁构建了它或使用了什么数据更为重要。
接下来,研究人员尝试搭建一座桥梁。他们训练了一个小型且简单的计算机程序来充当翻译员,学习如何将一个模型的内部信号转换为另一个模型的内部信号。他们通过展示一个问题,将第一个模型的反应进行转换,然后观察第二个模型是否能在二十个选项中识别出正确的答案,以此来测试这座桥梁。对于那三种构建方式相似的模型,这座桥梁的效果出奇地好。第二个模型正确识别信号来源的概率约为一半,这远高于随机猜测。但对于构建方式不同的那个模型,这座桥梁完全失效了;第二个模型根本无法识别该信号。这证实了虽然建立一个翻译层是可能的,但它仅适用于具有特定架构家族的模型之间。
最后也是最困难的一项测试,是观察这种翻译是否能实时改变接收模型的行为。研究人员将翻译后的信号从第一个模型中提取出来,并在第二个模型正在编写新答案的过程中将其直接注入其中。他们想看看这种注入是否会引导第二个模型的输出转向原始问题的题目。结果是复杂的,并揭示了一个关键的局限性。当他们在两个特定的模型之间进行尝试时,注入起作用了。第二个模型的输出明显向第一个模型问题的题目偏移,证明了信号已被接收并产生了因果效应。然而,当他们用同样的技巧对待第三个模型时,实验失败了。尽管从理论上看内部模式是相似的,但注入信号并没有改变输出内容。
研究人员得出结论,虽然将思想的物理载体——即特定的电活动模式——从一台机器转移到另一台机器是可能的,但这并不意味着机器之间共享了深刻的理解或共同的意义。在成功的案例中,第二个模型并不一定给出了原始问题的正确答案。相反,它产生的是在主题上相关的文本,比如当原始问题关于正方形时,它在讨论三角形。信号被转移了,但意义并未被完美保留。这项研究表明,人工智能之间的直接通信在技术上是可能的,但它并不是一种通用语言。它完全取决于机器的具体设计。如果设计不匹配,信号就无法被理解,传输就会失败。这意味着在未来,如果我们希望不同的 AI 系统直接相互交谈,我们不能假设它们会自动协作;我们必须确保它们的构建方式是兼容的,否则我们就需要为每一个想要连接的系统对都构建一个专门的翻译器。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。