Divergent large language model predictions from convergent representations in ambiguous word pairs
这项研究揭示了仅解码器(decoder-only)Transformer 如何通过在后期层中先发散后部分重聚其内部表示来解决词汇歧义,从而产生一种断层,使得语义区别尽管对标准嵌入相似度度量而言已变得不可见,却依然存在并驱动着不同的预测。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图理解一个巨大的数字大脑是如何学习阅读的。这个大脑被称为“大语言模型”(LLM),它是我们每天使用的聊天机器人和智能助手背后的技术。为了理解世界,这些模型不仅仅是记忆单词;它们将每个单词转化为一种数学上的“指纹”,称为嵌入(embedding)。你可以把这种指纹想象成一个多维地图上的坐标。如果两个词的意思相似,它们的坐标应该靠得很近,就像城市里的邻居;如果意思不同,它们就应该离得很远。
多年来,科学家们一直信任这张地图。他们认为,如果我们观察模型为某个词创建的最终指纹,就能准确判断出模型认为该词的含义。这种想法是当今许多工具的核心,比如用于寻找文档的搜索引擎,或将相似想法分组在一起的应用。但问题在于:语言是非常复杂的。有些词,比如“bank”,既可以指存放金钱的地方,也可以指河流的岸边。这些被称为歧义词(ambiguous words)。研究人员一直在追问一个大问题:模型的最终指纹是否真的展示了这两种含义之间的区别,还是在到达最后阶段时,地图变得模糊且混乱了?
这篇论文通过观察三个不同的 AI 模型——一个小型、一个中型和一个非常大型的模型——如何逐层处理歧义词,深入探讨了这个谜团。研究人员发现了一些令人惊讶且违反直觉的现象。当模型处理像“bank”这样的词时,在网络的中间部分,表示“河流”的含义与表示“金钱”的含义之间的数学距离实际上会变宽,但在最后的层级中又会缩减回原样。这就像是模型的内部地图暂时分离了这两种含义,然后在它开口说话之前,又决定把它们放回同一个街区。
然而,这里有一个转折:即使最终的指纹看起来非常相似(几乎回到了同一个街区),模型的预测却是完全不同的。当模型被要求猜测下一个词时,它非常清楚正在谈论的是哪种“bank”。研究表明,最后一层掌握着意义的秘密,但它以一种标准测量工具(如简单的距离检查)无法察觉的方式隐藏了意义。模型并没有感到困惑;它只是在最后一层使用了一种特殊的“秘密代码”,这种代码看起来是相似的,但表现出来的却是差异。这表明,仅仅依靠最终的“指纹”来理解 AI 的想法可能是误导性的,因为最重要的区别是以一种看似已经消失的方式存在的,尽管它们仍在驱动着模型的行为。
移位的地图的故事
为了理解这是如何运作的,请把 AI 模型想象成一个由 64 名侦探组成的团队(对于最大的模型 Qwen2.5 而言)正在传递一份秘密纸条。每一位侦探代表模型的一个“层”(layer)。当纸条上写着“bank”时,前几位侦探只是在观察这个词的形状。他们还不知道这是指河流还是银行,所以他们的笔记看起来几乎一模一样。
随着纸条传到中间的侦探手中,神奇的事情发生了。这些侦探开始关注上下文——即“bank”前后的词。一位侦探看到了附近的“river”(河流),就在笔记上画了一个大红点。另一位看到了“money”(金钱),就在上面画了一颗蓝星。在这个中间阶段,这两种含义的笔记是天差地别的。如果你在这里测量它们之间的距离,它们会相距甚远。
但随后,纸条传到了最后的侦达手中。情节在这里变得复杂了。最后的侦探们将那些截然不同的红点和蓝星重新折叠回一份看起来非常相似的笔记中。如果你测量“river bank”和“money bank”的最终笔记之间的距离,它们看起来又几乎完全一样了。就好像侦探们决定:“让我们让最终报告看起来一样,这样就不会搞混老板了。”
然而,老板(模型的输出)并没有被愚弄。即使最后的笔记看起来一样,侦探们已经以一种改变最终答案的方式,秘密地编码了差异。当模型预测下一个词时,即使最终的笔记看起来属于“河流”,它也不会说出“river”。
研究人员通过玩一场“调包计”证明了这一点。他们把“河流”语境下的最终笔记拿出来,换到了“金钱”语境中。当他们这样做时,模型完全改变了主意,开始预测与河流相关的词。这证明了最后一层确实保留了差异,即使看起来这两个含义已经合并在一起了。差异依然存在,但它隐藏在下一步的指令中,而不是笔记本身的形状里。
为什么地图具有误导性
这一发现有点像魔术师的戏法。如果你只看魔术师在表演结束时的双手,它们看起来是空的且完全一样的。但如果你观察了整个表演过程,你会看到魔术师全程都在玩转两个不同的球。研究人员发现,对于歧ர义词,这种“玩转”发生在中间层,在那里含义是清晰分离的。但到了表演结束时,球又被藏了起来,双手看起来又恢复了原样。
论文在三个不同的模型上测试了这一点:一个小型的 GPT-2(1.17 亿参数),一个中型的 Llama-3.2(30 亿参数),以及一个大型的 Qwen2.5(320 亿参数)。尽管它们的规模和架构各不相同,但它们都表现出了相同的行为:在中间层分离含义,然后在最后将其带回原处,同时仍然准确知道该使用哪种含义。
研究人员还检查了这是否仅仅是由单词在句子中的位置造成的偶然现象。他们交换了句子中的单词顺序(例如将“The cat chased the mouse”改为“The mouse chased the cat”),发现模型的行为仍然是由含义驱动的,而不仅仅是词序。这证实了模型确实理解了歧义。
这对未来意味着什么
主要的启示是,我们可能一直在观察错误的地图部分。长期以来,人们一直假设,如果在 AI 的最后一层中两个事物看起来相似,那么它们的意思就相同。这篇论文表明,事实并不总是如此。最后一层看起来可能像是一个拥挤的房间,每个人都站得很近,但如果你倾听他们在说什么(他们的预测),你会发现他们其实在讨论完全不同的主题。
这并不意味着 AI 是损坏的。它只是意味着它存储信息的方式比简单的距离图表要复杂得多。研究人员建议,如果我们想要构建更好的搜索或组织信息的工具,我们可能需要观察那些含义清晰分离的中间层,或者我们需要倾听模型的预测,而不是仅仅测量其指纹的接近程度。
这项研究并没有找到神奇的解决方法或构建模型的新方法,但它确实解开了一个关于这些模型如何思考的谜题。它表明,歧义消除的“魔力”并没有在最后一层丢失;它只是隐藏在显眼之处,等待我们去寻找正确的线索。研究人员对这些结果充满信心,因为他们使用了多种模型和不同类型的歧义词,并且这种模式每次都成立。这提醒我们,在 AI 的世界里,事情并不总是看上去的那样,有时最重要的区别正是那些你无法用尺子量出来的区别。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。