Lexical Perturbations Disrupt LLM Reasoning: An Empirical Study of Attention Diversion
本文表明,词汇扰动通过破碎分词并分散 Transformer 层中的注意力,严重降低了大语言模型的推理能力,这种耦合效应使得推理时修复策略失效,因为这些策略无法同时恢复受损的内容与注意力分配。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大语言模型是新一代人工智能背后的引擎,它们能够理解复杂的指令、解决数学问题,并进行感觉非常接近人类的对话。这些系统通过将文本分解成被称为“token”(标记)的小块来工作,这些标记就像是模型理解意义的建筑模块。当人类阅读带有拼写错误的句子时,大脑会毫不费力地跳过错误并领会意图。多年来,研究人员一直假设这些强大的计算机模型也具备同样的韧性,认为微小的拼写错误或生硬的措辞不会显著破坏它们的推理能力。关于这些系统在面对现实中常见的日常错误时究竟有多脆弱,这个问题在很大程度上仍未得到解答,这使得它们在干净数据上的惊人表现与在混乱现实世界中的可靠性之间存在着差距。
最近的一项研究旨在填补这一空白,测试了四种不同的语言模型如何处理三种特定类型的文本损坏。研究人员采用了标准的推理任务,例如回答有关物理科学的问题或解决多步数学问题,并引入了现实中的错误。他们模拟了快速打字时的失误(即按到了目标键相邻的键)、单词内相邻字母的交换,以及添加像“um”或“you know”之类的谈话填充词来拉长句子。其目标是观察当文本看起来略有破损时,模型是否仍能找到正确答案,并理解它们失败的具体原因。
结果揭示了模型反应方式中一个尖锐且令人惊讶的分歧。当研究人员添加谈话填充词时,模型的表现与在干净文本上的表现几乎完全一致,即使句子变长了也是如此。然而,当他们引入字符级的错误,如拼写错误或字母交换时,模型的准确率大幅下降。这种下降在需要多步数学推理的任务中最为严重,因为在这些任务中,一个单一的拼写错误就可能导致模型彻底迷失方向。研究表明,这种失败并非由文本长度增加引起的,而是由计算机分解单词的方式所导致的。当一个单词拼写错误时,计算机的内部词典无法将其识别为一个单一单元,而是将其拆分为奇怪且陌生的碎片。
研究人员将这种失败的原因归结为一种他们称之为“注意力分流”(attention diversion)的现象。在一个功能正常的模型中,系统会将计算能量集中在句子的重要部分,例如数学问题中的数字或故事中的关键事实。当一个单词被拆解成奇怪的碎片时,这些碎片就像磁铁一样,将模型的注意力从重要的证据吸引到破碎的文本上。模型最终是在盯着那个拼写错误,而不是在寻找解决方案。这种干扰在模型处理的中期和后期阶段最具破坏性,因为那是它尝试结合信息以形成答案的阶段。研究证实,是单词的碎片化而非句子的长度驱动了这种注意力的丧方面。
为了理解为什么这很难修复,研究人员进行了一系列实验,试图隔离地修复该问题。他们尝试在保留拼写错误的同时恢复模型对句子正确部分的关注,同时也尝试在保持模型注意力混乱的同时修复拼写错误。但这两种方法单独使用时效果都不佳。事实上,在文本保持破碎的情况下修复关注点反而使模型的表现变差了,因为它现在正专注地盯着错误的信息。研究发现,对文本的破坏和模型的注意力分流是深度耦合的;它们无法被分离。模型依赖于单词的特定形状来理解输入,当这种形状被破坏时,模型的注意力也会随之被拉走。
这种耦合解释了为什么一些提高性能的常用策略——例如要求模型“一步步思考”或在执行主任务前使用拼写检查器——往往无法恢复丢失的准确性。这些方法通常只能修复问题的一侧,要么是文本,要么是注意力,而另一侧仍然是破碎的。研究人员还发现,失败的严重程度取决于受损信息的类型。如果拼写错误发生在数学题中的数字上,模型几乎肯定会失败,因为该数字无法从周围的语境中被推测出来。如果拼写错误发生在常用词上,模型可能仍能恢复。这表明,最关键的错误是那些破坏了独特且不可替代的信息片段的错误。
最终,研究结论指出,这些模型的脆弱性在于它们在处理过程的最开始阶段是如何表示文本的。一旦一个单词被分解成陌生的碎片,如果没有原始的、正确的文本,这种损害实际上是不可逆转的。研究人员发现,即使是强大的修复模型也无法可靠地修复这些错误,因为损坏的文本往往不包含任何指向原词的线索。这意味着,构建真正鲁棒的人工智能需要保护进入模型之前的文本,而不是在事后尝试修复它。研究结果表明,未来的改进必须专注于使系统的初始文本理解更加灵活,使其即使在表面形式略有损坏时也能识别意义,而不是依赖完美的拼写来运行。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。