Which Question Is Your Attention Metric Answering? Attention Rows as Compositional Data
本文认为,标准的注意力度量往往会得出误导性的结论,因为它们未能区分模型对主导“汇”(sink)标记的关注与对内容标记的分布,因此,本文提议将注意力行视为成分数据(compositional data),以准确分离这些因素,从而避免模型分析和剪枝中的伪影。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在驱动现代人工智能的庞大神经网络内部,存在着一种被称为“注意力”(attention)的机制,它允许系统决定在任何给定时刻,句子或图像的哪些部分是最重要的。当这种机制运行时,它会为每个单词或标记(token)生成一个概率列表,显示对每一个部分的关注程度。多年来,研究人员一直通过使用标准的数学工具来比较这些列表,以试图理解机器是如何思考的。他们假设,如果两个列表看起来相似,那么底层的思维过程也是相似的。然而,一项新的分析揭示了这一假设建立在一个隐藏的选择之上——科学家们在不知不觉中做出了这个选择,而这个选择可以完全扭转他们关于机器实际在做什么的结论。
问题的核心在于几乎所有大型语言模型中都存在的一种奇特行为:它们倾向于将大量的注意力倾注在单个无信息的标记上,通常是句子的第一个单词。研究人员称之为“注意力汇聚”(attention sink)。在许多情况下,这个单一的标记吸收了百分之八十甚至更多的总注意力,使得剩余的标记只能分享极小的剩余部分。当科学家想要比较两种不同的注意力模式时,他们面临着一个两难的选择。他们是应该在比较中包含这个占主导地位的第一个标记,还是应该将其移除以观察其余信息的分布情况?论文证明,这并非一个无关紧要的技术细节。根据研究人员选择哪种方案的不同,相同的两个注意力模式可能看起来几乎完全相同,也可能看起来截然不同。这意味着,过去数十年的研究——其中许多研究在没有明确说明如何处理第一个标记的情况下就进行了模式比较——其结论可能是基于一种任意的惯例,而非模型实际的结构过程。
为了解决这个问题,作者将注意力列表视为一种特定类型的数据,即“成分数据”(compositional data),在这种数据中,唯一重要的是各部分的相对比例,而非它们的绝对大小。通过应用一种专为这类数据设计的专门数学框架,他们能够将“汇聚”问题与“内容”问题分离开来。他们证明了社区使用的标准工具(如余弦相似度和熵)将这两个截然不同的问题混淆在了一起。当注意力汇聚变得更大时,这些标准工具会报告说注意力变得更加集中,且系统正在坍缩为一个更简单的状态。但新的分析表明,这往往是一种错觉。注意力并不一定是在有意义的内容上变得更加集中,仅仅是因为第一个标记占据了更多的聚光灯。当实际的注意力在有意义的单词之间的分布保持完全不变时,标准指标却会在大声疾呼发生了“坍缩”。
研究人员在十个不同的预训练模型上测试了这一理论,范围涵盖了从小型实验网络到拥有数十亿参数的巨型模型。他们发现,选择哪种惯例在相当多的案例中改变了最终的判定。在某些模型中,当包含汇聚点时,网络不同部分之间的对比结论,在切换到移除汇聚点后,近一半的情况发生了反转。例如,在包含汇聚点时被视为网络中最亲近邻居的一对注意力头,一旦移除汇聚点,就会变成疏远的陌生人。反之,在包含汇聚点时看起来毫无关联的注意力头,在移除后却可能看起来像是孪生兄弟。这种不稳定性意味着,那些科学家用来分类大脑不同部分功能的著名“头聚类”(head clustering)图谱,往往捕捉的是汇聚点的大小,而非各部分的实际功能。在对一个标准聚类流水线进行的重大重新分析中,一旦正确处理了汇聚点,数据中原本最显著的结构便完全消失了,这表明该结构是测量方法的产物,而非模型的特征。
这对训练和改进这些模型具有重要意义。论文表明,许多看起来像是“熵坍缩”(entropy collapse)——即模型在训练过程中变得不稳定或过度简化的迹象——实际上只是注意力汇聚变得更大的现象。在拥有十亿参数的模型中,百分之九十五的表观复杂度下降都是由于汇聚点占据了更多空间,而非内容本身变得不再多样化。这种区别至关重要,因为它改变了工程师应该如何修剪或移除网络中不必要的部件。当研究人员使用这种新的、分离了汇聚点的法来决定切除网络的哪些部分时,他们发现,使用旧方法可能会导致模型的性能崩溃,在某些情况下使错误率增加一百倍以上。新方法使他们能够识别并移除冗余部分而不破坏模型,但前提是必须先将汇聚点的噪声与内容的信号分离开来。
最终,这项工作并不是声称旧的数学方法是错误的,而是说它回答了一个与研究人员自认为在问的问题不同的问题。旧工具测量的是包括对第一个标记的巨大偏向在内的总分配量。新工具测量的是剩余的注意力如何在实际内容之间进行分配。作者提供了一份清晰的指南,说明了何时使用每种方法是安全的,以及何时会导致灾难。他们表明,对于具有强注意力汇聚的模型,标准方法在理解机器的内部逻辑方面是不可靠的。通过分离这两个通道,研究人员现在可以观察到模型注意力的真实几何结构,从而区分出一个系统是在真正简化其思维,还是仅仅让它的第一个标记主导了对话。这种分离提供了一个更诚实的视角来观察这些复杂系统如何组织信息,确保未来的发现是基于它们思想的内容,而非测量方式的特性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。