Output Dilution: Redundant but Fragile Representations in MoE Models
本文揭示了尽管混合专家(MoE)模型在编码道德内容方面的冗余程度与稠密模型相当,但由于“输出稀释”现象——即激活专家的平均化过程剧烈降低了信号强度,使得编码信息即便在路由稳定的情况下也极易被噪声淹没——其表示形式显著更加脆弱。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能飞速发展的领域中,研究人员不断试图理解大型语言模型是如何思考的。这些能够撰写故事、解决问题并回答问题的系统,是由庞大的数学连接网络构建而成的。一种流行的网络设计被称为“专家混合”(mixture of experts)。想象一个庞大的专家团队,对于计算机处理的每一个句子,只有其中一小部分专家被允许工作,其余的则保持沉默。这种方法旨在通过为每项任务使用更少的资源,使计算机变得更快、更高效。对于那些致力于研究如何使这些模型与人类价值观对齐(确保其行为符合伦理且安全)的科学家来说,这种结构提供了一个诱人的可能性:如果道德推理是由一组特定的、孤立的专家模块处理的,研究人员就有可能仅通过调整或移除那组特定的专家来修正不良行为,而不必干扰系统的其他部分。这是一种针对复杂问题所采取的精准、外科手术式的解决方案。
然而,一项针对名为 OLMoE 的特定开源模型进行的新研究发现,这种希望是错位的。研究人员旨在观察这些“专家”模块究竟是在专门处理道德推理,还是它们都在做同样的事情。他们还想测试这些道德信号究竟有多强。结果令人惊讶。研究发现,该模型并没有一个专门的道德专家团队。相反,网络中每一个层级的每一个专家模块都包含了相同的道德信息。更重要的是,研究发现虽然这些道德信息确实存在,但它们极其脆弱。信息存在于系统中,但表达得如此微弱,以至于极少量的数字噪声就能将其抹除;相比之下,一个同等规模的标准模型则能轻易抵御同样的干扰。
这项调查首先检查了 OLMoE 模型的内部运作机制,该模型在 16 个层级中每个层级包含 64 个此类专家模块。研究人员训练了简单的检测器,以观察能否在每个独立模块的输出中发现道德概念。如果“专家混合”设计如预期般奏效,他们原本期望会发现只有少数特定模块擅长识别道德内容,而其他模块则专注于语法或事实等不同任务。然而,结果却恰恰相反。几乎每一个模块,无论其在网络中的位置如何,都能高精度地识别道德内容。这种能力的分布是完全均匀的:没有模块是专家,也没有模块是新手。决定哪些模块可以工作的路由也并未表现出将道德句子发送给特定专家的偏好,它对所有输入一视同仁。这意味着,拥有独立专家的结构优势并不能帮助隔离道德特征以进行针对性干预。
随后,研究人员将注意力转向一个更微妙的问题:这种道德信息的鲁棒性如何?他们将 OLMoE 模型与一个不使用专家系统、但具有相似活跃参数数量的标准“稠密”(dense)模型进行了对比。当他们测试这些模型在失去识别道德内容能力之前能容忍多少噪声时,显著的差异出现了。标准模型表现得非常坚固,能够承受显著的数字干扰而仍能保持其道德理解力。相比之下,OLMoE 模型则几乎立即崩溃。它比其标准对应模型脆弱了四倍以上。专家模型中的道德信号如此脆弱,以至于微小的静态噪声就足以将其完全淹没。
为了理解发生这种情况的原因,团队观察了信息如何在系统中流动。在标准模型中,处理单元向网络的下一阶段发送一个强大且清晰的信号。而在专家模型中,系统选择少数专家,对它们的输出取平均值,然后将结合后的结果向前传递。研究人员测量了这一结合信号的强度,发现它比标准模型中的信号要弱得多。信号被稀释了,其强度减小了近两个数量级。有一种可视化方式可以理解这一点:想象在一个拥挤的房间里交谈。在标准模型中,一个人用清晰、响亮的声音说话,每个人都能听到;而在专家模型中,就像是八个人在低声重复同一句话,而房间里只能听到这些低语的平均值。信息确实在那里,但它太微弱了,以至于一阵轻微的噪声之风就能让它变得无法辨听。
这一发现对于我们如何理解和控制这些系统具有深远的影响。研究表明,这种脆弱性并非由于模型在训练过程中未能正确学习所致。通过查看模型从最初步骤到最终形态的整个训练历史,研究人员确认了道德信息从一开始就存在,并且在整个过程中始终保持均匀分布且微弱。模型从未开发出专门的道德专家,也从未加强过这一信号。这种脆弱性是架构本身自带的特性。因为系统会对选定的少数专家输出进行平均,导致产生的信号本质上是微小的。这种微小的信号极易被噪声淹没,使得这些模型中的道德编码比传统设计中更不安全。
研究结论认为,专家混合设计的对齐研究承诺是一个幻象。虽然这种结构提供了一种将网络划分为离散单元的方法,但它并未创造出可以被轻松编辑或移除的孤立道德推理区域。相反,它将道德信息稀薄地分散在所有单元中,使其具有冗余性,但也变得极其脆弱。对于试图确保这些模型行为安全的专家来说,这意味着仅仅观察模型是否能在表面上识别道德概念是不够的。他们还必须衡量这些信息存储的安全性。一个模型在表面上可能表现得完美理解伦理,但其本身可能非常脆弱,以至于环境的微小变化或微调过程中的轻微调整,就可能导致它完全丧失这种理解力。研究表明,这些模型的构建方式从根本上改变了其内部信号的性质,造成了一种通过单纯训练无法修复的永久性结构性弱点。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。