RARE: Decoupling Representation Steering from Expert Routing in Mixture-of-Experts Language Models
该论文介绍了 RARE,这是一个与路由无关的框架,它通过将行为扰动投影到路由器的零空间中,将表示引导与专家路由解耦,从而在显著提高针对有害性、真实性和事实编辑的引导有效性的同时,保留了模型的效用。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大语言模型是现代人工智能背后的引擎,能够创作故事、解决问题并回答问题。为了使这些庞大的系统变得高效,许多模型现在采用了一种被称为“混合专家”(mixture of experts)的设计。想象一个大型办公室,经理会接收每一个进来的请求,并决定由哪位特定的专家来处理。在这些模型中,“经理”是一个路由机制,它观察句子的每一个词,并将其发送给一小组专门的内部处理器,即“专家”,而不是在执行每项任务时都动用计算机的整个大脑。这使得模型能够变得极其庞大且聪明,同时保持运行的高速与经济。
研究人员长期以来一直寻求如何引导或“操纵”这些模型,使其表现出特定的行为,例如使其更加诚实或降低生成有害内容的概率。一种流行的方法是在模型的思考过程中,通过微调其内部数学状态来进行引导,这种方法在那些每个部分都始终处于活跃状态的旧型、简单模型中效果良好。然而,当科学家们尝试将这种相同的微调技术应用于新型的混合专家模型时,往往会失败。问题在于,旨在改变行为的微调同时也意外地干扰了“经理”,导致它将请求发送给了错误的专家。这种不匹配破坏了模型的自然流转,导致结果不佳。
一组研究人员现在通过开发一种名为 RARE 的新框架解决了这个难题。他们的工作揭示了一个关键洞察:这些模型中的“经理”主要关注的是请求的主题,而不是模型预期表现出的特定行为。无论用户是询问关于编程的问题,还是要求模型拒绝一个有害的请求,只要主题保持不变,经理往往会将请求发送给同一组专家。研究人员发现,旧方法之所以失败,是因为它们试图通过改变数据的路径来改变行为,从而迷惑了经理。而他们的新方法则是在不改变路径的情况下改变行为。
RARE 框架通过在应用“微调”之前进行仔细过滤来发挥作用。它移除了指令中任何会导致经理改变其选择哪些专家的部分。通过这样做,模型会继续将请求发送给正确的专家,但这些专家随后会以产生预期行为的方式来处理信息。研究人员在六种不同的主流模型以及三个截然不同的任务上测试了这种方法:使模型减少有害性、提高其诚实度,以及更新其掌握的特定事实。
结果令人瞩目。在试图阻止模型遵循有害指令时,新方法的成功率达到了 53.3%,较之前的尝试有了显著提升,同时仍保持了模型在通用知识测试中 67.8% 的准确度。在诚实度测试中,该方法将模型给出正确答案的能力从 41.0% 提高到了 58.6%。或许最令人震撼的是,当被要求更新一个特定事实时,成功率从 16.8% 跃升至 96.3%。这些数字表明,通过尊重模型的内部路由系统,研究人员可以有效地引导其行为,而不破坏其底层的智能。
该研究还比较了五种计算必要微调量的不同方法,以找出哪种效果最好。他们发现,一种基于分析数据形状和分布(而非仅仅是其平均方向)的方法,在所有不同模型中提供了最一致且最强大的结果。这一发现表明,内部数据的几何特征与变化的直接方向同样重要。
最终,这项研究证明,控制现代复杂 AI 模型的行为需要一种微妙的平衡。你不能简单地强行改变;你必须在模型的现有架构内进行操作。通过保留模型为给定主题所选择的自然路径,就可以引导其输出趋向于安全、真实或准确。这种方法提供了一种可靠的方式,可以在不损害通用能力的前提下,使这些强大的工具适应特定需求,为使人工智能更符合人类价值观提供了一条清晰的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。