← 最新论文
🤖 AI

Beyond Routing Weights: Faithful Response-Level Interpretation of Mixture-of-Experts Reward Models via Contribution Contrast

本文介绍了贡献对比(Contribution-Contrast, CoCo),一种针对混合专家(Mixture-of-Experts)奖励模型的创新响应级解释方法,该方法通过识别具有最大贡献对比的“被选中-被拒绝”响应对来确定专家的角色,从而克服了基于路由权重分析的局限性,在保持竞争力的准确性的同时,提供了更具忠实度和专业性的解释。

原作者: Yifan Wang, Jinyi Mu, Mayank Jobanputra, Yu Wang, Soyoung Oh, Isabel Valera, Vera Demberg

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Yifan Wang, Jinyi Mu, Mayank Jobanputra, Yu Wang, Soyoung Oh, Isabel Valera, Vera Demberg

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人变得乐于助人、善良且聪明。你不能仅仅用一套死板的规则手册来编程,因为人类的偏好是混乱且复杂的。相反,你向机器人展示成千上万个“好”答案与“坏”答案的例子,让它学习人类喜欢什么。这就是**基于人类反馈的强化学习(RLHF)*的世界,这种技术帮助巨大的 AI 聊天机器人与我们的价值观保持一致。为了实现这一点,AI 使用了一个“奖励模型”(Reward Model),它就像一个严格的老师在给机器人的作业打分。但棘手之处在于,有时这个老师是一个“黑盒”。我们知道它会给出一个好的答案高分,但我们不知道它为什么*决定这么做。是因为答案很有趣?因为它很礼貌?还是因为它遵循了特定的格式?

为了解决这个问题,研究人员最近尝试构建了一种“混合专家”(Mixture-of-Experts, MoE)奖励模型。不要把它看作一个庞大的老师,而要看作一个由 20 位不同专家组成的教室。当一个问题进来时,一个“路由”(Router,就像一位校长)会查看问题,并决定哪位专家应该来评分。也许一位专家擅长数学,另一位擅长创意写作,还有一位擅长提供法律建议。目标是通过观察这些专家接收到了哪些问题,使它们变得易于理解。但正如我们即将探讨的这篇论文所暗示的,仅仅知道接到了问题,并不能告诉你他们是如何评分的。

这篇名为《超越路由权重》(Beyond Routing Weights)的论文介绍了一种窥探这些 AI 专家内心世界的新方法。作者们(来自萨尔兰大学及其他机构的团队)认为,仅仅观察一个专家接收了哪些问题,就像是在不品尝菜肴的情况下,仅凭递交给厨师的食材来评判一位厨师。因此,他们提出了一种名为 贡献-对比(Contribution-Contrast, CoCo) 的方法。CoCo 观察的是专家在区分“好”答案与“坏”答案时,其观点产生最大差异的具体时刻。通过比较这些配对,CoCo 能够揭示专家究竟在关注什么——是“简洁性”还是“循序渐进的逻辑”——而不仅仅是他们通常处理的主题。研究人员在两个大型数据集上测试了该方法,发现 CoCo 提供了一个更清晰、更诚实且更详细的图景,展示了这些 AI 专家实际在做什么,且完全没有降低 AI 执行任务的准确性。

问题所在:“校长”与“厨师”

在 AI 奖励模型的世界里,“混合专家”设置就像一所拥有校长和许多老师的学校。校长(路由)阅读学生的提问,并决定哪位老师最适合对其进行评分。如果问题是关于烹饪的,校长会将它发送给“烹饪专家”。如果是关于编程的,它就会被送到“编程专家”那里。

有一段时间,研究人员认为只要通过查看校长的笔记就能理解这些专家。他们会说:“啊,烹饪专家主要接收关于烘焙的问题,所以他们一定是‘烘焙专家’。”这被称为观察路由权重(Routing Weights)

但本文的作者意识到,这有点像是在不品尝厨师烹饪出的菜肴,而仅凭递交给他们的食材来评判厨师。仅仅因为烹饪专家收到了一个关于烘焙的问题,并不能告诉你他们是如何评判答案的。他们是喜欢详细的食谱?还是讨厌冗长的解释?他们是否在意安全提示?路由权重只告诉了你接到了工作,却没有告诉你他们是如何完成工作的。这是一个残缺的故事,遗漏了最重要的部分:实际的决策过程。

解决方案:CoCo(贡献-对比)

为了解决这个问题,团队发明了 CoCo,即贡献-对比(Contribution-Contrast)。与其仅仅询问“谁得到了这个问题?”,CoCo 问的是:“哪位专家在决定这个答案比那个答案更好时,发挥了最大的作用?”

想象你是一名烹饪比赛的评委。你有两道菜:一个是完美的千层饼,另一个是稍微烤焦了的。

  • 旧方法(路由权重): 你查看计分卡,看到被分配给“意大利专家”来评判这一轮。你得出结论:“意大利专家喜欢面食。”但你不知道他们喜欢这道千层饼是因为它奶酪丰富、热气腾腾,还是因为它上面有罗勒。
  • CoCo 方法: 你查看计分卡,看到“意大利专家”在对比那道烤焦的菜时,给这道千层饼带来了巨大的加分,而其他专家大多保持中立。于是 CoCo 说:“啊哈!这位意大利专家特别喜爱带有奶酪、热气腾腾且点缀着罗勒的千层饼。”

CoCo 的工作原理是寻找专家意见成为决定性因素的答案对。它将两件事相乘:

  1. 该专家获得该问题的可能性(路由权重)。
  2. 该专家的评分对最终结果产生了多大的改变(“好”答案与“坏”答案之间的差异)。

通过聚焦于这些高影响力的时刻,CoCo 可以生成一个忠实于专家实际行为的描述。它不仅仅说“这个专家处理烹饪问题”,它会说“这个专家比起模糊的建议,更倾向于详细、循序渐进的烹饪指令”。

研究发现:更清晰的图景

研究人员将 CoCo 与其他方法进行了对比测试,包括旧有的“路由权重”方法,以及一些使用所谓“稀疏自编码器”(Sparse Autoencoders,类似于在巨大的数据堆中寻找隐藏模式)的复杂技术。他们在两个巨大的数据集上进行了测试:一个包含 70 万个样本,另一个来自 Reddit。

结果非常明确。CoCo 生成的解释具有以下特点:

  • 更具忠实度(More Faithful): 描述与专家在 AI 决策过程中的实际行为高度吻合。当研究人员从 AI 中移除该专家时,AI 的行为变化正如 CoCo 所预测的那样。
  • 更具专业性(More Specialized): 被 CoCo 描述的专家拥有非常鲜明的个性。一位可能是“严厉的语法警察”,而另一位则是“创意讲述者”。其他方法往往会产生模糊或重复的描述。
  • 同样准确(Just as Accurate): 至关重要的是,使用 CoCo 来理解专家并没有降低 AI 的性能。奖励模型在挑选最佳答案方面依然表现得同样出色。

在人类测试中,人们在阅读了专家的描述后,认为 CoCo 的描述是最连贯且最有用的。他们能够真正理解这个“教室”里的每位“老师”擅长什么。

为什么这很重要

这篇论文表明,如果我们想要真正理解 AI 是如何做出决策的,我们需要超越表面现象。仅仅知道一个 AI 专家处理什么主题是不够的;我们需要知道他们是如何评估响应质量的。CoCo 提供了一种方法来实现这一点,而无需重新训练 AI 或添加复杂的全新层。它是一个用于“审计”AI 的工具,帮助我们观察我们的数字老师是否真的在教授我们所认为的内容。

作者谨慎地指出,这并不是一个能揭示 AI “真实”隐藏思想的魔杖。解释的质量取决于 AI 最初被训练得有多好。如果训练数据是混乱的,那么专家也可能是混乱的。然而,在现有技术的限制范围内,CoCo 为我们提供了观察这些专门化 AI 奖励模型内心世界的、最诚实且最详细的窗口。它让我们从“根据专家接触的对象来猜测他们的行为”,转向了“理解他们究竟是如何评判所做的工作”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →