← 最新论文
💬 NLP

AdaJudge: Adaptive Multi-Perspective Judging for Reward Modeling

AdaJudge 是一个统一的框架,它通过将骨干表示共同适配到判别导向空间,并将静态池化替换为自适应多视图聚合模块,从而增强了奖励建模,并在关键基准测试上超越了现有模型。

原作者: Yongliang Miao, Yangyang Liang, Mengnan Du

发布于 2026-06-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Yongliang Miao, Yangyang Liang, Mengnan Du

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在雇佣一位法官来评判两个故事中哪一个更好。在人工智能的世界里,这个“法官”被称为奖励模型(Reward Model)。它的工作是观察一个问题和两个可能的答案,然后给出一个分数,以说明人类会更倾向于哪一个。

长期以来,这些 AI 法官一直使用一种非常僵化、一刀切的方法来履行职责。AdaJudge 这篇论文指出这种旧方法存在缺陷,并提出了一种更聪明、更灵活的方式来构建这些法官。

以下是问题的拆解与解决方案,使用了简单的类比:

问题:“单招”法官

想象一位法官只有两种读书的方式:

  1. “最后一页”法官: 这位法官只读故事的最后一句,以此来决定故事是否优秀。
  2. “平均页面”法官: 这位法官会阅读每一页,计算平均质量,并根据这个结果做出决定。

论文指出,这两类法官都有一个严重的盲点:

  • “最后一页”法官擅长捕捉那些结局糟糕的故事(比如数学题算错了答案),但他们会忽略故事的中间部分是否充满了谎言或逻辑错误。
  • “平均页面”法官擅长察觉整个故事是否感觉安全且礼貌,但如果故事长达 100 页,那么其中的“坏”部分可能会被大量的“好”部分所稀释,使得一个危险的故事看起来很安全。

类比: 这就像是在评判一道复杂的菜肴。

  • 如果你只品尝最后一口(Last Token),你可能会错过整碗汤其实一直很咸。
  • 如果你从中间舀一勺(Mean Pooling),你可能会错过最后的甜点其实烤焦了。
  • 旧的 AI 法官被迫在这些“品尝方法”中选其一,并且无论在评判什么样的“食物”(任务)时都必须坚持这一种方法。这导致了错误的发生。

解决方案:AdaJudge(自适应法官)

作者创建了 AdaJudge,这是一个新的框架,它扮演着一个聪明的、多视角的侦探的角色。AdaJudge 不再强迫 AI 只能用一种方式阅读文本,而是根据它正在回答的具体问题来改变策略。

它分为两个阶段:

第一阶段:磨炼镜头(自适应表示精炼)

在法官开始阅读之前,AdaJudge 会给 AI 的大脑进行一次“体能训练”。

  • 类比: 想象 AI 的大脑是一个模糊的相机。在拍摄答案的照片之前,AdaJudge 使用一个特殊的滤镜来锐化图像。它会突出那些细微的线索(比如一个微小的逻辑错误或隐藏的安全违规),而这些线索是普通相机通常会错过的。
  • 运作方式: 它通过几个额外的、轻量级的层来“精炼”信息,使 AI 更容易识别出优秀答案与糟糕答案之间的差异。

第二阶段:动态专家组(多视角聚合)

这是核心创新。AdaJudge 不仅仅设立了一位法官,而是建立了一个由三位专家组成的专家组,并且配备了一位聪明的经理来决定应该听取每位专家的多少意见。

  • 专家 A(最后 Token): 专注于最终结论。
  • 专家 B(平均值): 观察整体氛围和一致性。
  • 专家 C(注意力机制): 扫描全文以寻找特定的、零散的线索(例如隐藏在第 3 段中的安全违规行为)。

聪明的经理(路由程序/Router):
当一个问题进来时,经理会观察提示词(Prompt)并询问:“这是一个什么样的任务?”

  • 如果是数学题: 经理会说:“我们需要仔细检查最终答案!”然后主要听取专家 A的意见。
  • 如果是安全问题: 经理会说:“我们需要扫描全文以寻找隐藏的危险!”然后主要听取专家 C的意见。
  • 如果是创意写作任务: 经理会说:“让我们看看流畅度和语调,”然后主要听取专家 B的意见。

这一切都是针对每一个问题即时发生的。AI 不仅仅是在选择一种策略;它是在进行自适应

结果

论文将这种新的法官与旧有的“单招”法官以及一些非常庞大、昂贵的 AI 模型进行了对比测试。

  • 更高的准确度: AdaJudge 在困难的基准测试(RM-Bench 和 JudgeBench)中表现得持续更高。
  • 高效性: 即使使用较小的、更便宜的 AI 模型作为基础,AdaJudge 的表现也优于那些使用旧有、僵化方法的更大、更昂贵的模型。
  • 灵活性: 它解决了“数学 vs 安全”的冲突。它既能在数学逻辑上保持严谨,又能在安全检查上保持彻底,而旧有的法官必须在两者之间做出牺牲。

总结

AdaJudge 就像是从一位总是用放大镜看最后一页的法官,升级到了一位拥有专家团队和聪明经理的法官。经理观察案件,决定需要哪位专家,并将他们的见解结合起来,做出尽可能最公正、最准确的决定。这使得 AI 对齐(教导 AI 遵循人类偏好)变得更加可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →