← 最新论文
🤖 machine learning

DynaCF: Mitigating Shortcut Learning in Reward Models via Dynamic Counterfactual Sensitivity

该论文提出了 DynaCF,这是一个动态重加权框架,通过利用反事实扰动在线测量捷径敏感性,并在训练过程中降低敏感样本的权重,从而缓解奖励模型中的捷径学习问题,以鼓励模型依赖真实的偏好信号。

原作者: Fengyuan Liu, Yongliang Miao, Zirui He, Yanguang Liu, Fei Sun, Mengnan Du

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Fengyuan Liu, Yongliang Miao, Zirui He, Yanguang Liu, Fei Sun, Mengnan Du

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在雇佣一名老师来批改学生的论文。你的目标是让这位老师根据思想的好坏来评判论文。然而,这里有一个问题:这位老师很懒,并且开始寻找捷径。他们不再阅读深刻的思想,而是只看一些表面的东西,比如:

  • “这篇论文是不是真的很长?”(越长 = 越好)
  • “它有没有花哨的列表符号?”(格式精美 = 越好)
  • “它听起来是不是超级自信?”(语气礼貌 = 越好)

如果这位老师依赖这些捷径,他们可能会给一篇空洞但华丽的论文打 A,而给一篇深刻但简短的论文打 C。这正是**奖励模型(Reward Models)**在 AI 中发生的情况。这些奖励模型就是教导 AI 聊天机器人什么是人类所喜好的“老师”。但通常情况下,这些 AI 老师会通过关注风格而非实质来“作弊”。

本文介绍了一种名为 DynaCF 的新方法来阻止这种作弊行为。以下是它的工作原理,使用一个简单的类比:

问题所在:“重风格轻实质”的老师

过去,研究人员试图通过列出一份“坏习惯”清单(例如“不喜欢长篇大论”)并告诉老师忽略这些习惯来解决问题。但本文认为,这就像是用一本静态的规则手册来试图阻止作弊者。作弊者会适应!如果你禁止长篇大论,他们可能会开始使用花哨的字体。如果你禁止了字体,他们可能会使用更多的列表符号。虽然“捷径”改变了,但作弊行为依然存在。

解决方案:DynaCF(“现实检查”教练)

DynaCF 就像一位实时观察老师评分过程的教练,并对每一篇论文进行 “如果……会怎样?”测试

  1. “如果……会怎样”测试(反事实测试):
    假设老师刚刚批改了一篇论文,并因为它很长且带有列表符号而给了高分。

    • DynaCF 介入并说:“等等。让我们拿这篇完全相同的论文,但是去掉列表符号并缩短篇幅,同时保持其完全相同的思想。”
    • 这就是“反事实(Counterfactual)”部分:一个在含义上完全相同但在风格上有所不同的版本。
  2. 现实检查(敏感度):
    DynaCF 要求老师对这个新的、更短的版本进行评分。

    • 场景 A(优秀的老师): 老师说:“嗯,思想仍然很棒。分数也差不多。”这意味着老师是在关注内容
    • 场景 B(作弊的老师): 老师惊慌失措地说:“噢不!它变短了而且没有列表符号了!分数减半了!”这意味着老师在通过依赖长度和格式来作弊,而不是看思想。
  3. 动态惩罚(重新加权):
    这就是 DynaCF 的魔力所在。它并不只是开除老师或删除论文,而是调整老师从那篇特定论文中学到的程度。

    • 如果老师在“如果……会怎样”测试中失败了(场景 B),DynaCF 会说:“好吧,我们知道你在这一篇上作弊了。我们会调低这一篇论文的权重(音量),这样你就不会从错误的教训中学到错误的东西。”
    • 如果老师通过了测试(场景 A),DynaCF 会说:“做得好!我们会调高这一篇论文的权重(音量),以便你从这个优秀的例子中学习。”

为什么“动态”很重要

本文强调这不仅仅是一次性的修复。老师可能在周一作弊,但到周五就能学会诚实。

  • 静态方法 就像是在学年开始时写好的一本规则手册。它会过时。
  • DynaCF 就像是一位在每次练习期间每天都会检查老师工作的教练。它会询问:“你现在在作弊吗?”并立即进行调整。

结果

作者在各种基准测试(如 RM-Bench 和 RewardBench)上对 AI 模型(特别是 Qwen3 模型)进行了测试。

  • 结果: 使用 DynaCF 训练的模型变得更擅长忽略“虚假”的风格技巧,转而关注答案的实际质量。
  • 证明: 当测试“难题”(在这种题目下风格技巧不起作用)和“安全性”问题(在这种问题下你不能仅仅通过表现得有礼貌来掩盖错误)时,DynaCF 模型的得分显著高于标准模型。

简而言之

DynaCF 通过不断询问:“如果我们改变了表面风格但保留了含义,你的观点会改变吗?”来阻止 AI “玩弄系统”。如果答案是“是的”,那么 AI 会被告知暂时忽略这个特定的例子。这迫使 AI 去学习什么才是真正让回答变好的因素,而不仅仅是学习什么看起来很好。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →