← 最新论文
🤖 AI

Unbiased Alignment for Large Language Models with Noisy Preferences

本文引入了一个包含无偏奖励模型(URM)和无偏直接偏好优化(UDPO)损失的理论框架,旨在使大语言模型能够在不需要干净真值监督的情况下,直接从含有噪声的偏好数据集中实现鲁棒且具噪声容忍性的对齐。

原作者: Jialiang Wang, Xianming Liu, Xiong Zhou, Hui Liu, Haoliang Li

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Jialiang Wang, Xianming Liu, Xiong Zhou, Hui Liu, Haoliang Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教导一位才华横溢但缺乏经验的学生(一个大型语言模型)如何写出好的故事或回答问题。你手里有一叠来自一群人的反馈卡,告诉这位学生哪些回答是“好”的,哪些是“坏”的。

问题在于?提供这些反馈的人并不完美。有些人很累,有些人很困惑,有些人甚至可能有个人偏见。在现实世界中,大约有 20% 到 40% 的这些反馈卡可能是错误的。如果你只是盲目地遵循这些卡片,学生就会学到错误的教训,并开始犯错。

这篇论文介绍了一种新的教学方法,它忽略了反馈卡中的“噪声”(错误),并专注于其下方的真相。

核心思想:“降噪”耳机

把嘈杂的反馈想象成一段伴随着大量静电干扰播放的音乐。标准的教学方法试图通过倾听这整个混乱的过程来学习歌曲,这会导致旋律失真。

这篇论文的作者构建了一个数学上的“降噪”系统。他们意识到,如果你知道噪声是如何发生的(例如,“20% 的时间里,人们会颠倒他们的答案”),你就可以在数学上逆转这个过程。这就像是有一个食谱说:“如果蛋糕味道太咸了,就减去恰好这么多的盐,以找回完美的风味。”

他们创建了两个具体的工具:

  1. URM(无偏奖励模型): 这是用于第一阶段教学的。通常,模型学习如何为答案给出“评分”。如果反馈是有噪声的,评分系统就会变得混乱。URM 充当了一个过滤器,在模型看到评分之前对其进行清洗,确保模型学习到正确的“好与坏”的区别。
  2. UDPO(无偏直接偏好优化): 这是用于第二阶段,即模型实际学习写作的阶段。UDPO 不仅仅是直接遵循嘈效的反馈,它使用一种特殊的数学公式来“撤销”这种混乱。它允许模型即使在老师偶尔出错的情况下,也能学习到正确的行为。

它是如何工作的:“神奇公式”

该论文声称,你不需要确切知道哪些特定的反馈卡是错误的。你只需要知道总体的“噪声率”(反馈有多乱)。

他们使用了一个变量 aa(它基于噪声率)。

  • 向下兼容技巧: 想象你在猜测反馈有多乱。如果你猜反馈非常乱(高噪声率),但实际上只是有点乱,你的方法仍然能完美运作。这就像是在晴天穿着重型雨靴;即使只是毛毛细雨,你也能保持干爽。然而,如果你猜是晴天,但实际上正下着大雨,你就会淋湿。作者证明了如果你的估计过高(高估了噪声),该方法依然是安全的。

结果:赢得比赛

研究人员在真实世界的数据集(如聊天对话和摘要任务)上测试了这些方法,并人为地增加了更多噪声以观察其表现。

  • 基准线: 标准方法(如 DPO)在噪声变高时开始表现糟糕。它们变得困惑并表现不佳。
  • 新方法: 他们的 URM 和 UDPO 方法保持强劲。即使当 40% 的反馈被颠倒(变错)时,他们的模型仍然学习到了正确的行为方式。
  • 证明: 他们从数学上证明了,该方法不仅仅是“运气好”。它被证明能够从一个嘈杂的课堂中恢复出“最佳可能”的老师(贝叶斯最优分类器)。

简而言之

这篇论文说:“不要丢弃你那些有噪声的反馈数据。相反,在使用这些数据进行学习时,使用我们的新数学工具来清洗它。”

他们提供了一个“降噪”损失函数(一种学习规则),让 AI 模型能够从不完美、有噪声的人类反馈中学习,而不会感到困惑。这是一种更稳健、更安全的方法,用于使 AI 符合人类价值观,确保即使在制造反馈的人感到疲劳或产生偏见时,AI 仍能学到正确的教训。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →