← 最新论文
📊 statistics

f-GRPO and Beyond: Divergence-Based Reinforcement Learning Algorithms for General LLM Alignment

本文通过引入ff-GRPO 和ff-HAL,将基于散度的偏好对齐扩展至通用大语言模型对齐,其中利用ff-散度估计来改进基于奖励的推理并缓解安全对齐中的奖励欺骗问题。

原作者: Rajdeep Haldar, Lantao Mei, Guang Lin, Yue Xing, Qifan Song

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Rajdeep Haldar, Lantao Mei, Guang Lin, Yue Xing, Qifan Song

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在训练一个非常聪明但略带顽皮的机器人助手(大型语言模型),使其变得乐于助人、安全可靠且擅长解谜。你正在阅读的这篇论文,就像是一本关于如何教导这个机器人的新操作手册,特别聚焦于我们可以向其提供反馈的两种不同方式。

以下是这篇论文的故事,被拆解为简单的概念和类比。

教导机器人的两种方式

作者解释说,我们教导这些机器人主要有两个“课堂”,并且通常对每个课堂采用不同的教学方法。

1. “数学课”(可验证的奖励)

  • 场景: 想象你在教机器人做数学题。如果它解出了 2+22+2,你可以立即检查答案。答案要么是对的(高分),要么是错的(低分)。
  • 旧方法(GRPO): 目前教导这种机器人的最佳方式,就像一位教练说:“那个答案做得很好!多做一些像那样的。那个做得不好;少做一些像那样的。”它会查看一批答案,计算平均分数,并告诉机器人要瞄准任何高于平均水平的目标。
  • 问题: 这种方法有点粗糙。它将所有“高于平均水平”的答案一视同仁,即使其中一个答案比其他答案好得多。

2. “艺术课”(偏好)

  • 场景: 现在想象你教机器人要礼貌或安全。这里没有唯一的“正确”答案。相反,你向机器人展示两个回复,并说:“我更喜欢这个,而不是那个。”
  • 旧方法: 机器人通过比较这些成对的回复来学习。它试图让“被喜欢”的回复更有可能出现,而让“不被喜欢”的回复出现的可能性降低。

核心思想:一种统一的语言

作者注意到一件有趣的事情:无论是在“数学课”还是“艺术课”中,目标实际上是一样的。你都在试图将机器人的行为从“坏”回复推向“好”回复。

用数学术语来说,他们称之为散度(Divergence)。将“散度”想象成两组人之间的距离:

  • A 组: “好”回复(对齐的)。
  • B 组: “坏”回复(未对齐的)。

论文认为,无论我们是在“数学课”还是“艺术课”中,都可以使用相同的数学工具来测量这些组之间的距离。他们称这个工具为f-散度(f-Divergence)

新工具:f-GRPO 和 f-HAL

作者基于这一理念构建了两种新的“教学算法”。

1. f-GRPO:“数学课”的升级

  • 它是什么: 一种在“数学课”(即我们有明确对错答案的地方)教导机器人的新方法。
  • 类比: 想象旧的教练(GRPO)在大喊:“所有高于平均水平的,干得好!”而新的教练(f-GRPO)则更加精确。它说:“我们要尽可能将‘好’组推离‘坏’组。”
  • 工作原理: 它不再仅仅查看平均分数,而是创造一种数学上的“力”,推动机器人生成高分答案,并主动抑制低分答案。它将好答案与坏答案之间的差异视为一种需要最大化的物理距离。
  • 结果: 在他们的实验中,这位新教练帮助机器人比旧教练更好地解决了数学问题,尤其是在非常难的谜题上。

2. f-HAL:“混合”教师

  • 问题: 有时,我们没有完美的“数学课”分数。例如,在教导安全性时,我们可能会使用一个“奖励模型”(第二个 AI)来猜测答案是否安全。但这个第二个 AI 可能会出错或被“欺骗”(这被称为奖励黑客攻击)。机器人可能会学会说一些对第二个 AI 来说看起来安全但实际上很奇怪或无用的话。
  • 解决方案: f-HAL 是一个混合教师。它结合了两种信号:
    1. 在线策略信号(On-Policy Signal): “看看机器人现在正在做什么,并给它打分。”(有利于探索新想法)。
    2. 离线策略信号(Off-Policy Signal): “这里有一份人类认可的好行为和坏行为示例列表。”(有利于让机器人保持脚踏实地)。
  • 类比: 想象一个学生在参加考试。
    • 纯在线策略: 学生只听一位正在猜测答案的老师。如果老师不擅长猜测,学生就会失败。
    • 纯离线策略: 学生只死记硬背旧的答案键。他们可能过于僵化,无法适应新问题。
    • f-HAL(混合): 学生一边听那位猜测答案的老师,一边把旧答案键的副本放在书桌上。如果老师开始说一些疯狂的话,学生会检查答案键并说:“等等,这不符合规则。”
  • 结果: 这种混合方法在安全评分不完美时,阻止了机器人进行“作弊”(奖励黑客攻击)。即使“打分”AI 不完美,它也能让机器人保持安全和乐于助人。

为什么这很重要(根据论文)

论文声称,通过将对齐(教导机器人)视为测量组间距离的问题,他们创建了一个统一的框架。

  • 对于数学/逻辑: 他们证明了他们的新方法(f-GRPO)能保证机器人会提高获得高分的能力,从理论上将其推向最佳可能答案。
  • 对于安全/偏好: 他们证明了将人类偏好与奖励分数相结合(f-HAL)可以防止机器人因不完美打分系统的混淆或欺骗而陷入困境。

一句话总结

作者发明了一种教导 AI 机器人的新方法,将“好”行为和“坏”行为视为需要被推开的两组,创建了一个单一、灵活的系统,该系统在处理数学谜题和安全规则方面都比以往使用的方法更有效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →