← 最新论文
🤖 machine learning

PAIR: Pairwise-Aware Inclusion Reweighting for Adaptive Rollout Allocation in RLVR

本文介绍了 PAIR,一种用于具有可验证奖励(RLVR)的强化学习中自适应展开分配的新颖方法,该方法通过将展开交互建模为对比图并应用成对感知包含重加权,从而纠正了逐点估计器的统计偏差,进而实现比现有方法更高的准确度且生成的标记数量显著减少。

原作者: Pixel Nomand, Elena Voss, Marcus Hale, Sofia Reyes

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Pixel Nomand, Elena Voss, Marcus Hale, Sofia Reyes

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在举办一场盛大的烹饪比赛,旨在教一个机器人厨师制作完美的舒芙蕾。在人工智能的世界里,这被称为“具有可验证奖励的强化学习”(Reinforcement Learning with Verifiable Rewards, RLVR)。机器人尝试烹饪一道菜,计算机裁判进行品尝,如果做得好,机器人就会得到一分。为了快速学习,机器人不仅仅是做出一道菜,而是同时制作出一整组菜肴。然后,它会观察这一组菜肴并说:“好吧,这个是最好的,而那个是最差的。我要从它们的差异中学习。”

棘手之处在于,制作这些菜肴是非常昂贵的。生成每一步食谱需要消耗大量的计算能力和时间。因此,研究人员一直在尝试聪明地决定哪些食谱值得完成。通常情况下,他们会观察食谱的开头(“前缀”),然后猜测:“这个看起来很有前景,让我们把它做完,”或者“那个看起来很乏味,我们停下来吧。”他们将每一份食谱都视为一个独立的参赛者。但如果一份食谱的价值并不在于其自身有多好,而是在于它如何与邻居进行比较呢?如果真正的教训隐藏在两份食谱的“对子”中,而非单份食谱本身呢?这就是一篇新论文试图解决的谜题。

这篇名为 PAIR(成对感知包含重加权,Pairwise-Aware Inclusion Reweighting)的论文认为,旧的方法忽略了一个关键的统计技巧。作者发现,当机器人从一组菜肴中学习时,它实际上并不是在从单份菜肴中学习,而是在从组内每一对可能的菜肴之间的“关系”中学习。这就像一个舞池,乐趣不在于某一个人跳得有多好,而在于每对舞伴之间的化学反应。

当前方法的问题在于,它们表现得像一个只允许“看起来最好”的舞者进入的保镖。如果保镖仅根据舞者最初的几步舞步就挑选出最优秀的舞者,那么选出的群体跳舞方式都会非常一致。缺乏对比,缺乏张力,因此也就没有有趣的教训可以学习。论文表明,通过提前停止某些食谱的生成并完成另一些食谱,研究人员无意中创造了一个有偏差的群体,即其中的“对子”不再是随机的了。他们挑选的对子过于相似,这破坏了数学逻辑。

为了解决这个问题,作者构建了一个名为 PAIR 的新系统。与其仅仅猜测哪份食谱是最好的,PAIR 将整个群体视为一个巨大的连接网络。想象一个图(graph),其中每一份食谱都是一个点(顶点),而每两个食谱之间所有可能的比较都是连接它们的线(边)。计算成本支付在生成“点”(食谱)上,但学习的“价值”发生在“线”(比较)上。

以下是 PAIR 在实践中的运作方式:

  1. 品尝测试:系统为每个候选食谱生成一个短小的“前缀”——只需足以感受其风味即可。
  2. 水晶球:利用这些简短的开头,一个小型预测器会预测两件事:“这份食谱很可能成功吗?”以及“完成它还需要多少计算能力?”
  3. 智能预算:与其挑选“最好”的那些,PAIR 使用一种巧妙的数学技巧(凸设计/convex design)来决定完成哪些食谱。它确保即使是一份看起来有风险的食谱,仍有微小的机会被完成。这至关重要,因为它保持了“网络”连接的开放性。
  4. 修正:这是神奇的秘方。因为系统并没有选择所有的食谱,所以一些连接(对子)缺失了。PAIR 会精确计算看到每个对子的概率,并使用这个数值来“重加权”学习过程。如果一个对子很难被观测到,它的教训就会被赋予更高的权重,以弥补缺失的数据。

结果令人印象深刻。在对 Qwen3-1.7B 和 Qwen3-4B 等 AI 模型进行测试时,PAIR 成功让机器人厨师变得更聪明,同时减少了约 51% 到 52% 的生成 Token(计算步骤)。与次优方法相比,它将模型的平均准确率提高了 +1.2 到 +1.4 个百分点

作者非常谨慎地指出,这不仅仅是运气好。他们从数学上证明了其方法是“设计无偏的”(design-unbiased),这意味着如果运行实验足够多次,平均结果将完美命中真实目标,尽管他们只观察了部分数据。他们还进行了“冻结群体”(frozen population)审计,这类似于对一组固定的食谱进行快照,并重复运行数千次选择过程,以观察数学逻辑是否成立。结果证明,逻辑确实成立。

然而,论文也警告说,这个系统依赖于“水晶球”(预测器)具备相当高的准确性。如果预测器无法准确判断哪些食谱会成功,系统可能会将预算浪费在错误的对子上。但当预测器表现良好时,PAIR 将 AI 训练这一混乱的过程转化为了一个高度高效且在数学上严谨的“连点成线”游戏,证明了有时,为了学到最多的东西,你不需要看到一切——你只需要看到正确的连接。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →