← 最新论文
💬 NLP

DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning

本文提出动态方差自适应优势优化(DVAO),这是一种新颖的方法,它基于经验方差动态调整多奖励组合权重,以克服组相对策略优化中标准标量化方法存在的训练不稳定性和静态局限性,从而在使大语言模型对齐多个目标时实现更优越的性能与稳定性。

原作者: Guochao Jiang, Jingyi Song, Guofeng Quan, Chuzhan Hao, Guohua Liu, Yuewei Zhang

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Guochao Jiang, Jingyi Song, Guofeng Quan, Chuzhan Hao, Guohua Liu, Yuewei Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在训练一个非常聪明的机器人(大型语言模型)去完成一项复杂的工作。这项工作不仅仅是为了得到正确答案;它还要求快速不出错,并且严格遵守特定格式

在人工智能领域,这被称为“多奖励强化学习”。机器人会因不同的表现获得分数(奖励):

  1. 准确性:它是否解决了数学问题?
  2. 长度:它是否将答案控制在足够短的范围内?
  3. 格式:它是否使用了正确的工具语法?

问题:“音量旋钮”的困境

论文指出,当前教导机器人掌握多项技能的方式,就像试图用三种不同的原料调制鸡尾酒,却只有一个音量旋钮。

  • 方法 A(奖励组合):你在告诉机器人该做什么之前,先将各项分数混合在一起。问题在于:如果其中一种原料(例如“长度”)的分数出现剧烈波动,就会淹没其他信号。机器人会感到困惑,训练变得不稳定,甚至可能开始“大喊大叫”(产生巨大且 erratic 的更新),而不是进行学习。
  • 方法 B(优势组合):你分别测量每种原料,将其标准化,然后再进行混合。这种方式更为平稳,但它将每项技能视为孤立存在。它未能意识到,有时获得完美的答案有助于你保持在长度限制内,而有时它们又会相互冲突。它使用固定的配方(静态权重),即使机器人在某项特定技能上挣扎,这个配方也永远不会改变。

解决方案:DVAO(智能指挥家)

作者提出了一种新方法,称为DVAO(动态方差自适应优势优化)。

将 DVAO 想象成一位智能乐队指挥,他实时倾听各位乐手(不同的奖励)的表现。

  1. 倾听噪音:在任何一次练习(称为"rollout")中,指挥家会观察乐手们的波动程度。

    • 如果“准确性”乐手演奏的音符变化剧烈(高方差),这意味着机器人正处于学习新事物的边缘。指挥家会调大该信号的音量,因为这是一个强烈的学习机会。
    • 如果“长度”乐手反复演奏完全相同的音符(低方差),这意味着机器人已经掌握了它,或者该信号只是噪音。指挥家会调小音量,以免其干扰更困难的任务。
  2. “群体”效应:与旧方法孤立地看待各项技能不同,DVAO 关注技能在同一次尝试中的相互作用。如果机器人努力追求准确性却未能通过格式检查,DVAO 会调整学习信号以反映这一整体情况,而不仅仅是准确性分数。它充当一种“正则化器”,防止机器人过度执着于一项简单任务而忽视其他任务。

  3. 稳定性:论文从数学上证明,DVAO 能防止学习更新的“音量”失控爆炸。它确保机器人稳步学习而不至于失控,而这正是旧“奖励组合”方法存在的主要问题。

结果:更佳的平衡

作者在两项严峻的挑战中测试了该方法:数学推理(解决难题)和工具使用(让机器人正确调用外部工具)。

  • 旧方法:它们通常迫使人们做出权衡。如果你将机器人调校得非常准确,它的回答就会过长或破坏格式;如果你将其调校得简短,它又会算错数学题。
  • DVAO:它找到了“最佳平衡点”(帕累托前沿)。它能够在严格遵循长度限制和格式规则的同时,保持极高的准确性。它无需为了提升某项技能而牺牲另一项。

一句话总结

论文认为,旧有的教导 AI 掌握多项技能的方式,要么过于混乱(导致不稳定),要么过于僵化(忽视了技能之间相互促进或相互制约的关系)。DVAO 通过根据 AI 在当下时刻的实际学习程度,动态调整每项技能的重要性,从而解决了这一问题,造就了一个更智能、更稳定且平衡性更好的 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →