← 最新论文
💬 NLP

Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization

本文介绍了奖励去相关策略优化(RDPO),这是一种新颖的方法,它利用幅度感知分位数归一化和马氏白化来稳定多奖励强化学习中的优势估计,从而在不损害推理或编码能力的前提下,提升模型在指令遵循、写作和鲁棒性方面的表现。

原作者: Yang Bai, Kaiyuan Liu, Ziyuan Zhuang, Jiahong Zhou, Rongxiang Weng, Xin Chen, Jingang Wang, Xunliang Cai

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Yang Bai, Kaiyuan Liu, Ziyuan Zhuang, Jiahong Zhou, Rongxiang Weng, Xin Chen, Jingang Wang, Xunliang Cai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在训练一个非常聪明的机器人(人工智能)同时完成多种不同的任务:撰写故事、解决数学问题、编写软件以及遵循严格的指令。为了教导这个机器人,你会在它每一次尝试后给予反馈(奖励)。

问题在于,这些反馈信号杂乱无章。有些是简单的“通过/不通过”等级(如同二进制开关),有些是 0 到 100 的分数,还有些是复杂的意见。此外,这些信号经常相互重叠。例如,一个长篇回答可能因“详尽”而得分,却因“过于冗长”而扣分,而“详尽”的分数可能在数学上与“冗长”的分数相关联。

当你试图将这些混杂的分数加总,以告知机器人如何改进时,训练过程会变得混乱不堪。机器人可能会因某个巨大的分数而感到困惑,忽略其他信号,或者因为两个信号相互冲突而陷入死循环。

本文作者提出了一种名为**RDPO(奖励去相关策略优化)**的新方法来解决这一混乱局面。可以将 RDPO 视为一个两步走的“信号净化器”,在机器人从中学习之前对反馈进行预处理。

第一步:“公平过滤器”(幅度感知分位数归一化)

问题所在: 想象你在给一个班级打分。一名学生得了 100 分,另一名学生得了 99 分,第三名得了 0 分。如果你只看原始数字,99 分和 100 分之间的差距看起来微乎其微,但 0 分和 99 分之间的差距却巨大无比。在人工智能训练中,如果某种类型的奖励(例如“通过/不通过”检查)存在巨大差距,它可能会淹没所有其他反馈,导致机器人只关注这一项而忽略其他一切。

解决方案: RDPO 使用一种名为幅度感知分位数归一化的“公平过滤器”。

  • 工作原理: 它不关注原始数值,而是关注尝试之间的排名差距。它会压缩巨大的差距(使 100 分不会无限优于 99 分),同时拉伸微小的差距(使 99 分和 100 分仍然保持区分度)。
  • 类比: 想象一场比赛,一名选手用时 10 秒,另一名选手用时 100 秒。如果只看时间,第二名选手的表现显得极差。但如果你对比赛进行归一化,让每个人根据相对于群体的表现来评判,那么第二名选手就能获得公平的改进机会,而不会被第一名选手的巨大优势所压垮。这确保了没有任何一次“糟糕”或“异常”的尝试会劫持机器人的学习过程。

第二步:“降噪器”(马氏白化)

问题所在: 有时,反馈信号是冗余的。想象你有两个传感器:一个测量“机器人说了多少”,另一个也测量“机器人说了多少”。如果你将这两个分数相加,你就对同一信息进行了重复计算。或者,想象两个传感器是相反的:一个说“要更长”,另一个说“要更短”。如果你只是将它们相加,它们会相互抵消,导致机器人得不到清晰的指导方向。

解决方案: RDPO 使用一种名为马氏白化的“降噪器”。

  • 工作原理: 它观察不同反馈信号之间的关系。如果两个信号说的是同一件事(相关),它会降低其中一个的权重,以避免重复计算。如果它们相互冲突,它会调整它们,使机器人获得清晰、平衡的指令。
  • 类比: 想象一个乐队,鼓手和贝斯手正在演奏完全相同的节奏。听起来浑浊且冗余。“降噪器”就像一位音响工程师,稍微调低贝斯的音量,使节奏部分听起来清脆清晰,而不是浑浊。这确保了机器人从独特的信息中学习,而不是从重复的噪声中学习。

结果

作者在名为LongCat-Flash的大型人工智能模型上测试了这种方法。他们在四种类型的任务上训练了该模型:

  1. 指令遵循: 完全按照你的要求行事。
  2. 通用写作: 创作高质量的故事或文章。
  3. 数学推理: 解决逻辑谜题。
  4. 编程: 编写计算机程序。

发生了什么?

  • 写作与指令: 机器人在遵循指令和撰写高质量文本方面有了显著提升。在面对困难或棘手的提示时,它变得更加稳健。
  • 数学与编程: 机器人的表现与之前的最佳方法持平。它在数学和编程方面没有变差;它在其他任务表现大幅提升的同时,保持了在这些领域的竞争力。

核心结论

该论文声称,通过在人工智能学习之前清理反馈信号(使其公平并消除冗余),训练过程变得更加稳定。这使得人工智能能够在提升复杂多任务能力(如写作和遵循规则)的同时,不丧失解决数学问题或编写代码的能力。这是一种更聪明的方法,用于混合不同类型的表扬与批评,使人工智能能够学到正确的经验。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →