← 最新论文
🤖 machine learning

HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime

本文提出了滞回策略优化(HPO)及其自适应变体(A-HPO),旨在通过在稀疏奖励条件下对负优势更新进行降权处理,并将按响应长度归一化替换为平均长度归一化,以解决 GRPO 风格强化学习中的早期训练不稳定性问题,从而在各种基准测试和模型规模上实现更优越的性能与稳定性。

原作者: Mohamed Sana, Nicola Piovesan, Antonio De Domenico, Fadhel Ayed, Haozhe Zhang

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Mohamed Sana, Nicola Piovesan, Antonio De Domenico, Fadhel Ayed, Haozhe Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人解决一个难题,比如一道复杂的数学题或一项网络故障排查任务。你给机器人一个提示,它尝试生成答案。有时它能答对;但大多数时候,尤其是在初期,它会答错。

本文介绍了一种训练这些机器人的新方法,称为滞回策略优化(Hysteretic Policy Optimization, HPO)。这是对现有方法(GRPO)的一种改进,当机器人在寻找正确答案而挣扎时,它能显著加快学习速度并提高稳定性。

以下是使用简单类比进行的分解说明:

问题所在:“嘈杂的课堂”

在当前的训练方法(GRPO)中,老师(算法)会审视机器人尝试的 8 个批次。

  1. “罕见成功”问题:在困难任务中,机器人可能 8 次尝试中只有 1 或 2 次答对,其余 6 次都是错的。
  2. “音量”问题:当前方法对待每一个错误答案和正确答案一样严肃。由于错误答案数量众多,老师最终对每一次“干得好!”的表扬,都要喊出 6 次“别那样做!”。
  3. “长度”问题:当前方法还根据答案的长度来评判答案。
    • 如果机器人给出一个简短的正确回答,它会获得巨大的“干得好!”奖励。
    • 如果机器人给出一个冗长、啰嗦的错误回答,由于惩罚分散在这么多词汇上,“别那样做!”的惩罚力度会被稀释。

结果:机器人感到困惑。它被所有错误答案的噪音淹没,可能会开始猜测非常简短、随机的答案,只是为了避免那些冗长而沉重的惩罚。这就像一个学生,因为微小的错误被责骂了 100 次后,不再尝试写完整的句子,而只是写“是”或“否”以便尽快了事。

解决方案:HPO(“聪明的教练”)

作者提出了 HPO,它像一位懂得如何帮助挣扎学生的更聪明的教练。它有两个主要技巧:

1. “音量旋钮”(滞回加权)

教练不再同等对待每一个错误答案,而是调低负面反馈的音量。

  • 类比:想象机器人身处一个房间,里面有 6 个人在大喊“错了!”,而只有 1 个人在低语“对了!”。
  • 旧方法:教练平等地听取这 7 个人的意见。“错了!”的人群淹没了“对了!”的低语。
  • HPO 方法:教练给“错了!”的人群按下了“静音键”。他们仍然会听取这些声音,但会显著调低音量。这使得罕见的“对了!”低语能够真正被听到并从中学习。
  • 自适应版本(A-HPO):这是最聪明的版本。教练不使用固定的静音键。相反,他们会实时计算有多少人正在大喊“错了!”对比有多少人喊“对了!”。如果“错了!”的人群庞大,就大幅静音他们。随着机器人变得更好,“对了!”的人群增多,教练会慢慢调高“错了!”人群的音量,让机器人再次从错误中学习。

2. “公平平均”(平均长度归一化)

教练不再根据单个答案的长度来评判,而是开始根据整个群体的平均长度来评判。

  • 类比:在旧方法中,一个简短的正确回答会得到一颗金星,而一个冗长的错误回答只会得到一个几乎看不见的红色叉号。这鼓励机器人变得懒惰和简短。
  • HPO 方法:教练说:“我们将根据群体的平均努力程度来评判每个人。”这阻止了机器人为了获得更大奖励而通过写简短答案来钻系统空子。它鼓励机器人无论需要多少词汇,都要充分思考问题。

实验中发生了什么?

研究人员在两项任务上测试了这种方法:

  1. TeleLogs:修复复杂的 5G 网络错误(就像侦探破案)。
  2. Countdown:一个数学游戏,你需要组合数字以达到目标值。

结果

  • 更快的学习:使用新方法(A-HPO)的机器人学习速度快得多,尤其是在初期失败很多的时候。
  • 更高的分数:在网络任务中,新方法达到了 0.84 的分数,显著优于旧方法(0.73)和其他竞争对手。
  • 没有“短路”:与旧方法有时会让机器人放弃并写出非常简短、无用的答案不同,新方法在提高准确性的同时,保持了答案的冗长和深思熟虑。

核心结论

当教 AI 一项它经常失败的困难任务时,你不应该将每一次失败都视为与每一次成功同等重要。如果你这样做,AI 会感到不知所措并停止尝试。

HPO 是一个简单的修正,它说:“倾听失败,但不要让它淹没罕见的成功。此外,不要让答案的长度欺骗评分系统。”通过平衡反馈,AI 能更高效地学习并解决更难的问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →