想象一下,你正在教一个机器人解决一个难题,比如一道复杂的数学题或一项网络故障排查任务。你给机器人一个提示,它尝试生成答案。有时它能答对;但大多数时候,尤其是在初期,它会答错。
本文介绍了一种训练这些机器人的新方法,称为滞回策略优化(Hysteretic Policy Optimization, HPO)。这是对现有方法(GRPO)的一种改进,当机器人在寻找正确答案而挣扎时,它能显著加快学习速度并提高稳定性。
以下是使用简单类比进行的分解说明:
问题所在:“嘈杂的课堂”
在当前的训练方法(GRPO)中,老师(算法)会审视机器人尝试的 8 个批次。
- “罕见成功”问题:在困难任务中,机器人可能 8 次尝试中只有 1 或 2 次答对,其余 6 次都是错的。
- “音量”问题:当前方法对待每一个错误答案和正确答案一样严肃。由于错误答案数量众多,老师最终对每一次“干得好!”的表扬,都要喊出 6 次“别那样做!”。
- “长度”问题:当前方法还根据答案的长度来评判答案。
- 如果机器人给出一个简短的正确回答,它会获得巨大的“干得好!”奖励。
- 如果机器人给出一个冗长、啰嗦的错误回答,由于惩罚分散在这么多词汇上,“别那样做!”的惩罚力度会被稀释。
结果:机器人感到困惑。它被所有错误答案的噪音淹没,可能会开始猜测非常简短、随机的答案,只是为了避免那些冗长而沉重的惩罚。这就像一个学生,因为微小的错误被责骂了 100 次后,不再尝试写完整的句子,而只是写“是”或“否”以便尽快了事。
解决方案:HPO(“聪明的教练”)
作者提出了 HPO,它像一位懂得如何帮助挣扎学生的更聪明的教练。它有两个主要技巧:
1. “音量旋钮”(滞回加权)
教练不再同等对待每一个错误答案,而是调低负面反馈的音量。
- 类比:想象机器人身处一个房间,里面有 6 个人在大喊“错了!”,而只有 1 个人在低语“对了!”。
- 旧方法:教练平等地听取这 7 个人的意见。“错了!”的人群淹没了“对了!”的低语。
- HPO 方法:教练给“错了!”的人群按下了“静音键”。他们仍然会听取这些声音,但会显著调低音量。这使得罕见的“对了!”低语能够真正被听到并从中学习。
- 自适应版本(A-HPO):这是最聪明的版本。教练不使用固定的静音键。相反,他们会实时计算有多少人正在大喊“错了!”对比有多少人喊“对了!”。如果“错了!”的人群庞大,就大幅静音他们。随着机器人变得更好,“对了!”的人群增多,教练会慢慢调高“错了!”人群的音量,让机器人再次从错误中学习。
2. “公平平均”(平均长度归一化)
教练不再根据单个答案的长度来评判,而是开始根据整个群体的平均长度来评判。
- 类比:在旧方法中,一个简短的正确回答会得到一颗金星,而一个冗长的错误回答只会得到一个几乎看不见的红色叉号。这鼓励机器人变得懒惰和简短。
- HPO 方法:教练说:“我们将根据群体的平均努力程度来评判每个人。”这阻止了机器人为了获得更大奖励而通过写简短答案来钻系统空子。它鼓励机器人无论需要多少词汇,都要充分思考问题。
实验中发生了什么?
研究人员在两项任务上测试了这种方法:
- TeleLogs:修复复杂的 5G 网络错误(就像侦探破案)。
- Countdown:一个数学游戏,你需要组合数字以达到目标值。
结果:
- 更快的学习:使用新方法(A-HPO)的机器人学习速度快得多,尤其是在初期失败很多的时候。
- 更高的分数:在网络任务中,新方法达到了 0.84 的分数,显著优于旧方法(0.73)和其他竞争对手。
- 没有“短路”:与旧方法有时会让机器人放弃并写出非常简短、无用的答案不同,新方法在提高准确性的同时,保持了答案的冗长和深思熟虑。
核心结论
当教 AI 一项它经常失败的困难任务时,你不应该将每一次失败都视为与每一次成功同等重要。如果你这样做,AI 会感到不知所措并停止尝试。
HPO 是一个简单的修正,它说:“倾听失败,但不要让它淹没罕见的成功。此外,不要让答案的长度欺骗评分系统。”通过平衡反馈,AI 能更高效地学习并解决更难的问题。
技术摘要:用于稀疏奖励大语言模型训练的滞后策略优化(HPO)
1. 问题陈述
本文研究了组相对策略优化(GRPO)在应用于稀疏可验证奖励机制(例如,仅有一小部分采样回复正确的推理任务)下的大语言模型(LLM)时的一种特定失效模式。作者识别出两种相互依赖的偏差,导致该设置下的训练不稳定:
- 符号失衡(负向主导): 在稀疏奖励场景中,初始策略通常生成大部分错误的回复。因此,大多数采样轨迹低于组均值,导致负优势(p−>p+)出现频率极高。对这些大量负样本的对称处理可能会淹没罕见的正向信号,从而抑制有用但带有噪声的推理轨迹。
- 回复级长度偏差: 标准 GRPO 通过每个回复的长度(1/∣τi∣)对损失进行归一化。这在回复长度与更新幅度之间建立了一种反比关系:
- 短的正确回复获得不成比例的大正向梯度,使模型偏向简洁。
- 长的错误回复获得不成比例的小负向梯度,未能充分惩罚冗长的失败。
- 这种相互作用使得优化压力同时依赖于奖励和长度,这对于推理任务尤为成问题,因为长度通常与搜索深度或解释相关。
2. 方法论
作者提出了滞后策略优化(HPO),这是对 GRPO 目标函数的一种最小化修改,旨在通过两种机制解决上述偏差:
2.1 固定 HPO
HPO 对 GRPO 目标函数引入了两项结构性变更:
- 平均长度归一化: HPO 不再按每个回复自身的长度(∣τi∣)进行归一化,而是按平均回复长度(∣τˉ∣)对整个批次进行归一化。这消除了更新幅度随回复长度增加而缩小的反比缩放效应,确保长的错误回复得到适当惩罚,而短的正确回复不会主导梯度。
- 非对称滞后加权: 策略梯度更新根据优势(A^i)的符号进行非对称缩放:
- 正优势(A^i≥0)保留全权重(因子 = 1)。
- 负优势(A^i<0)通过滞后因子 α∈[0,1] 进行降权。
- 目标函数变为:
JHPO(θ)=EXN∣τˉ∣1i=1∑Nj=1∑∣τi∣wiℓi,j(θ)
其中,若 A^i≥0,则 wi=1;否则 wi=α。
2.2 自适应 HPO(A-HPO)
鉴于最优的 α 取决于训练阶段(随着策略改进,所需的滞后效应减少),作者引入了A-HPO。该变体根据当前批次的符号统计动态调整 α:
- 它估计正负优势频率的比率(p^+/p^−)。
- 自适应权重设定为:
αadaptive=clip(p^−+ϵp^+,αmin,1)
- 机制: 当负样本占主导(稀疏阶段)时,p^+/p^− 较小,导致 α 减小并抑制负向更新。随着策略改进且分布趋于平衡,α 趋近于 1,恢复对称更新。这避免了对固定 α 的手动调整。
3. 主要贡献
- 失效模式识别: 本文明确将 GRPO 在稀疏奖励机制下的不稳定性归因于负优势主导与回复级长度归一化的结合。
- HPO 算法: 一种在“仅正向”学习(丢弃负反馈)与完全对称更新之间进行单参数插值的算法。它结合了平均长度归一化与非对称加权。
- A-HPO: 一种轻量级自适应规则,可根据批次级符号统计自动调整滞后权重,无需手动超参数搜索。
- 实证验证: 消融研究表明,最优行为介于仅正向(α=0)和对称(α=1)更新之间,验证了中间滞后效应的必要性。
4. 实验结果
作者在两个任务上评估了 HPO 和 A-HPO:TeleLogs(5G 网络根因分析)和Countdown(算术构造),使用的模型参数量从 15 亿到 70 亿不等。
- TeleLogs(Qwen2.5-1.5B):
- A-HPO 实现了 0.84 的最终奖励,优于 GRPO(0.73,+15%)、GSPO(0.76,+11%)和 SAPO(0.80,+5%)。
- A-HPO 显著更快地达到高奖励水平(样本效率),同时保持与基线相当的回复长度,避免了“仅正向”方法中出现的“长度坍塌”现象。
- Countdown(15 亿–70 亿参数模型):
- 增益在训练早期和更难的配置(包含 4 个数字的 Countdown-4,奖励稀疏)中最为显著。
- 例如,在 Llama3.1-3B 模型上进行 Countdown-4 任务时,A-HPO 将 200 步奖励从 0.40(GRPO)提升至 0.54。
- 在饱和机制下(例如,70 亿参数模型在较简单的 Countdown-3 上),性能差距缩小,表明 A-HPO 在策略仍处于学习阶段时最为关键。
- 消融研究:
- 固定 HPO 设置 α=0(仅正向)导致输出极短(16 个 token)且奖励较低(0.71)。
- 固定 HPO 设置 α=1(对称)表现不佳(0.72),原因是负向主导。
- 最佳固定性能出现在 α≈0.6 时,A-HPO 无需调整即可自动达到该水平。
- 对“代理贡献平衡”的分析证实,A-HPO 成功平衡了正负更新贡献的幅度,而 GRPO 仍然充满噪声且受负向主导。
5. 意义与主张
本文主张,HPO 和 A-HPO 为 GRPO 提供了一种实用且低开销的改进方案,显著提高了大语言模型在稀疏奖励强化学习中的稳定性和样本效率。
- 核心原则: 作者认为,在稀疏奖励机制下,负优势更新应被利用,但当其频率压倒性高时,不应被对称信任。
- 平衡: 该方法成功防止了因大量失败而抑制有用的推理轨迹,同时避免了完全丢弃负面证据的退化行为。
- 自适应性: A-HPO 被提出作为一种稳健的解决方案,能够自动跟踪“仅正向”与对称更新之间的中间阶段,并随着训练分布从稀疏奖励向密集奖励转变而进行自适应调整。
该工作将 HPO 定位为一种必要的改进,适用于在缺乏密集过程奖励或评论家反馈的情况下进行计算高效的大语言模型微调。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。