SPO++: Stream-Aligned Policy Optimization for Asynchronous Agentic RL
SPO++ 通过动作标记度量归一化(action-token-measure normalization)和事件对齐证据组织(event-aligned evidence organization),纠正了轨迹级优势中心化(trajectory-level advantage centering)与标记加权策略优化(token-weighted actor optimization)之间的失配,从而提升了异步智能体强化学习的在线学习效率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在快速发展的人工智能领域,研究人员正在通过让计算机程序尝试、失败并从结果中学习,来教它们解决复杂问题。这一过程被称为强化学习(reinforcement learning),对于训练大型语言模型作为能够使用工具、在虚拟环境中导航或解决数学问题的智能体(agents)特别有用。这项工作的一个核心挑战在于,当通往答案的路径漫长且不可预测时,如何衡量成功。传统方法通常要求系统同时针对同一个问题生成许多不同的尝试,并等待每一项尝试都完成后才能从结果中学习。这造成了一个瓶颈:如果某一次尝试因为陷入困境或尝试了过多的工具而耗时过长,整个学习过程就会暂停,等待那个最慢的尝试赶上进度。
为了解决这种低效问题,一种被称为单流策略优化(Single-stream Policy Optimization)的新方法被开发了出来。该方法不再等待一组尝试完成,而是允许系统一次处理一个尝试,利用对过去成功与失败的持久记忆来指导未来的决策。然而,由 Kai Ruan 和 Jinghao Lin 领导的研究团队发现,虽然这种方法消除了等待时间,但它在计算机计算进度的方式上引入了一个微妙但显著的偏差。他们发现,系统计算平均奖励的方式与其处理解决方案步骤的方式并不一致。通过修正这种对齐,他们创建了一个改进版本,命名为 SPO++,该版本能让人工智能学习得更快、更高效。
问题的核心在于计算机处理其响应长度的方式。在原始方法中,系统会为整个尝试计算一个单一的分数,例如机器人是否成功清理了房间,或者数学求解器是否找到了正确答案。然后,它会将这个单一分数分布到模型生成的每一个词(或称“token”)上。这看似合乎逻辑,却造成了扭曲。如果一次尝试很长而另一次很短,长的尝试会将分数稀释到许多词语中,而短的尝试则会将分数集中在较少的词语上。当系统试图从这些分数中学习时,响应的长度在无形中改变了学习的中心点,导致模型在针对错误的目标进行优化。这就像系统试图平衡一个天平,但天平上的砝码重量会根据放置物品的数量而变化,而不是取决于物品本身的价值。
研究人员确定了两个发生这种失调的具体领域。首先,系统追踪的是它何时收到尝试的结果,而不是尝试何时实际生成的。在一个任务发送和完成速度不一的异步系统中,结果到达的顺序通常是随机的,取决于网络速度或计算机负载。原始方法使用这种到达顺序来更新其记忆,这意味着学习信号受到计算机系统定时性的影响,而非任务本身的逻辑影响。其次,更为关键的是,评分的平均方法没有考虑到模型是根据它生成的每一个词进行学习,而不仅仅是最终结果。研究人员意识到,要修复学习过程,需要根据生成的动作词数量来标准化分数,确保奖励信号与模型实际完成的工作量相匹配。
为了解决这些问题,团队引入了 SPO++,它对学习过程进行了两项关键改进。首先,他们重新组织了记忆系统,以追踪“策略事件”(policy event),即请求被发送出的特定时刻,而不是结果返回的时刻。这确保了系统对过去成功的记忆与任务创建时的模型状态相绑定,使得学习信号无论任务执行时间长短都保持一致。其次,他们改变了评分的平均方式。该方法不再将每次尝试视为一个单一单元,而是根据所有尝试中生成的动作词总数来计算平均得分。这确保了学习信号与模型逐词更新知识的方式完全对齐。
研究人员在两种不同类型的任务上测试了这些改进的效果:一种是包含 128 个模拟家务的任务,智能体必须将物体移动到特定位置;另一种是包含 1,500 个需要使用 Python 计算器的数学问题数据集。研究人员使用两种不同规模的语言模型进行了实验,一个拥有 8 亿参数,另一个拥有 20 亿参数。在每一次测试中,新方法 SPO++ 的学习速度都比原始方法更快。在家庭家务任务中,改进非常显著,新方法在整个训练过程中实现了更高的总奖励。在数学问题中,增益虽然较小但依然稳定,表明模型更快地达到了更高的性能水平。研究人员发现,新方法最强大的部分在于评分平均方式的改变,这本身就贡献了大部分的提升。
这些发现表明,在训练人工智能智能体的复杂世界中,数据处理的方式与数据本身同样重要。通过确保系统衡量进度的方式与其实际学习的方式相匹配,研究人员可以在不需要更多计算能力或更大模型的情况下,实现效率的显著提升。这项工作证明,即使是学习过程中微小的失调也会减缓进度,而修正这些不匹配可以让系统专注于解决问题,而不是补偿缺陷的测量方式。随着人工智能继续应对更加困难和多样的任务,像 SPO++ 这样的方法提供了一条更清晰的前行之路,确保模型的每一步都能被准确衡量,并有效地促进其成长。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。