SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning
本文介绍了 SAPO,这是一个针对智能体强化学习(agentic reinforcement learning)设计的内存高效且计算优化的框架,该框架利用用于策略函数和价值函数的共享自回归主干网络,在实现优于 PPO 和 GRPO 等现有方法的高性能与高稳定性的同时,消除了对独立评论家(critic)模型的的需求。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能飞速发展的世界中,一个新的前沿领域已经出现:计算机程序不再仅仅是消极的文本生成器,而是成为了能够进行推理、搜索网络并跨越多个步骤解决复杂问题的活跃智能体。这个被称为“智能体强化学习”(agentic reinforcement learning)的领域,通过让这些数字助手在模拟环境中尝试行动并从结果中学习来对其进行训练。想象一名正在参加考试的学生:如果答对了,他们会感到愉悦;如果失败了,他们会试图弄清楚哪里出了错。对于人工智能而言,这种学习过程依赖于一个能够回顾长链决策并确定哪一个特定步骤导致了成功或失败的系统。传统上,这需要一个沉重的两部分系统:一部分用于决定下一步该做什么,另一部分则是庞大的、独立的“评论家”(critic)部分,用于评估当前状态的好坏。这种分离虽然运作良好,但需要巨大的计算能力和内存,往往会减慢学习过程,或使其在标准硬件上运行的成本过高。
研究人员最近发现,许多人工智能智能体在面对反馈稀疏或延迟的情况时(例如直到漫长任务结束才知道是否成功)会表现挣扎。现有的试图通过移除独立评论家来简化这一过程的方法,往往会导致学习不稳定或性能低下,因为它们缺乏一种清晰的方式来为长序列中的单个步骤分配信用。为了解决这个问题,来自厦门大学和南洋理工大学的一个科学家团队开发了一个名为 SAPO 的新框架,其全称为“单次展开自回归策略优化”(Single-Rollout Autoregressive Policy Optimization)。SAPO 并不使用两个独立的模型,也不需要针对一个任务生成数十次不同的尝试来进行学习,而是教导单个语言模型同时完成所有工作。它利用语言生成的自然流,在一个连续的思想流中同时决定行动、评估行动前的状态以及判断行动本身的价值。
SAPO 的核心创新在于它如何组织人工智能大脑内部的信息。在标准的对话或任务中,人工智能读取提示词、思考,然后写出响应。研究人员意识到,在人工智能开始编写响应之前的那个瞬间,是询问“当前情况有多好?”的最佳时机;而当响应完成后,则是询问“那个特定的行动有多好?”的最佳时机。通过将这两个问题放置在文本生成过程中特定的固定点,模型可以学会回答这两个问题,而无需一个独立的评估器。这种设计使人工智能能够仅通过一次任务尝试进行学习,而不是需要生成一大组变体进行相互比较。该系统有效地学习了其对不同情境下价值的理解泛化,确保它不仅仅是记住了通往成功的特定路径,而是理解了为什么某个动作是好或坏的底层逻辑。
为了测试这种方法,团队在两个具有挑战性的环境中训练了该人工智能:一个模拟家庭环境,智能体必须完成如清洁或加热物品等物理任务;以及一个复杂的网页购物场景,智能体必须在网站间导航以寻找特定产品。他们使用了两种不同规模的语言模型,一个拥有 15 亿参数,另一个拥有 70 亿参数,以观察该方法在不同规模下的表现。结果令人瞩目。在家庭任务中,与使用独立评论家的标准方法相比,新方法的成功率提高了 15 个百分点以上;与试图完全避免使用评论家的领先方法相比,提高了 12 个百分点以上。在网页购物任务中,提升同样显著,人工智能取得了更高的分数并更成功地完成了更多任务。或许最重要的一点是,由于消除了运行第二个独立模型来评估性能的需求,新方法在消耗显著更少内存的同时,每个训练步骤的速度比传统方法快了约 33%。
这一框架的成功表明,可以利用大型语言模型处理信息的自然方式来解决训练人工智能智能体时面临的一些最困难的问题。通过将学习过程与语言生成的自然结构相对齐,研究人员证明了在不承担维护决策与评估分离系统所带来的沉重计算成本的情况下,实现高性能是可能的。这种方法不仅提高了训练效率,还增强了稳定性,使得智能体即使在奖励延迟或不频繁的情况下也能有效地学习。随着人工智能领域向着创建更具自主性和能力的智能体迈进,像这样的方法提供了一条切实可行的路径,证明了效率与高性能可以并行不悖,且不会牺牲从复杂、长期交互中学习的能力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。