EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning
原作者: Zhitong Wang, Songze Li, Hao Peng, Shuzheng Si, Yi Wang, Maosong Sun, Juanzi Li
原作者: Zhitong Wang, Songze Li, Hao Peng, Shuzheng Si, Yi Wang, Maosong Sun, Juanzi Li
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:ENVRL —— 从环境动力学中学习智能体强化学习
1. 问题陈述
强化学习(RL)已成为训练大型语言模型(LLM)作为自主智能体以处理复杂、长程任务(如网页导航、软件交互)的标准范式。然而,主流的智能体强化学习算法(如 GRPO 和 RLOO)主要依赖于基于结果的奖励(outcome-based rewards),即环境仅在回合(episode)结束时提供二元反馈。
在长程、多轮对话的语境下,这种稀疏反馈带来了严重的学习挑战。作者认为,这种方法忽视了展开轨迹(rollout interaction trajectories)中所包含的丰富的环境动力学信息(environment dynamics information)。当智能体与环境交互时,它生成的经验隐含地携带了描述环境如何响应动作而演变的密集信号,并揭示了底层的转换机制。现有方法未能利用这种隐式监督,限制了智能体构建准确内部环境模型并做出稳健决策的能力。
2. 方法论:ENVRL 框架
本文提出了 ENVRL,一个旨在将环境动力学学习融入智能体强化学习的框架。其核心思想是将交互经验转化为自监督信号,以补充主要的强化学习目标。ENVRL 引入了两个辅助目标:
A. 状态预测 (State Prediction, SP)
该目标对前向环境动力学进行建模。给定当前状态 st 和所选动作 at,智能体被训练去预测下一个环境状态 st+1。
- 机制: 在文本环境中,st+1 是下一步的文本观测。该目标最小化预测状态与实际状态之间的交叉熵损失:
LSP(θ)=−E(st,at,st+1)∼Dπθ[logpθ(st+1∣st,at)] - 目标: 鼓励智能体内化其动作如何塑造后续观测的过程。
B. 逆向动力学 (Inverse Dynamics, ID)
该目标对后向因果关系进行建模。给定连续的两个状态 (st,st+1),智能体被训练去推断导致该转换的动作 at。
- 机制: 该目标最小化恢复动作的交叉熵损失:
LID(θ)=−E(st,at,st+1)∼Dπθ[logpθ(at∣st,st+1)] - 目标: 加强智能体对行为与环境变化之间因果联系的理解,帮助其过滤掉无关的观测细节。
C. 带衰减的联合在线优化
总学习目标结合了主要的强化学习损失 (LRL) 与辅助损失 (LSP 和 LID):
L(θ;t)=LRL(θ)+λSP(t)LSP(θ)+λID(t)LID(θ)
为了平衡早期动力学学习与后期奖励最大化的需求,作者采用了系数衰减机制。权重 λSP(t) 和 λID(t) 遵循余弦衰减调度(cosine decay schedule),从较高的值开始,并随着训练的进行逐渐降低至零。这确保了智能体在早期获得关于动力学的密集监督,随后平滑地转向关注主要任务的奖励。
计算效率: ENVRL 复用了标准强化学习过程中生成的展开数据(rollout data)。它在每次更新时仅需一次额外的正向传播来计算辅助损失,引入了微不足道的计算开耗。
3. 核心贡献
- 框架提出: 引入了 ENVRL,这是一个轻量级框架,将状态预测和逆向动力学作为辅助目标集成到智能体强化学习中。
- 隐式监督利用: 一种将交互经验视为独立且密集监督信号来源的新颖方法,解决了长程任务中结果奖励稀疏的问题。
- 衰减机制: 一种随时间变化的系数调度方案,动态平衡动力学学习与任务奖励优化之间的关系。
- 高效性: 证明了这些改进是在不增加额外采样或单独训练模型的情况下实现的,通过复用现有的展开轨迹即可完成。
4. 实验结果
作者在两个长程智能体基准测试上评估了 ENVRL:ALFWorld(基于文本的家庭任务)和 WebShop(电子商务产品搜索)。实验使用 Qwen2.5 模型(1.5B 和 7B)以及 GRPO 和 GiGPO 基线进行。
- 性能提升:
- ALFWorld (1.5B, GRPO): 成功率从 72.8% 提高到 77.4%(+4.6 个百分点)。
- WebShop (1.5B, GRPO): 成功率从 56.8% 提高到 67.0%(+10.2 个百分点)。
- 7B 模型: 在使用 GRPO 和更强的 GiGPO 基线时均观察到一致的改进(例如,GiGPO + ENVRL 在 ALFWorld 上达到了 94.5%)。
- 样本效率: ENVRL 平均仅使用约 68.5% 的总训练步数即可达到 RL 基线的最终性能水平,表明其收敛速度更快。
- 行为改进: 成功的回合通常需要更少的交互轮数和更短的响应长度,这表明决策更加精准且减少了冗余探索。
- 泛化能力: 在标准任务上训练的 ENVRL 模型在具有新房间配置和未见物体类型的分布外(OOD)测试集上表现出更强的鲁棒性。
- 消融实验:
- 移除 SP 或 ID 中的任一模块都会导致性能下降,证实了前向和后向动力学建模之间的互补性质。
- 移除衰减机制会导致性能下降,凸显了随时间将重心从动力学转向奖励的必要性。
- 性能随用于辅助训练的经验数据比例的正向增加而提升。
5. 重要性与主张
本文声称 ENVRL 为 LLM 智能体提供了一种通用且轻量级的方法,使其能够从环境动力学中学习。通过通过自监督目标将环境转换机制内化,智能体可以在结果奖励稀疏的长程任务中做出更有效的决策。
作者将他们的工作定位为与现有专注于细粒度信用分配(credit assignment)或中间奖励塑造(reward shaping)的方法正交。相反,ENVRL 将交互经验视为一种丰富的、独立的信息源。该框架被呈现为一种互补策略,可以集成到各种策略优化算法(如 GRPO 或 GiGPO)中,在不产生显著计算成本的情况下增强样本效率和泛化能力。这项工作旨在为智能体强化学习机制提供一个新的视角,为开发更稳健、更自主的智能体做出贡献。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。