想象一下,你正在试图教一个机器人如何通过迷宫或驾驶汽车。传统上,我们使用强化学习(Reinforcement Learning, RL)。这就像是在训练一只狗:你让狗到处乱跑,它会犯错,当你做得好时,你给它一个奖励(零食);经过成千上万次的尝试,它会慢慢学会正确的路径。这个过程通常很慢,需要大量的“零食”(数据),并且需要人类训练师仔细调整游戏规则(超参数)才能使其奏效。
这篇论文提出了一个新问题:我们能不能直接要求一个超级聪明的 AI(大语言模型或 LLM)来为机器人编写指令,而不是从头开始训练它?
作者介绍了一种名为 PromptPO(提示策略优化)的方法。它是这样运作的,这里使用简单的类比:
“建筑师与建造者”类比
与其让机器人通过试错来学习,不如让 LLM 充当一名大师级建筑师。
- 蓝图: 你向 LLM 提供一段关于世界的描述(迷宫、汽车、规则),是用代码编写的。你不需要告诉它世界是如何运动的;你只需要描述规则。
- 草案: LLM 为机器人编写一套指令(一个“策略”)。这些指令是用 Python 代码编写的。
- 试驾: 机器人在现实世界中测试这些指令。
- 评论: LLM 查看结果。机器人撞车了吗?它获得奖励了吗?LLM 会写一份关于哪里出错的简短报告。
- 修订: 根据那份报告,LLM 重写指令以使其变得更好。
- 循环: 这个循环会进行几次,直到机器人表现出色。
他们发现了什么?
研究人员在三种不同类型的世界中,将这种“建筑师”方法与传统的“训狗”(RL)方法进行了对比测试:
1. “探索型”游戏(迷宫和网格)
- 结果: LLM 的表现与传统方法一样好,而且通常更快。
- 原因: LLM 就像是一个读过数千本推理小说的人。即使面对的是新的迷宫,LLM 也知道通用的策略,比如“尝试绘制墙壁地图”或“使用搜索算法”。它不需要盲目地跑上好几个小时;它可以“思考”出一个计划(比如一张地图)并将其写下来。
- 惊喜: 在某些情况下,LLM 自发地编写了类似于复杂规划算法(如价值迭代)的代码,而无需任何人告知。它自己悟出了:“嘿,我需要提前规划才能获胜。”
2. “机械臂”游戏(Meta-World)
- 结果: LLM 的效率更高。它学习移动机械臂去按按钮或开门所需的尝试次数,远少于传统的 RL。
- 原因: 这些任务涉及移动手部到某个位置。LLM 可以轻松理解诸如“将手向前移动”或“抓取物体”之类的概念,因为它在训练数据中读到过这些内容。它编写了简单且有效的规则(如比例控制器)并取得了良好的效果。
3. “微调型”游戏(MuJoCo)
- 结果: LLM 在这里遇到了困难。
- 原因: 这些任务需要控制极其精细、连续的肌肉动作(关节扭矩)来保持机器人平衡。这就像是要求 LLM 为外科医生的手部颤抖编写指令。LLM 擅长高层逻辑(“向前走”),但不擅长维持机器人单腿站立所需的那些极其琐碎、连续的数学计算。传统的 RL 通过数百万次的尝试来学习这些微小的调整,因此表现得更好。
4. “现实世界”游戏(流行病、交通、糖尿病)
- 结果: LLM 完胜。
- 原因: 这些是涉及人类行为和经济学的复杂问题。LLM 在其训练数据中“读”过关于流行病、交通拥堵和糖尿病的内容。它可以利用这些现有的知识立即编写出非常好的策略,而传统的 RL 算法必须从零开始学习这些复杂的动态过程,这需要很长时间。
核心结论
该论文得出结论:LLM 是策略优化的强大工具,但它们并不是应对一切的魔杖。
- 它们的优势所在: 当任务需要逻辑、规划或通用知识时(例如导航迷宫、管理流行病或移动机械臂到达目标点)。它们具有很高的“样本效率”,这意味着它们尝试测试的次数比传统方法少得多。
- 它们的劣势所在: 当任务需要极细粒度的、连续的控制时(例如让机器人在钢丝上保持平衡),此时 LLM 的“常识”不足以处理那些精确的数学计算。
简而言之,如果你有一个需要思考和规划的问题,请求 LLM 编写代码可能比从头训练机器人更快、更容易。但如果你需要微观层面的精准度,你可能仍然需要传统的“试错”训练。
技术摘要:LLM 何时可以作为序列强化学习任务的充分策略优化器?
问题陈述
强化学习(RL)已经确立了一个核心目标,即通过与环境交互来产生能够最大化预期回报的策略。然而,标准的强化学习算法(如 PPO、SAC、DQN)通常计算密集,需要大量的环境交互,并且由于依赖于精细的超参数调优、模型架构选择和算法选择,表现得较为脆弱。本文研究了大型语言模型(LLM)是否可以作为有效的“黑盒”策略优化器,作为标准强化学习算法的直接替代方案。具体而言,作者提出了一个问题:在仅给定 Python 格式的状态空间、动作空间和奖励函数描述的情况下,LLM 是否能够生成并优化一个策略,从而在无需进行大规模设计决策或面对传统强化学习典型的样本效率低下问题的情况下,实现预期回报的最大化?
方法论:提示策略优化(PromptPO)
作者引入了提示策略优化(PromptPO),这是一个迭代框架,其中 LLM 生成代表策略的可执行 Python 代码。该过程运行如下:
- 输入: LLM 接收关于环境状态空间、动作空间和奖励函数的 Python 格式描述。至关重要的是,作者避免提供显式的转移动力学(transition dynamics),以便在无模型(model-free)设置下评估该方法。
- 评估函数生成: 在生成策略之前,提示 LLM 实现一个
Feedback 类。该类汇总轨迹级统计数据(例如平均回报、最小值/最大值),以提供超越原始奖励信号的监督,类似于强化学习算法使用时序差分误差(temporal difference errors)的方式。
- 策略生成: 提示 LLM 生成一个策略类(通过 Python 实现),该类接收一个观测值并输出一个动作,以最大化预期回报。
- 迭代优化:
- 从 LLM 中采样 N 个候选策略。
- 每个策略都在环境中进行展开(rollout)。
- 选择表现最好(基于回报)的策略。
- LLM 接收一段自然语言的反思,将新策略的表现与以往尝试的历史进行对比。
- 利用这些反馈和最佳策略的历史记录,LLM 为下一轮生成新的策略。
- 如果发生代码执行错误,则提示 LLM 重新实现相关的代码组件。
作者在所有实验中均使用 Gemini 3 Pro。该方法依赖于 LLM 合成代码的能力,这些代码可以实现各种优化策略,从基于规则的计划到类似价值迭代(value iteration)的规划算法,且无需显式提示使用这些算法。
核心贡献
- 框架引入: 提出 PromptPO 作为一种将 LLM 视为策略优化器的方法,其输出的是可执行代码,而非直接的动作或参数向量。
- 经验基准测试: 在四个不同领域进行了全面的评估:硬探索环境(NoiseWorld、Point Maze)、机器人操作(Meta-World)、连续控制(MuJoCo)以及现实世界控制任务(流行病缓解、血糖监测、交通控制)。
- 充分条件分析: 识别了 LLM 优化是充分还是失效的场景,特别将成功与利用环境先验知识或优化策略的能力联系起来。
实验结果
该研究在 19 个环境中将 PromptPO 与标准无模型强化学习基准(PPO、SAC、DQN/QR-DQN、TD3)进行了比较:
- 探索环境: 在 19 个环境中的 15 个中,PromptPO 的表现达到或超过了最佳的强化学习基准。在 NoiseWorld(随机生成的网格世界)和 Point Maze 中,PromptPO 展示了强大的探索能力。值得注意的是,在 NoiseWorld 中,PromptPO 通常无需环境反馈更新即可达到最优性能,这表明它利用先验知识直接在生成的代码中实现了规划算法(如价值迭代、Dijkstra 算法)。
- 机器人技术(Meta-World vs. MuJoCo):
- Meta-World: PromptPO 在所有任务中都比强化学习具有更高的样本效率,并在“拾取与放置”(Pick and Place)任务中超越了最终的强化学习性能。这里的动作空间涉及末端执行器的位移。
- MuJoCo: PromptPO 的表现逊于标准强化学习算法。作者将其归因于对精细连续控制(关节力矩)的要求,目前的 LLM 在处理此类问题时的推理能力较弱。
- 现实世界控制: 在涉及流行病封锁规定、胰岛素管理和自动驾驶车辆交通控制的任务中,PromptPO 的样本效率显著更高(例如,在流行病缓解任务中高出 >60 倍),并且在相同的训练预算内,其最终回报通常高于 PPO。
- 策略类型: 在没有显式指令的情况下,PromptPO 自主生成了多样化的策略类型,包括调优后的比例控制器、基于规则的启发式算法和规划算法,并根据环境的性质调整策略。
意义与主张
论文声称,对于许多序列决策任务,基于 LLM 的策略优化是一种充分且往往更优的替代方案,特别是当 LLM 能够利用关于环境或有效优化策略的先验知识时。
- 样本效率: PromptPO 的主要优势在于其样本效率,这源于 LLM 在包含优化和控制结构知识的海量数据集上的预训练,从而减少了对大量环境交互的需求。
- 易用性: PromptPO 降低了强化学习的门槛,因为它比标准方法需要更少的超参数和算法设计决策,使其对缺乏深度强化学习专业知识的从业者更加友好。
- 局限性: 作者谦虚地承认,该方法目前在需要精细连续控制(如 MuJoCo 关节力矩)或奖励函数为不可解释神经网络(例如通过 RLHF 学习到的函数而非 Python 函数)的环境中表现挣扎。
- 泛化性: 结果表明,PromptPO 的成功可能较少源于对特定环境知识的掌握(如在随机生成的 NoiseWorlds 中的成功所示),而更多是源于对有效优化策略的先验知识。
论文得出结论,虽然 LLM 目前可能尚未在所有领域超越人类能力,但它们代表了一种实用且强大的工具,用于在广泛的设置中生成高性能策略,从而可能促进强化学习在现实世界应用中的更广泛采用。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。