From LLM-Generated Specifications to Learned Quadruped Locomotion
本文证明了大型语言模型可以从自然语言描述中生成参数化信号时序逻辑(PSTL)规范,以自动推导可解释的奖励函数,使四足机器人能够实现鲁棒、高速的运动,且其成功率达到100%,显著优于手工设计和基于代码的奖励方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
=== 技术摘要:从 LLM 生成的规范到学习到的四足机器人运动控制 ===
问题陈述
深度强化学习(RL)已使四足机器人的敏捷运动成为可能,但性能仍高度依赖于奖励函数的工程化设计。设计这些奖励需要大量的领域专业知识来平衡局部项(追踪、姿态、能量),且往往依赖于经验调优而非第一性原理。此外,数值型局部奖励无法显式描述所需的全局时间行为,这在多步态运动(如行走、小跑和跳跃在接触时机和支撑模式上存在差异)中尤为关键。虽然信号时序逻辑(STL)等形式化规范具有可解释性和定量鲁棒性,但手动编写这些规范仍需要极高的专业知识。相反,近期通过大语言模型(LLM)直接从自然语言生成奖励代码的方法,往往缺乏处理复杂时序约束所需的结构严谨性。本文旨在解决利用 LLM 生成具有可解释性的、具有时间结构的奖励规范,并将其数值参数锚定在专家数据中的问题。
方法论
作者提出了一个流水线,利用 LLM 生成参数化信号时序逻辑(PSTL)规范的结构,同时利用专家轨迹来实例化其参数并过滤输出。
LLM 规范生成:
- 模型(GPT-5.5 和 Qwen 3.6)通过自然语言运动目标和受限的 STL 文法进行提示。
- 至关重要的是,要求 LLM 仅提出命令追踪、安全性和步态结构的符号化结构(模板)。数值阈值和时间常数被留作稍后估计的符号参数,以防止 LLM 凭空捏造任意数值。
- 探索了两种设置:
- 步态感知(多步态): 提示词基于弗劳德数(Froude number)的转变定义了三个速度区间(行走-小跑、小跑、跳跃)。LLM 为每个区间生成不同的规范。
- 步态无关: 提示词不规定特定步态,允许机器人自主发现接触模式。
数据锚定与专家一致性过滤:
- PSTL 模板的数值参数是从每种机制下 50 条专家轨迹的数据集中估计得出的。
- 应用了一种过滤机制:只有当生成的规范在专家轨迹上的中值鲁棒性为非负()时,该规范才会被保留。这会剔除那些系统性违反专家行为的规范,确保奖励信号与展示出的能力相一致。
奖励构建与训练:
- 保留的规范通过 STL 鲁棒性语义转换为平滑的、有限历史的奖励函数。
- 激活规范的鲁棒值使用 soft-min 函数进行聚合,并通过 进行归一化,以防止被大数值主导。
- 最终标量奖励是安全项、追踪项和模式项的加权和。
- 在 MuJoCo XLA (MJX) 仿真环境中使用 Barkour 四足机器人,利用近端策略优化(PPO)进行策略训练。
核心贡献
- LLM-专家混合流水线: 一种新型框架,其中 LLM 生成具有可解释性的运动规范的符号结构,而专家数据则用于锚定数值参数。
- 专家一致性过滤器: 一种用于丢弃与演示的专家行为相矛盾(中值鲁棒性 < 0)的 LLM 生成规范的机制,防止将系统性违反的约束引入奖励。
- 配方对比评估: 研究了明确规定步态结构(步态感知)与允许涌现行为(步态无关)如何影响学习到的运动控制。
- 基准测试: 与手工设计的启发式方法、直接由 LLM 生成奖励代码(Text2Reward)以及专家切换先验(expert-switching oracle)进行了全面比较。
结果
研究使用从 0.3 m/s 到 2.1 m/s 的前进速度对性能进行评估,指标包括运输成本(CoT)、生存率、命令成功率和步态匹配度。
步态无关性能:
- GPT-5.5 和 Text2Reward(步态无关)实现了最强的定量性能,在所有速度下均保持 100% 的生存率和命令成功率,且 CoT 较低。
- 然而,视觉检查揭示了一个关键缺陷:这些策略在整个速度范围(包括 0.3 m/s 的低速)内都学习到了一种“类跳跃”的接触模式。这导致了不自然的、高频的腿部运动和垂直振荡,表明高定量成功分数并不保证动态合理的控制。
- Qwen 3.6(步态无关)在速度 m/s 时无法生存。
步态感知(多步态)性能:
- Qwen 3.6 (多步态): 在全速度范围(0.3–2.1 m/s)内实现了 100% 的生存率和命令成功率,并成功匹配了高速下的目标“跳跃”步态。
- GPT-5.5 (多步态): 很好地捕捉了低/中速步态,但在速度 m/s 时无法完成命令追踪。
- Text2Reward (多步态): 在高速阶段(1.9–2.1 m/s)完全失败,在每次 Rollout 中均以终止结束。
- 手工设计(启发式): 在最高速度(2.0–2.1 m/s)下失去了追踪精度。
关于鲁棒性时界()的消融实验:
- 较短的时间时界()通常产生更稳定且成功的策略。
- 较长的时界()往往会降低性能,因为 STL 中的“总是”()算子依赖于窗口内的最小值,这使得过去的违规会在奖励信号中停留更长时间,从而增加了信用分配的难度。
模型比较:
- GPT-5.5 和 Qwen 3.6 的相对表现高度依赖于控制设置。GPT-5.5 在步态无关设置中表现出色,而 Qwen 3.6 在多步态设置中表现更好,尤其是在高速情况下。
重要性与主张
论文声称,将时序逻辑作为 LLM 生成与策略学习之间的中间表示,相比于直接的奖励代码生成,在处理高速运动时具有明显的优势。基于 STL 的方法(特别是多步态设置下的 Qwen 3.6)成功学习了所需的的高速“跳跃”步态,而直接的代码生成(Text2Reward)则失败了。
然而,作者对研究结果持谨慎态度:
- 无普遍优势: 没有一种单一的奖励配方能在所有任务设置(步态感知 vs 无感)和所有评估标准下实现普遍领先。
- 定量指标的局限性: 结果强调,高命令追踪成功率并不保证能恢复预期的步态结构或自然运动,正如步态无关策略在低速下采用跳跃步态所体现的那样。
- 仿真限制: 作者明确指出,评估仅限于仿真环境(MJX)。虽然使用了领域随机化,但这些学习到的多步态行为在物理硬件上的实机迁移能力尚未得到验证。
这项工作证明,LLM 可以有效地提出形式化规范的结构,但为了产生鲁棒、可解释且有效的运动控制,其参数和有效性必须通过专家数据进行严格的锚定。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。