想象一下,你正在尝试教一个机器人如何在繁忙的世界中导航,比如工厂里的送货机器人或城市中的自动驾驶汽车。你有两个主要工具来帮助它,但两者都有一个重大缺陷:
- “创意作家”(AI/LLM): 这是一个聪明的 AI,它可以阅读你的指令(“去食堂”)并制定出一个巧妙的计划。它擅长理解语境并修复错误。问题在于: 它有点鲁莽。它可能会制定出一个听起来不错但物理上无法实现的计划,或者因为它没有“思考”规则,可能会不小心闯红灯。
- “严谨会计”(经典规划器): 这是一个僵化的、基于规则的系统。它只有在你给它一个完美的、数学化的世界描述时才能工作。问题在于: 它很难理解自然语言或修复自己的错误。如果世界发生轻微变化,它就会陷入停滞。
EvoPlan 是一个全新的框架,它结合了两者的优点。它利用“创意作家”来构思计划,并利用“严冥会计”来确保计划的安全性和可执行性。以下是它的工作原理,分为三个简单的步骤:
1. “影子教练”(学习规则)
在机器人开始移动之前,系统需要学习道路或工厂车间的“潜规则”。
- 问题: 研究人员只有关于“良好”行为的视频(例如安全驾驶或礼貌行走的人),而没有关于“错误”行为的视频来向机器人展示什么是不该做的。
- 解决方案: 系统充当了一个创意写作教练。它提取一段良好的驾驶视频,然后询问 AI:“如果驾驶员加速会怎样?如果他们闯红灯会怎样?”它通过发明这些“错误”场景(反事实场景)来制造对比。
- 结果: 通过将“良好”的视频与发明的“错误”场景进行对比,系统学习到了一个单一且通用的规则手册(称为 STL 约束)。你可以把它理解为一个“影子教练”,在机器人耳边低语:“永远不要快于 X 速度”,或者 “始终与人保持 Y 米距离”。这个规则手册适用于机器人的每一次动作。
2. “进化编辑师”(构建计划)
现在,机器人需要一个从 A 点到 B 点的计划。
- 过程: “创意作家”(AI)提出一个计划。但系统并不会直接接受它,而是将其置于一个严格的编辑过程中。
- 循环:
- AI 写出一份计划草案。
- “验证器”(会计)检查它。如果计划出错了(例如:“你不能打开一扇不存在的门”),验证器会标出具体的错误。
- AI 阅读错误信息,修复该特定部分,然后再次尝试。
- 这个过程周而复始,就像作家不断精炼故事直到它完美为止。
- 神奇之处: 系统会保留已经过检查的计划中的“优秀部分”,并且只重写出错的部分。随着时间的推移,计划变得越来越长、越来越可靠,直到它完全符合规范。
3. “安全守门员”(实时执行)
最后,机器人开始移动。这是“影子教练”和“安全守门员”接管工作的时刻。
- 检查: 机器人并不会盲目地执行计划。在采取每一个动作(或转动一次轮子)之前,系统都会根据第一步中学到的规则手册进行检查。
- 安全网:
- 场景 A: 机器人计划左转。守门员检查:“那里有行人吗?速度安全吗?” 是的。 机器人移动。
- 场景 B: 机器人计划左转。守门员检查:“等等,行人离得太近了!” 不。 机器人立即停止。
- 重新规划: 如果守门员说“不”,机器人并不会发生碰撞。它会锁定已经完成的所有安全步骤,更新当前位置,并要求“进化编辑师”为剩余的旅程编写一个新计划。
为什么这很重要
论文表明,该系统的表现优于仅使用 AI 或仅使用规则。
- 在驾驶方面: 在驾驶数据测试中,该系统在不需要重新训练驾驶 AI 的情况下,显著减少了碰撞和闯红灯的行为。它只是增加了一个“护栏”,阻止了错误动作的发生。
- 在导航方面: 在复杂的开放世界谜题(如在房子里寻找物体)测试中,即使指令中使用的词汇与机器人的词汇不完全匹配,该系统解决任务的能力也高于其他 AI 规划器。
简而言之: EvoPlan 是一个机器人规划系统,它利用 AI 来实现创意和灵活性,但强制它戴上一个(从数据中学习到的)“安全头盔”并遵循一个(由代码检查的)“规则手册”,以确保它永远不会做出危险或不可能的行为。它就像是一个才华横溢但冲动的司机,身边始终有一位非常严厉且聪明的副驾驶在引导着。
技术摘要:EvoPlan
问题定义
本文旨在解决在部分已知且动态的环境中,执行自然语言机器人任务时满足隐含规范(例如安全规则、社交偏好)的挑战,而这些规范在任务提示词中并未明确说明。作者指出,三个核心难点导致标准解决方案失效:
- 部分可观测性与动态性: 世界模型是不完整的,智能体的轨迹必须进行在线追踪,这导致依赖于全量指定环境的规划器会失效。
- 提示词欠指定(Underspecification): 自然语言任务往往省略了规范性要求。仅针对显式目标进行优化的规划器可能会在满足提示词的同时违反隐含规范(例如,通过闯红灯到达目的地)。
- 单类数据(One-Class Data): 仅有的先验数据由未标注的操作日志组成,其中所有记录的轨迹均为“可接受”的。缺乏标记的违规案例、偏好对或规范的符号化说明,这使得标准的奖励塑造(Reward Shaping)、行为克隆(Behavior Cloning)或基于偏好的强化学习(Preference-based RL)无法适用。
方法论:EvoPlan 框架
EvoPlan 是一个神经符号框架,它将大语言模型(LLM)与形式化验证及进化搜索相结合。该框架分为三个不同的阶段运行:
1. 离线约束挖掘(进化 STL 拟合)
系统从未标注的演示数据中学习一个单一的全局**信号时间逻辑(Signal Temporal Logic, STL)**约束 Φmob。
- 反事实合成: 由于数据是单类的(全部为可接受),系统通过程序化扰动(如超速、拥挤)和基于 LLM 的违规生成器来生成负类数据(D−)。这将问题转化为一个监督分类任务。
- 进化搜索: 受 AlphaEvolve 启发,由 LLM 驱动的进化搜索在信号原子(速度、间距、碰撞时间等)的语法空间内演化 STL 公式。其适应度函数旨在最大化正向集合(D+)上的鲁棒性,同时最小化负向集合(D−)上的满足度,并惩罚复杂度。
- 通用性: 该程序既能恢复成文规则(例如从 nuPlan 日志中提取“在红灯时停止”),也能恢复人口偏好(例如从 SCAND 遥操作数据中提取社交间距)。
2. 进化 PDDL 规划合成
系统采用进化 PDDL 规划器来生成离散动作序列。
- LLM 作为提议机制: LLM 不仅仅是一个独立的规划器,而是针对固定的领域(Domain)和问题(Problem)提出并修复 PDDL 计划。
- 验证器级联(Validator Cascade): 一个程序化级联过程(包括 PDDL 语法检查、VAL 仿真、目标可达性以及 STL 鲁棒性检查)会对候选方案进行评分。
- 迭代修复: LLM 根据来自验证器的具体反馈(例如“动作 X 未满足前提条件 Y”)来调整其下一次的变异。这使得计划的“已验证前缀”能够随迭代过程单调增长。
- 对对齐偏差的鲁棒性: 系统通过使用 LLM 在验证前推导出一个谓词-符号映射,从而处理开放世界场景和词汇不匹配问题(例如,目标是“加热”,而动作是“烤面包”)。
3. 受约束执行环路
在运行时,系统将离散的 PDDL 计划桥接到连续的机器人执行层。
- 路标扩展(Waypoint Expansion): 每个 PDDL 动作都会被分发到导航层(如 Nav2),由其生成一系列路标序列。
- 屏蔽(Shielding): 路标序列会根据挖掘出的全局 STL 约束 Φmob 进行检查。
- 违规重规划: 如果序列违反了 Φmob,该动作将被拒绝。系统提交计划中已验证的前缀,根据当前世界状态更新初始状态,并重新调用规划器以生成新的后缀。这创建了一个闭环系统,只有当安全性或可行性受到威胁时,才会重新激活规划器。
核心贡献
- 数据驱动的 STL 挖掘: 一种通过合成反事实负例,从单类演示数据中提取单一全局移动性约束的方法,适用于基于规则和基于偏好的领域。
- 进化 PDDL 求解器: 一个在形式化验证循环内利用 LLM 进行提议和修复的规划器,展示了对词汇不匹配和开放世界信念增长的鲁棒性。
- 受约束执行架构: 一个运行时环路,将 PDDL 计划编译为路标,并根据学习到的 STL 约束进行验证,并在违反约束时触发重规划,从而在无需重新训练底层策略的情况下确保安全性。
- 本地部署: 整个流水线(包括所有 LLM 调用)均可在本地托管的开源模型(Qwen3-32B)上运行,实现了无需云端依赖的机器人端部署。
实验结果
作者通过三个基准测试评估了该框架:
- STL 约束迁移(屏蔽):
- 驾驶(nuPlan → Bench2Drive): 挖掘出的基于规则的约束使 Qwen2.5-VL 驾驶策略的红灯违规减少了 77%,碰撞减少了 71%,提升了整体驾驶得分。
- 社交导航(SCAND → HA-VLN-CE): 挖掘出的基于偏好的约束使室内导航任务中的可避免接触减少了 82%(PointNav)和 93%(MLP),有效地压缩了安全分布中的“不安全尾部”。
- 规划性能(ALFWorld Text):
- 在开放世界 ALFText 基准测试中,EvoPlan 实现了 98.5% 的成功率,优于强基准模型(如 NL-PDDL 为 94%,直接使用 LLM 约为 20%)。
- 至关重要的是,即使目标词汇与动作模型词汇不匹配,它仍能保持此性能(98.5%),而其他方法性能显著下降。
- 它能够解决深度超过 10 步的最优计划任务,而固定步长的规划器在此类任务中会失败。
- 端到端执行(Gazebo):
- 在一个包含 9–15 名行人的模拟工厂环境中,系统完成了取放任务并表现出平滑的降级能力。虽然由于极端密度导致了一次任务失败,但在五次运行中,系统通过在违反间距阈值时进行重规划,成功维持了低个人空间暴露度并避免了碰撞。
意义与主张
论文声称 EvoPlan 提供了一种“两全其美”的方法:它利用 LLM 的流畅性和上下文感知能力进行计划生成与修复,同时依靠符号验证和基于数据衍生的时间逻辑来保证可执行性和安全性。
作者强调,该系统将神经模型视为候选方案的生成器,而非未经检查的权威来源。通过直接从未标注的操作日志中学习约束,该框架避免了需要手动编写安全规范或标记违规数据的需求。结果表明,这种神经符号环路对于开放世界动态和词汇不匹配具有鲁棒性,为部署无需云端基础设施的安全、自适应机器人规划器提供了一条路径。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。