← 最新论文
💻 computer science

EvoPlan: Evolutionary Neuro-Symbolic Robot Planning with Spatio-Temporal Guarantees

本文介绍了 EvoPlan,这是一个神经符号框架,它通过集成进化搜索从演示中挖掘时空约束,并将这些约束与进化 PDDL 规划器及约束执行循环相结合,使基于大语言模型的机器人能够在开放世界环境中生成具有形式化保证的安全且可执行的规划。

原作者: Bhavya Sai Nukapotula, Samin Moosavi, Haoze Wang, Luke Duncan, Diya Shakkottai, Varun Murali, Srinivas Shakkottai

发布于 2026-07-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Bhavya Sai Nukapotula, Samin Moosavi, Haoze Wang, Luke Duncan, Diya Shakkottai, Varun Murali, Srinivas Shakkottai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人如何在繁忙的世界中导航,比如工厂里的送货机器人或城市中的自动驾驶汽车。你有两个主要工具来帮助它,但两者都有一个重大缺陷:

  1. “创意作家”(AI/LLM): 这是一个聪明的 AI,它可以阅读你的指令(“去食堂”)并制定出一个巧妙的计划。它擅长理解语境并修复错误。问题在于: 它有点鲁莽。它可能会制定出一个听起来不错但物理上无法实现的计划,或者因为它没有“思考”规则,可能会不小心闯红灯。
  2. “严谨会计”(经典规划器): 这是一个僵化的、基于规则的系统。它只有在你给它一个完美的、数学化的世界描述时才能工作。问题在于: 它很难理解自然语言或修复自己的错误。如果世界发生轻微变化,它就会陷入停滞。

EvoPlan 是一个全新的框架,它结合了两者的优点。它利用“创意作家”来构思计划,并利用“严冥会计”来确保计划的安全性和可执行性。以下是它的工作原理,分为三个简单的步骤:

1. “影子教练”(学习规则)

在机器人开始移动之前,系统需要学习道路或工厂车间的“潜规则”。

  • 问题: 研究人员只有关于“良好”行为的视频(例如安全驾驶或礼貌行走的人),而没有关于“错误”行为的视频来向机器人展示什么是不该做的。
  • 解决方案: 系统充当了一个创意写作教练。它提取一段良好的驾驶视频,然后询问 AI:“如果驾驶员加速会怎样?如果他们闯红灯会怎样?”它通过发明这些“错误”场景(反事实场景)来制造对比。
  • 结果: 通过将“良好”的视频与发明的“错误”场景进行对比,系统学习到了一个单一且通用的规则手册(称为 STL 约束)。你可以把它理解为一个“影子教练”,在机器人耳边低语:“永远不要快于 X 速度”,或者 “始终与人保持 Y 米距离”。这个规则手册适用于机器人的每一次动作。

2. “进化编辑师”(构建计划)

现在,机器人需要一个从 A 点到 B 点的计划。

  • 过程: “创意作家”(AI)提出一个计划。但系统并不会直接接受它,而是将其置于一个严格的编辑过程中。
  • 循环:
    1. AI 写出一份计划草案。
    2. “验证器”(会计)检查它。如果计划出错了(例如:“你不能打开一扇不存在的门”),验证器会标出具体的错误。
    3. AI 阅读错误信息,修复该特定部分,然后再次尝试。
    4. 这个过程周而复始,就像作家不断精炼故事直到它完美为止。
  • 神奇之处: 系统会保留已经过检查的计划中的“优秀部分”,并且只重写出错的部分。随着时间的推移,计划变得越来越长、越来越可靠,直到它完全符合规范。

3. “安全守门员”(实时执行)

最后,机器人开始移动。这是“影子教练”和“安全守门员”接管工作的时刻。

  • 检查: 机器人并不会盲目地执行计划。在采取每一个动作(或转动一次轮子)之前,系统都会根据第一步中学到的规则手册进行检查。
  • 安全网:
    • 场景 A: 机器人计划左转。守门员检查:“那里有行人吗?速度安全吗?” 是的。 机器人移动。
    • 场景 B: 机器人计划左转。守门员检查:“等等,行人离得太近了!” 不。 机器人立即停止。
  • 重新规划: 如果守门员说“不”,机器人并不会发生碰撞。它会锁定已经完成的所有安全步骤,更新当前位置,并要求“进化编辑师”为剩余的旅程编写一个新计划。

为什么这很重要

论文表明,该系统的表现优于仅使用 AI 或仅使用规则。

  • 在驾驶方面: 在驾驶数据测试中,该系统在不需要重新训练驾驶 AI 的情况下,显著减少了碰撞和闯红灯的行为。它只是增加了一个“护栏”,阻止了错误动作的发生。
  • 在导航方面: 在复杂的开放世界谜题(如在房子里寻找物体)测试中,即使指令中使用的词汇与机器人的词汇不完全匹配,该系统解决任务的能力也高于其他 AI 规划器。

简而言之: EvoPlan 是一个机器人规划系统,它利用 AI 来实现创意和灵活性,但强制它戴上一个(从数据中学习到的)“安全头盔”并遵循一个(由代码检查的)“规则手册”,以确保它永远不会做出危险或不可能的行为。它就像是一个才华横溢但冲动的司机,身边始终有一位非常严厉且聪明的副驾驶在引导着。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →