← 最新论文
💻 computer science

Emergent Neural Automaton Policies: Learning Symbolic Structure from Visuomotor Trajectories

该论文提出了 ENAP 框架,通过从视觉运动轨迹中自适应地推断可解释的 Mealy 状态机作为高层规划器,并引导底层残差网络进行连续控制学习,从而在无需特定任务标签的情况下实现了长程机器人任务的高样本效率与可解释性。

原作者: Yiyuan Pan, Xusheng Luo, Hanjiang Hu, Peiqi Yu, Changliu Liu

发布于 2026-03-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Yiyuan Pan, Xusheng Luo, Hanjiang Hu, Peiqi Yu, Changliu Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 ENAP(Emergent Neural Automaton Policy,即“涌现神经自动机策略”)的新方法,旨在解决机器人学习复杂、长时间任务时的难题。

为了让你轻松理解,我们可以把机器人学习做任务的过程,想象成教一个刚入职的实习生(机器人)完成一项复杂的“组装乐高”或“整理房间”的工作。

1. 核心问题:为什么现在的机器人学得很慢?

  • 传统方法(端到端大模型): 就像让实习生死记硬背每一帧画面和每一个动作。
    • 比喻: 你给实习生看一万次“拿杯子”的视频,他记住了“手往左移 5 厘米,再往下压 2 厘米”。但如果杯子稍微偏了一点,或者光线变了,他就懵了,因为他是靠“肌肉记忆”硬背的,没有理解背后的逻辑。这需要海量的数据,而且是个“黑盒”,你不知道他为什么这么做。
  • 旧式符号方法: 就像给实习生一本死板的说明书。
    • 比喻: 说明书上写着:“如果看到红色,就抓;如果看到蓝色,就放”。但这需要人类专家把规则一条条写出来。如果任务变复杂了(比如杯子是半透明的),说明书就失效了,因为人类很难穷尽所有情况。

2. ENAP 的解决方案:让机器人自己“悟”出逻辑

ENAP 的核心思想是:让机器人自己从观察中“涌现”出一套逻辑结构,既像人一样有直觉(反应快),又像人一样有逻辑(会规划)。

我们可以把 ENAP 的工作流程想象成**“先画地图,再开车”**:

第一步:自动画地图(结构发现)

机器人先看专家演示的视频(比如如何把积木插进孔里)。它不会死记硬背每一帧,而是像侦探一样,自动把连续的动作拆解成几个关键的**“阶段”**(State)。

  • 比喻: 想象你在学做一道复杂的菜。
    • 普通机器人:记住“切葱 3 秒,炒 5 秒,加盐 2 克..."。
    • ENAP 机器人:自动发现这道菜有四个关键阶段:
      1. 准备阶段(洗菜、切菜)
      2. 热锅阶段(倒油、烧油)
      3. 烹饪阶段(下菜、翻炒)
      4. 出锅阶段(装盘)
    • 它甚至能发现**“分支逻辑”:如果油温不够,就回到“热锅阶段”;如果菜炒糊了,就自动“回退”到上一步重试。这就叫“自动故障恢复”**(就像图 1 里展示的,插不进去就退出来再试一次)。

第二步:粗调 + 微调(双层控制)

有了这个“地图”(状态机)后,ENAP 用两层网络来指挥机器人:

  1. 高层大脑(状态机/System 2): 负责**“看大局”**。
    • 比喻: 就像导航仪。它告诉机器人:“现在我们在‘热锅阶段’,目标是‘油温合适’,所以接下来的大方向是‘继续加热’。”它不需要知道手具体动多少毫米,只负责切换任务模式。
  2. 低层手脚(残差网络/System 1): 负责**“干细活”**。
    • 比喻: 就像司机的肌肉。它接收导航仪的指令(“继续加热”),然后根据眼前的具体情况(油温稍微低了一点,或者手抖了一下),微调动作(“再加热 0.5 秒”或“手往右偏 1 毫米”)。

关键点: 这种分工让机器人既不需要像死记硬背那样学海量数据(因为逻辑已经由“地图”概括了),也不需要人类专家来写死板的规则(因为“地图”是机器人自己从数据里“悟”出来的)。

3. 这个方法的厉害之处(实验结果)

论文通过实验证明,ENAP 就像是一个**“天赋异禀且善于总结的实习生”**:

  • 数据少也能学会(样本效率高):
    • 比喻: 别人学做 100 道菜需要看 1000 遍视频,ENAP 看 10 遍就能总结出“炒菜”的通用逻辑,然后举一反三。在数据很少的情况下,它的成功率比目前最先进的 AI 模型(VLA)高出很多。
  • 能自己纠错(鲁棒性):
    • 比喻: 如果机器人插积木插歪了,普通机器人可能会继续硬插导致失败。但 ENAP 的“地图”里有“如果插不进去,就退回来”的逻辑分支,它能自动发现错误并回到上一步重试,就像人一样有“后悔药”。
  • 解释性强(白盒):
    • 比喻: 你可以清楚地看到机器人的“思考过程”:它现在处于“抓取”阶段,正准备切换到“放置”阶段。不像大模型那样是个黑盒子,你不知道它为什么突然乱动。

4. 总结

ENAP 就是给机器人装了一个“自动生成的思维导图”和“灵活的执行手脚”。

它不再让机器人像鹦鹉学舌一样死记硬背,而是让它学会**“分阶段思考”。遇到复杂任务,它先拆解成几个小目标(状态),每个目标里再灵活调整动作。这种方法让机器人学得快、懂得多,而且出了问题知道怎么自己想办法解决,是通往通用智能机器人**的重要一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →