← 最新论文
🤖 AI

A Few Words Go a Long Way: Language Guided Robot Policy Synthesis

本文介绍了 ARCHITECT,这是一个利用大语言模型(LLM)编码智能体通过迭代式自然语言修正来合成模块化、可解释的机器人策略的框架,该框架能够构建一个持久的技能库,在复杂的长程操纵任务中表现优于黑盒视觉-语言-动作模型。

原作者: Daphne Chen, Archit Ritesh Jain, Eric Goossen, Emma Romig, Michael Murray, Nick Walker, Maya Cakmak

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Daphne Chen, Archit Ritesh Jain, Eric Goossen, Emma Romig, Michael Murray, Nick Walker, Maya Cakmak

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人做家务,比如折叠一件衬衫或关上抽屉。在机器人领域,有两种主要的方法可以实现这一点。第一种方法就像训练小狗:你向机器人展示成千上万段人类做任务的视频,它试图记住其中的模式。这被称为“从数据中学习”,也是许多现代机器人的工作方式。但问题在于:如果机器人看到了稍微不同的东西——比如颜色不同的衬衫,或者一个有点卡住的抽屉——它往往会感到困惑并失败,而且没人知道它为什么失败了,因为机器人的大脑是一个“黑盒”(一个谜团)。第二种方法就像给人类一份食谱。你写下具体的步骤:“拿起杯子”、“移动到桌子旁”、“放下它”。这被称为“程序合成”。它清晰且逻辑严密,但如果食谱稍有差错,机器人仍可能撞到东西,而且你必须从头开始重写整个食谱。

核心问题是:我们能否结合两者的优点?我们能否拥有一个既能理解我们的语言、遵循清晰指令,又能通过实时学习我们的错误来改进,而无需从头开始重新训练的机器人?这就是让机器人不仅聪明,而且具有“可操控性”的挑战——这意味着我们可以轻松地引导它们纠正错误,就像我们会引导朋友一样。


会通过你的话语学习的“机器人建筑师”

见见 ARCHITECT,这是一个由华盛顿大学、微软研究院和麻省理工学院的研究人员开发的全新机器人大脑。不要把 ARCHITECT 仅仅看作是一个记忆视频的机器人,而要把它看作是一个超级聪明的机器人建筑师,它能即时构建自己的说明书。

ARCHITECT 并不试图通过观察百万张图片来猜测该做什么,而是将机器人任务视为编写计算机程序。当你告诉机器人“折叠毛巾”时,它不会只是瞎猜;它会使用它已经掌握的一套构建模块(如“抓取”、“移动”和“观察”),一步步地编写一段小代码。

这里有一个神奇的技巧:如果机器人搞砸了,你不需要重新训练它。你只需要对它说话。

想象一下你在教一个机器人关抽屉。

  1. 尝试: 机器人编写了一个计划并尝试推抽屉。
  2. 失败: 它推了,但抽屉卡住了,或者它用力过猛导致机器人手臂震动。
  3. 纠正: 你说:“嘿,抽屉卡住了。试着从侧面轻轻推,而不是从正面推。”
  4. 修复: ARCHITECT 不仅仅是针对这一次进行修复。它会重写该特定步骤的代码,将新规则保存到它的**技能库(Skill Library)**中,并永久记住它。

这个技能库就像是机器人的永久笔记本。每当你给出纠正时,机器人就会在笔记本里写下一项新的“技能”。下次面对类似问题时,它会先检查自己的笔记本。这就像拥有一个能从每一次你帮助它纠正的错误中学习的机器人,它会变得越来越聪明,每天所需的纠正也越来越少。

为什么这很重要

研究人员在真实的机器人手臂(Franka Panda)上测试了它,涵盖了 8 种棘手的任务,包括折叠布料、关闭抽屉以及捡起藏在织物下的香蕉。

他们将 ARCHITECT 与当前的“明星级”机器人学习模型(称为 π0\pi0π0.5\pi0.5 的模型)以及其他编码方法进行了对比。结果非常明确:

  • 黑盒模型失败了: 顶尖的 AI 模型经常陷入僵局。例如,当被要求折叠布料时,它们可能会提起布料但无法完成折叠,或者如果你改变了句子的措辞,它们就会感到困惑。在最难的任务中,它们的失败率约为 0% 到 40%
  • ARCHITECT 成功了: 在人类帮助下,ARCHITECT 在 80% 到 100% 的任务中取得了成功。它比处理棘手的布料折叠和隐藏香蕉的任务表现得更好。

但真正的魔力出现在观察投入程度时。

  • 起初,机器人需要人类进行约 4.7 次纠正才能完成任务。
  • 但一旦机器人通过之前的任务建立了它的技能库,对于新的、类似的任务,它只需要 0.8 次纠正。事实上,在研究中的 6 个人中有 3 个人在进行第二个任务时完全不需要任何纠正,因为机器人已经从第一个任务中学到了窍门。

机器人目前还做不到的事

论文谨慎地指出,ARCHITECT 并非完美。它依赖于它拥有的“工具”,比如它的眼睛(摄像头)和它的手(夹持器)。如果摄像头看不清,或者机器人的手太笨拙无法抓取光滑的球,ARCHITECT 仍可能面临困难。研究人员发现,机器人的最大失败点在于抓取物体——如果机器人最初无法正确抓取物体,再多的交谈也无法解决问题。

此外,它需要人类的帮助。它无法独自解决所有问题。研究表明,如果人类只给出一个纠正,机器人可能无法学到足够的东西来应对新的情况。它需要几次高质量的纠正来建立一个强大的“笔记本”。

总结

这篇论文表明,机器人的未来可能不在于喂给它们数百万个视频去记忆。相反,它可能在于对话。通过将机器人控制视为编写代码,并允许人类用简单的语言修复错误,我们可以构建出这样的机器人:

  1. 可解释性: 我们确切知道它们在做什么,因为它们在编写自己的计划。
  2. 适应性: 它们可以在无需昂贵重新训练的情况下学习新技巧。
  3. 高效性: 随着我们对它们说话,它们会变得越来越好。

正如作者所言,“寥寥数语,意义重大。”有了 ARCHITECT,今天的简单纠正可以节省未来的数小时麻烦,将一个笨拙的机器人变成一个真正倾听并能提供帮助的伙伴。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →