← 最新论文
💻 computer science

Vision Language Action (VLA) Models for Unmanned Aerial Robotics and Bimanual Manipulation: A Review

本综述通过对 2017 年至 2026 年间的 183 项研究成果进行综合分析,旨在展示最初为复杂双臂操作而开发的视觉-语言-动作(VLA)模型,如何通过共享的协调策略、训练方案和动作表示,有效地应用于解决无人机机器人领域的挑战。

原作者: Inkyu Sa, Chanoh Park, Hea-Min Lee, Donghee Noh, Ho Seok Ahn

发布于 2026-07-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Inkyu Sa, Chanoh Park, Hea-Min Lee, Donghee Noh, Ho Seok Ahn

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是使用简单语言和日常类比对该论文进行的解释。

核心理念:教机器人同时进行“思考”与“行动”

想象一下,你正在教一个机器人折叠毛巾,或者教一架无人机飞向某栋特定的建筑。在过去,你必须手动编写每一个动作的程序,就像为每一步都提供带有精确测量值的食谱一样。

这篇论文综述了一种新型的机器人大脑,称为 VLA(视觉-语言-动作)模型。可以将 VLA 想象成一个读遍了整个互联网(图像和文本)并了解世界运作方式的机器人。现在,你只需要对它说话:“折叠毛巾”或“飞向那栋红色的建筑”。机器人会观察它的摄像头,理解你的话语,并由它自己搞定物理层面的动作。

论文重点讨论了两个对机器人来说非常困难的任务:

  1. 双臂机器人(Bimanual): 就像人类使用双手折叠衣物或组装纸箱一样。
  2. 飞行机器人(无人机): 比如一架需要一边平稳飞行,一边可能还要拿着机械爪去抓取物品的无人机。

作者认为,我们用来教双臂机器人的技巧,正是教导飞行无人机所需的完全相同的技巧。


工作原理:“大脑”与“肌肉”

论文将这些机器人的构建分解为三个主要部分:

1. 大脑(视觉-语言模型)
想象一个拥有看过数百万个 YouTube 视频并读过数百万本书的大脑。它知道什么是“毛巾”,知道“折叠”是什么样子,也知道什么是“红色建筑”。这部分机器人能够理解你的语言和摄像头的图像。

2. 肌肉(动作生成)
一旦大脑理解了目标,它就需要告诉机器人的手臂或电机该做什么。论文对比了机器人决定动作的三种方式:

  • “逐字逐句”法(自回归法/Autoregressive): 机器人尝试像描述句子一样描述动作,一次一个词(例如,“向左移动”,然后“向上移动”)。这种方式很慢,且动作可能显得笨拙,就像试图通过逐一说出“踩油门”然后“转方向盘”来驾驶汽车一样。
  • “去噪”法(扩散模型/Diffusion): 想象机器人从一团模糊、随机的动作开始,然后慢慢将其清理干净,直到它看起来像一条平滑的路径。这就像是用一块粘土雕刻出一尊雕像。它非常精确,但“雕刻”过程需要很长时间。
  • “流”法(流匹配/Flow Matching): 这是目前的优胜者。想象机器人学习的是一条平滑的河流水流。它不是在猜测路径,而是学习一种自然携带落叶从 A 点到 B 点的水流。它快速、平滑,非常适合协调双臂或无人机的飞行。

3. “分块”(Chunking)技巧
机器人不仅仅是预测下一瞬间的动作,而是会一次性预测未来一整块(例如接下来 1 秒钟)的动作。

  • 类比: 想象你在玩电子游戏。如果你只计划下一步,你可能会错过跳跃。但如果你将接下来的 10 步作为一个连贯的平滑动作进行规划,你就能更好地应对障碍物。这有助于机器人让两只手臂保持完美的同步运动。

两大主要挑战

1. 双臂舞步(双臂操作)
折叠一件衬衫很难,因为你的左手必须拿着衬衫,而右手负责折叠。如果它们配合得不完美,衬衫就会起皱。

  • 论文的发现: 最好的机器人不会分别指挥左手和右手移动。相反,它们将两只手臂视为一个整体团队。它们在单个“分块”中同时预测两只手臂的运动。
  • 结果: 使用这种方法的机器人,其折叠毛巾的成功率在短短几年内,从大约 30% 提升到了 90% 以上。

2. 飞行机器人(无人机技术)
驾驶无人机就像用手平衡一根扫帚,非常不稳定。如果你再加上一个用于抓取物品的机械爪,难度会进一步增加。

  • 论文的发现: 同样的“双臂”技巧也适用于无人机。带机械爪的无人机本质上是一个既要控制飞行,又要操作“单臂”的机器人。论文表明,用于折叠毛巾的“流”法和“分块”法也是让无人机飞行平稳并完成抓取任务的最佳方式。

机器人如何学习:从观察到练习

论文解释说,仅仅给机器人看一段人类做任务的视频是不够的,机器人还需要练习。

  • 模仿学习(Imitation Learning): 机器人通过观察人类(通过遥操作)来模仿他们。这就像学生抄袭老师的作业。
  • 问题所在: 如果老师犯了错,机器人也会模仿这个错误。此外,人类的操作通常是缓慢且谨慎的。
  • 解决方案(RECAP): 论文强调了一种新的方法,即让机器人进行自主练习。它尝试执行任务,然后由一个“评委”(另一个 AI)告诉它成功还是失败。机器人随后再次尝试,从自身的失败中学习。
  • 类比: 这就像一个学生不仅抄写老师的作业,还会参加模拟测试,根据评分纠正错误,并不断学习,直到拿到 A 等级。这种方法让机器人的成功率比人类能教给它们的水平还要高出 10% 到 40%。

未来展望:下一步是什么?

论文最后提出了一个路线图,指出虽然我们取得了巨大进步,但仍存在障碍:

  1. 标准化测试: 目前,每个实验室都在用不同的任务测试机器人。我们需要一个标准的机器人“驾照”考试,以便公平地比较谁的表现更好。
  2. 安全性: 拥有双臂或飞行能力的机器人需要在人类周围保持安全。我们需要更好的方法来保证它们不会撞毁或伤及他人。
  3. 现实世界的可靠性: 机器人在实验室表现出色,但现实世界是混乱的(有风、地面湿滑、光线诡异)。我们需要能够应对这些突发状况而不损坏的机器人。
  4. “双系统”设计: 最有前景的路径是“慢大脑,快肌肉”的方法。一个聪明但反应较慢的大脑负责制定计划(例如,“去厨房”),而一个快速且简单的肌肉系统负责处理快速动作(例如,“手臂向左移动 5 英寸”)。这种将“思考”与“执行”分离的设计,可以使过程更快、更安全。

总结

这篇论文综서了机器人如何学习利用视觉、听觉和大脑来驱动身体运动。它表明,教机器人使用双手或驾驶无人机的最佳方式,是让它学习平滑且连续的运动(流匹配),并让它进行自主练习(强化学习)。技术正在飞速发展,正在将科幻小说转化为可以折叠衣服和驾驶无人机的现实工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →