← 最新论文
🤖 machine learning

Dynin-Robotics: Omnimodal Unified Diffusion Vision-Language-Action Model

Dynin-Robotics 推出了一种全模态统一扩散模型,该模型将语言、视觉和动作视为离散标记,以共同学习目标预测、动力学建模和动作生成,通过共享轨迹建模和测试时扩展,在多个基准测试中实现了具有竞争力的性能。

原作者: Hoeun Lee, Jaeik Kim, Jusang Oh, Jinhyeok Kim, Geon Choi, Hyeonggeun Kim, Jaeyoung Do

发布于 2026-09-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Hoeun Lee, Jaeik Kim, Jusang Oh, Jinhyeok Kim, Geon Choi, Hyeonggeun Kim, Jaeyoung Do

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

长期以来,机器人一直难以像人类那样理解世界。虽然可以对机器进行编程,让它的手臂移动到特定的坐标,但当任务需要理解诸如“递给我一个用来切割包装的东西”这样模糊的指令时,它往往会失败。为了解决这个问题,研究人员正在构建将语言、视觉和物理运动连接成一个单一“大脑”的系统。这些被称为视觉-语言-动作(vision-language-action)模型的系统,试图不仅学习一个物体是什么,还学习它的行为方式以及如何操纵它。挑战在于,目前大多数方法将这些技能分开处理:系统的某一部分可能理解文字,另一部分可能识别图像,而第三部分则负责计算电机指令。这种分离往往导致机器人在现实世界发生变化或指令以意想不到的方式表达时感到困惑。

首尔大学的一个研究团队推出了一种名为 Dynin-Robotics 的新方法,将这些分离的技能统一成一个连贯的模型。他们并没有为不同的任务构建具有不同模块的机器人大脑,而是创建了一个能够同时以多种方式预测未来的单一系统。想象一下,当给定一个任务时,机器人不仅仅是在计算下一步动作,还在想象动作完成后场景会变成什么样、最终目标状态应该是怎样的,以及如何用语言描述这项任务。通过训练一个能够同时处理所有这些预测的单一模型,研究人员发现,机器人变得更擅长遵循指令,即使这些指令的表达方式与它受训时不同。

该系统的核心是一种称为“掩码扩散”(masked diffusion)的方法。简单来说,这是一种学习过程,模型会被展示一段信息序列——例如一段执行任务的视频、一段书面指令和机器人的运动数据——但该序列中的某些部分被隐藏或“掩码”了。模型的任务是观察可见的部分并猜测隐藏的部分应该是怎样的。例如,它可能看到一张杯子的图片和文字“拿起杯子”,但运动数据被隐藏了,因此它必须预测正确的动作。在另一种场景中,它可能看到运动和指令,但杯子在手中被拿起后的最终画面被隐藏了,因此它必须预测结果。通过在超过 130 万条机器人轨迹的大规模数据集上练习这些不同类型的“猜谜游戏”,模型学会了语言、视觉和动作之间是如何紧密相连的。

这种方法的独特之处在于,同一个模型可以瞬间在这些不同的角色之间切换。它可以作为策略(policy)来决定下一步采取什么行动;作为世界模型(world model)来预测动作后摄像机将看到什么;作为目标预测器(goal predictor)来可视化任务成功的最终状态;或者作为教师(teacher)从机器人工作的视频中重建原始指令。这种灵活性使得系统能够利用自身的预测来提高性能。例如,在机器人决定如何移动手臂之前,它可以先预测目标状态看起来是什么样的。然后,它利用这个预测的目标作为引导,来优化其行动计划。这种向前看并实时调整计划的过程,有助于机器人处理需要精确对齐的复杂任务,例如将花插入花瓶或按特定顺序堆叠积木。

研究人员在各种基准测试上测试了这个系统,以观察其表现如何优于其他领先的机器人模型。在标准的模拟任务中,该模型实现了 98.1% 的成功率,位列该领域的顶尖水平。更重要的是,当在指令变得更加间接或抽象的任务中进行测试时,该系统展现出了显著的适应能力。在一组实验中,模型接受了一项任务,它必须根据“天然甜美多汁的东西”这类描述而非直接命令(如“拿起苹果”)来选择水果。虽然其他模型在面对这种语言转变时表现挣扎,但 Dynin-Robotics 保持了很高的成功率,证明它学习的是任务的底层概念,而非仅仅死记硬背特定的短语。

该系统在现实世界中也证明了其有效性。研究人员将该模型部署在名为 Franka Research 3 的物理机器人手臂上。在涉及拿起水果、对彩色立方体进行分类以及按用户指定的颜色顺序堆叠这些任务的一系列现实世界测试中,机器人在四种不同的操作条件下实现了 78.4% 的平均成功率。这种表现特别是在需要遵循步骤序列的任务中表现强劲,例如按颜色顺序堆叠立方体。通过可视化目标和中间步骤的能力,机器人可以在犯错时纠正自己的航向,而这种能力在较简单的系统中通常是缺失的。

除了控制机器人的能力外,该模型还展示了理解和生成描述的惊人能力。当看到机器人执行任务的视频时,系统可以准确地描述正在发生的事情,使用诸如“拿起”、“放置”和“折叠”之类的动词,并识别物体的颜色和位置。反之,当给定任务描述时,它可以生成一个关于最终场景看起来会是什么样的视觉预测。这些能力表明,该模型已经建立了一个超越简单电机控制的、关于物理世界的丰富内部表征。

为了使该系统足够快以进行实时使用,研究人员还开发了一种专门运行模型的方法。因为该模型通过迭代优化其猜测过程,如果必须逐一处理每一个步骤,可能会变得很慢。团队创建了一种技术,允许模型同时预测并提交多个步骤的运动。这种优化使机器人的决策过程比标准方法快了近 30 倍,使其能够在能够跟上物理机器人速度的硬件上运行复杂的模型。

这项工作的发现表明,将机器人学习视为一个统一的预测问题是一种强大的策略。通过将理解语言、预测视觉变化和生成动作的能力结合到一个单一框架内,研究人员创建了一个比以往模型更具鲁棒性和适应性的系统。Dynin-Robotics 的成功表明,当机器人能够想象未来并理解任务的上下文时,它就能更胜任处理现实世界不可预测性的工作。尽管仍有大量工作要做,特别是扩展这些能力到更长且更复杂的动作序列方面,但这种方法为实现真正理解并能与环境互动的机器人提供了一条充满希望的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →