← 最新论文
💻 computer science

OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning

本文提出了 OneTwoVLA,一种能够自适应切换推理与执行模式的统一视觉 - 语言 - 动作模型,通过构建可扩展的具身推理数据合成管道进行联合训练,显著提升了机器人在长程规划、错误恢复、人机交互及泛化视觉定位等复杂任务中的表现。

原作者: Fanqi Lin, Ruiqian Nai, Yingdong Hu, Jiacheng You, Junming Zhao, Yang Gao

发布于 2026-03-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Fanqi Lin, Ruiqian Nai, Yingdong Hu, Jiacheng You, Junming Zhao, Yang Gao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 OneTwoVLA 的机器人新模型。为了让你轻松理解,我们可以把传统的机器人和这个新模型比作两种不同的“厨师”。

🍳 传统机器人:手忙脚乱的“双厨师”模式

以前的机器人做复杂任务(比如做火锅或调鸡尾酒),通常采用“双系统”模式,就像一家餐厅里有两个厨师在配合:

  1. 大脑厨师(System Two):这是一个非常博学但反应慢的专家。他负责看菜谱、想步骤、做计划。比如:“先放油,再放蛋,最后翻炒。”
  2. 手厨师(System One):这是一个动作极快但没什么主见的执行者。他只听“大脑厨师”的指令,手眼协调地干活。

问题出在哪?

  • 沟通不畅:大脑厨师可能想出一个手厨师根本做不到的动作(比如“用筷子夹起整头大象”),手厨师就会卡住。
  • 反应太慢:大脑厨师思考太慢,等他把计划传到手厨师时,情况可能已经变了(比如油已经溅出来了),手厨师还在按过时的计划干活,导致失败。
  • 缺乏默契:两个厨师各干各的,手厨师不知道大脑在想什么,大脑也不知道手能干什么。

🤖 OneTwoVLA:一位“文武双全”的超级厨师

OneTwoVLA 把这两个角色合二为一了!它既是大脑,也是双手,而且它非常聪明,知道什么时候该“动脑子”,什么时候该“动手”。

1. 核心魔法:自适应切换(Adaptive Reasoning)

想象一下,这位超级厨师在做菜时:

  • 平时(动手模式):当他在切菜、倒油这种常规操作时,他不思考,直接凭肌肉记忆和直觉快速行动。这让他动作飞快,不会卡顿。
  • 关键时刻(动脑模式):一旦遇到关键节点(比如:菜炒糊了要补救、客人突然改主意了、或者刚完成一个步骤需要总结),他会立刻停下来,花几秒钟在脑海里快速过一遍:“刚才发生了什么?下一步该干嘛?有没有出错?”
    • 他会自言自语(生成文字推理):“刚才油放多了,现在需要加个鸡蛋来中和。接下来我要打鸡蛋。”
    • 想清楚后,他再继续动手。

比喻:就像你开车。在直路上,你不需要思考怎么踩油门(动手模式);但遇到红灯或突然窜出一只猫时,你会立刻刹车并思考对策(动脑模式)。OneTwoVLA 就是这种“该快则快,该慢则慢”的机器人。

2. 如何学会这种技能?(数据合成流水线)

光有模型不够,还得有“教材”。传统的机器人数据只有“动作”,没有“思考过程”。
作者们设计了一个全自动的“编剧工厂”:

  • 他们让 AI 生成成千上万张虚拟的桌子图片(上面摆着各种东西)。
  • 然后让 AI 扮演“导演”,为这些图片编写剧本:“场景是……计划是……刚才做了什么……接下来要做什么……"
  • 把这些“带思考过程的剧本”和真实的机器人操作数据混合在一起训练。

比喻:以前的机器人只看过别人怎么切菜的视频(只有动作);现在的机器人不仅看了视频,还读了厨师的日记(知道为什么要先切葱再切肉,以及切错了怎么办)。这让机器人不仅学会了“怎么做”,还学会了“为什么这么做”。


🌟 它有多厉害?(四大超能力)

论文通过实验展示了这位“超级厨师”的四个绝活:

  1. 超长任务规划(做火锅/调酒)

    • 场景:做一桌火锅,步骤很多,还要随机应变。
    • 表现:它能记住“先放肉,再放菜”,如果中间发现肉没夹住,它会停下来想:“哎呀,夹歪了,我得退回去重新夹。”而不是像旧机器人那样死板地继续往上提,结果把锅弄翻。
    • 结果:成功率比旧方法高了 30%。
  2. 错误检测与自救(打翻油瓶)

    • 场景:倒油时手滑了,瓶子掉了。
    • 表现:旧机器人可能还在假装倒油,或者乱动。OneTwoVLA 会立刻发现:“瓶子没拿稳!”然后推理出对策:“我得重新抓得更紧一点,再试一次。”
    • 比喻:就像你走路差点摔倒,身体会自动调整平衡,而不是继续往前冲撞墙。
  3. 自然的人机互动(听人指挥)

    • 场景:你在做鸡尾酒,突然说:“别放橙味伏特加了,我要柠檬味的。”
    • 表现:旧机器人可能还在按原计划倒橙味酒。OneTwoVLA 会立刻停下,思考:“哦,客人改主意了,我得把橙味的放下,去拿柠檬味的。”它甚至能主动问:“您想要哪种蔬菜?”
    • 比喻:它像一个懂眼色的服务员,而不是一个只会执行死命令的机器。
  4. 举一反三的视觉理解(认出新东西)

    • 场景:让它去拿一个它从未在训练数据里见过的东西,比如“那个用来放望远镜的盒子”。
    • 表现:通过阅读大量的“剧本”(合成数据),它理解了“望远镜”和“盒子”的关系,即使没见过实物,也能根据描述找到它。
    • 比喻:就像你虽然没去过南极,但看过很多关于企鹅的纪录片,当有人让你“找那只黑白相间的鸟”时,你能认出来。

🚀 总结

OneTwoVLA 的核心突破在于:它不再把“思考”和“行动”分开,而是把它们融合在一个大脑里。

  • 以前:思考是慢吞吞的顾问,行动是盲目的执行者,两人配合经常掉链子。
  • 现在:它是一位全能选手。平时手脚麻利,关键时刻大脑清醒,能自我纠错,能听懂人话,还能举一反三。

这就好比给机器人装上了一个会思考的“灵魂”,让它从“只会按按钮的机器”进化成了“能像人一样灵活应对复杂世界的智能体”。这对于未来让机器人真正走进家庭(做火锅、调酒、收拾屋子)是至关重要的一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →