这篇论文介绍了一个名为 OneTwoVLA 的机器人新模型。为了让你轻松理解,我们可以把传统的机器人和这个新模型比作两种不同的“厨师”。
🍳 传统机器人:手忙脚乱的“双厨师”模式
以前的机器人做复杂任务(比如做火锅或调鸡尾酒),通常采用“双系统”模式,就像一家餐厅里有两个厨师在配合:
- 大脑厨师(System Two):这是一个非常博学但反应慢的专家。他负责看菜谱、想步骤、做计划。比如:“先放油,再放蛋,最后翻炒。”
- 手厨师(System One):这是一个动作极快但没什么主见的执行者。他只听“大脑厨师”的指令,手眼协调地干活。
问题出在哪?
- 沟通不畅:大脑厨师可能想出一个手厨师根本做不到的动作(比如“用筷子夹起整头大象”),手厨师就会卡住。
- 反应太慢:大脑厨师思考太慢,等他把计划传到手厨师时,情况可能已经变了(比如油已经溅出来了),手厨师还在按过时的计划干活,导致失败。
- 缺乏默契:两个厨师各干各的,手厨师不知道大脑在想什么,大脑也不知道手能干什么。
🤖 OneTwoVLA:一位“文武双全”的超级厨师
OneTwoVLA 把这两个角色合二为一了!它既是大脑,也是双手,而且它非常聪明,知道什么时候该“动脑子”,什么时候该“动手”。
1. 核心魔法:自适应切换(Adaptive Reasoning)
想象一下,这位超级厨师在做菜时:
- 平时(动手模式):当他在切菜、倒油这种常规操作时,他不思考,直接凭肌肉记忆和直觉快速行动。这让他动作飞快,不会卡顿。
- 关键时刻(动脑模式):一旦遇到关键节点(比如:菜炒糊了要补救、客人突然改主意了、或者刚完成一个步骤需要总结),他会立刻停下来,花几秒钟在脑海里快速过一遍:“刚才发生了什么?下一步该干嘛?有没有出错?”
- 他会自言自语(生成文字推理):“刚才油放多了,现在需要加个鸡蛋来中和。接下来我要打鸡蛋。”
- 想清楚后,他再继续动手。
比喻:就像你开车。在直路上,你不需要思考怎么踩油门(动手模式);但遇到红灯或突然窜出一只猫时,你会立刻刹车并思考对策(动脑模式)。OneTwoVLA 就是这种“该快则快,该慢则慢”的机器人。
2. 如何学会这种技能?(数据合成流水线)
光有模型不够,还得有“教材”。传统的机器人数据只有“动作”,没有“思考过程”。
作者们设计了一个全自动的“编剧工厂”:
- 他们让 AI 生成成千上万张虚拟的桌子图片(上面摆着各种东西)。
- 然后让 AI 扮演“导演”,为这些图片编写剧本:“场景是……计划是……刚才做了什么……接下来要做什么……"
- 把这些“带思考过程的剧本”和真实的机器人操作数据混合在一起训练。
比喻:以前的机器人只看过别人怎么切菜的视频(只有动作);现在的机器人不仅看了视频,还读了厨师的日记(知道为什么要先切葱再切肉,以及切错了怎么办)。这让机器人不仅学会了“怎么做”,还学会了“为什么这么做”。
🌟 它有多厉害?(四大超能力)
论文通过实验展示了这位“超级厨师”的四个绝活:
超长任务规划(做火锅/调酒)
- 场景:做一桌火锅,步骤很多,还要随机应变。
- 表现:它能记住“先放肉,再放菜”,如果中间发现肉没夹住,它会停下来想:“哎呀,夹歪了,我得退回去重新夹。”而不是像旧机器人那样死板地继续往上提,结果把锅弄翻。
- 结果:成功率比旧方法高了 30%。
错误检测与自救(打翻油瓶)
- 场景:倒油时手滑了,瓶子掉了。
- 表现:旧机器人可能还在假装倒油,或者乱动。OneTwoVLA 会立刻发现:“瓶子没拿稳!”然后推理出对策:“我得重新抓得更紧一点,再试一次。”
- 比喻:就像你走路差点摔倒,身体会自动调整平衡,而不是继续往前冲撞墙。
自然的人机互动(听人指挥)
- 场景:你在做鸡尾酒,突然说:“别放橙味伏特加了,我要柠檬味的。”
- 表现:旧机器人可能还在按原计划倒橙味酒。OneTwoVLA 会立刻停下,思考:“哦,客人改主意了,我得把橙味的放下,去拿柠檬味的。”它甚至能主动问:“您想要哪种蔬菜?”
- 比喻:它像一个懂眼色的服务员,而不是一个只会执行死命令的机器。
举一反三的视觉理解(认出新东西)
- 场景:让它去拿一个它从未在训练数据里见过的东西,比如“那个用来放望远镜的盒子”。
- 表现:通过阅读大量的“剧本”(合成数据),它理解了“望远镜”和“盒子”的关系,即使没见过实物,也能根据描述找到它。
- 比喻:就像你虽然没去过南极,但看过很多关于企鹅的纪录片,当有人让你“找那只黑白相间的鸟”时,你能认出来。
🚀 总结
OneTwoVLA 的核心突破在于:它不再把“思考”和“行动”分开,而是把它们融合在一个大脑里。
- 以前:思考是慢吞吞的顾问,行动是盲目的执行者,两人配合经常掉链子。
- 现在:它是一位全能选手。平时手脚麻利,关键时刻大脑清醒,能自我纠错,能听懂人话,还能举一反三。
这就好比给机器人装上了一个会思考的“灵魂”,让它从“只会按按钮的机器”进化成了“能像人一样灵活应对复杂世界的智能体”。这对于未来让机器人真正走进家庭(做火锅、调酒、收拾屋子)是至关重要的一步。
这是一篇关于 OneTwoVLA 的论文技术总结,该模型发表于 ICLR 2026。OneTwoVLA 是一个统一的视觉 - 语言 - 动作(Vision-Language-Action, VLA)模型,旨在解决机器人“推理”与“行动”之间的协同问题。
以下是该论文的详细技术总结:
1. 研究背景与问题 (Problem)
- 核心挑战:通用机器人需要具备“推理”(System 2,慢速、高层规划)和“行动”(System 1,快速、底层控制)的协同能力。
- 现有方法的局限:
- 双系统架构(Dual-System):目前主流方法将高层推理(如预训练 VLM)与底层行动(如 VLA)分离。这导致两个系统缺乏对彼此能力的相互认知(System 2 可能生成 System 1 无法执行的指令),且存在显著的延迟问题(System 2 响应滞后导致指导过时)。
- 单一 VLA 的不足:传统的 VLA 模型虽然行动迅速,但缺乏长程规划、错误检测和复杂场景下的推理能力,泛化性较差。
- 效率与效果的权衡:如果在每一步都进行推理,会严重降低推理效率;如果不进行推理,则无法处理复杂任务。
2. 方法论 (Methodology)
2.1 OneTwoVLA 框架
OneTwoVLA 是一个单一的统一模型,能够自适应地在“推理模式”和“行动模式”之间切换:
- 自适应推理机制:
- 模型引入两个特殊决策 Token:[BOR] (Beginning of Reasoning) 和 [BOA] (Beginning of Action)。
- 推理模式:在关键节点(如子任务完成、检测到错误、需要人类交互时),模型生成自然语言推理内容(场景描述、任务计划、历史总结、下一步指令)。
- 行动模式:在其他时刻,模型基于最新的推理内容直接生成动作块(Action Chunk)。
- 优势:仅在关键步骤进行推理,既保证了长程任务的规划能力,又保持了与纯行动模型相当的高效推理速度(如图 2 所示,总耗时与无推理的 π0 相当,远低于双系统架构)。
2.2 数据构建策略
为了训练这种协同能力,作者设计了两种数据构建流程:
- 具身推理机器人数据 (Embodied Reasoning Robot Data):
- 将人类专家演示的轨迹分割为“推理区间”和“行动区间”。
- 推理区间:标注关键步骤的文本推理内容(场景、计划、历史、下一步)。
- 行动区间:模型学习基于当前状态和最新推理内容预测动作。
- 特别收集了错误恢复和人机交互的数据,使模型学会在失败时重新规划或在歧义时主动询问。
- 可扩展的具身推理视觉 - 语言数据合成 (Scalable Synthesis):
- 为了解决机器人数据稀缺问题,利用基础模型(Gemini 2.5 Pro, FLUX.1-dev)构建了一个全自动流水线。
- 流程:生成桌面布局文本描述 → 合成高质量图像(添加鱼眼畸变、机械臂遮挡等增强) → 生成任务指令及对应的推理内容。
- 规模:生成了 16,000 个样本,涵盖视觉定位(Visual Grounding)和长程规划任务。
2.3 模型实现
- 基于 π0 (Black et al., 2024) 作为基座 VLA。
- 视觉语言部分用于自回归生成文本推理;动作专家部分使用流匹配(Flow Matching)损失函数训练,以建模复杂的连续动作分布。
- 输入包含多视角图像、参考图像(防止状态描述过时)、语言指令、最新推理内容及机器人本体状态。
3. 关键贡献 (Key Contributions)
- 统一的推理 - 行动架构:提出了首个能自适应切换“思考”与“行动”模式的单一 VLA 模型,解决了双系统架构中的延迟和认知割裂问题。
- 具身推理数据合成流水线:设计了一套可扩展的自动化流程,生成了高质量的、富含推理逻辑的视觉 - 语言数据,显著提升了模型的泛化能力。
- 四大核心能力提升:
- 长程任务规划:能动态调整计划,跟踪任务进度。
- 错误检测与恢复:实时检测失败(如抓取失败、物体滑落)并自主规划恢复策略。
- 自然的人机交互:能主动澄清歧义,并根据人类指令实时调整后续动作。
- 可泛化的视觉定位:能理解空间关系、物体属性和语义特征,甚至泛化到训练数据中未出现的物体。
4. 实验结果 (Results)
实验在真实世界机器人平台上进行,对比了 π0(无推理 VLA)和双系统架构(Hi Robot 等):
- 长程任务规划:
- 在火锅(Hotpot)、番茄炒蛋(Tomato-Egg)、鸡尾酒(Cocktail)三个复杂任务中,OneTwoVLA 的平均成功率达到 87%。
- 比 π0 高出 30%,比双系统架构高出 24%。
- 在“通用规划”测试中(如“帮我醒醒”、“给我一杯冰可乐”),结合合成数据训练的 OneTwoVLA-VL 展现了极强的常识推理和泛化能力(成功率 60%-80%),而基线模型几乎完全失败。
- 错误恢复:
- 在 Hotpot 和 Tomato-Egg 任务中,OneTwoVLA 的错误恢复成功率为 80.0%,显著优于 π0 (57.1%) 和双系统 (58.3%)。
- 人机交互:
- 在 20 次交互测试中,OneTwoVLA 成功处理了 100% 的交互(包括澄清指令和应对突发修改),而双系统架构仅达到 65%。
- 视觉定位:
- 在开放世界(Open-World)设置下,OneTwoVLA-VL 在未见过的物体上取得了 73% 的成功率,证明了合成数据有效激活了预训练模型中的常识知识。
5. 意义与结论 (Significance)
- 范式转变:OneTwoVLA 证明了将“系统 1"(直觉/行动)和“系统 2"(反思/推理)统一在单一模型中是可行的,且比分离架构更高效、更鲁棒。
- 数据驱动:展示了通过合成富含推理逻辑的视觉 - 语言数据,可以低成本地大幅提升机器人模型的泛化能力和复杂任务处理能力。
- 实际应用:该模型能够完成如制作火锅、调制鸡尾酒等高难度、长程、需要精细操作和动态调整的任务,为通用服务机器人的落地提供了新的技术路径。
局限性:目前推理步骤的触发仍依赖人工设计的启发式规则(未来可用 RL 优化);推理过程会导致机器人暂停 2-3 秒(未来可探索异步架构);推理内容过长时仍会影响效率。
总体而言,OneTwoVLA 通过统一架构和高质量的数据合成,在机器人长程规划、容错能力和人机交互方面取得了显著突破。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。