Wall-OSS-0.5 Technical Report
本文介绍了 Wall-OSS-0.5,这是一个开源的 4B 参数规模视觉-语言-动作(VLA)模型,它证明了 VLA 预训练本身即可在多种具身形态中产生直接可执行的零样本机器人行为,同时增强了下游微调性能并保留了具备接地能力的视觉-语言能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是关于 Wall-OSS-0.5 技术报告的中文翻译,保留了原有的通俗易懂的风格与创意类比。
核心理念:“一次预训练,处处可行动”
想象一下,你想教一个机器人做家务。通常情况下,你必须先教它基础知识(比如什么是杯子),然后花费数月时间教它特定技能(比如如何拿起那个特定的杯子)。
Wall-OSS-0.5 背后的团队提出了一个大胆的问题:如果我们能让机器人在通用知识和运动能力上训练得足够好,以至于它在无需针对新工作进行额外训练的情况下,就能直接上手执行实际任务,那会怎样?
他们构建了一个名为 Wall-OSS-0.5 的机器人大脑。这是一个“视觉-语言-动作”(Vision-Language-Action, VLA)模型。你可以把它想象成一个既能看(视觉)、又能理解指令(语言)、还能同时移动手臂(动作)的机器人。
他们解决的问题:“教科书 vs. 实践”的差距
在过去,机器人大脑就像是那些读遍了图书馆所有教科书、却从未踏入过厨房的学生。它们完美掌握了理论,但一旦被要求实际烹饪,就会不知所措。
以往大多数机器人模型仅在经过针对特定任务的“微调”(重新训练)后才会接受测试。这留下了一个谜团:最初的训练究竟是教会了机器人如何移动,还是仅仅给了它一个良好的起点?
Wall-OSS-0.5 证明了初始训练确实教会了机器人如何移动。甚至在没有任何特定的“进修学校”式训练之前,机器人仅凭简单的指令,就能执行复杂的任务,如水果分类、叠放圆环,甚至是拉紧绳索(这是一个非常棘手的、处理柔软物体变形的任务)。
他们是如何做到的:“三脚架”模型
为了实现这一目标,他们不仅仅是向机器人喂数据,还使用了一种特殊的训练配方,叫做梯度桥接协同训练(Gradient-Bridged Co-Training)。想象一下,机器人的大脑正由三位各司其职的教练共同训练:
- “动作教练”(离散 Token): 这位教练教机器人像预测句子中的单词一样去预测“下一步动作”。它擅长教大脑掌握运动的“语法”。它扮演着桥梁的角色,向主脑发送强有力的信号,学习如何控制身体。
- “理解教练”(多模态数据): 这位教练确保机器人不会忘记如何阅读、观察和理解世界。它让机器人的认知扎根于现实,使其知道什么是“杯子”,以及“把它放进水槽”是什么意思。
- “流畅操作教练”(流匹配/Flow Matching): 这位教练教机器人如何像舞者一样进行平滑且连续的移动,而不是僵硬、机械的跳跃。这是机器人在现实世界中工作时实际使用的动作方式。
神奇之处在于: 通常情况下,这些教练会产生冲突。“动作教练”想要教大脑如何移动,但“流畅操作教练”使用的是另一种语言。Wall-OSS-0.5 构建了一座桥梁连接了两者。“动作教练”使用大脑理解得最好的语言,而“流畅操作教练”则确保最终的动作流畅且精准。
结果:一个真正能干活的机器人
他们在真实的物理机械臂上测试了这个机器人,共进行了 17 种不同的任务。
- 零样本学习(无需额外训练): 在没有针对这些任务进行任何特定训练的情况下,机器人成功完成了其中几项任务:
- 方块分类: 100% 成功率。
- 水果分类: 96% 成功率。
- 拉紧绳索: 82% 成功率(这非常了不起,因为绳索是松软且难以控制的!)。
- 微调之后: 当他们给予机器人针对 15 个任务的少量特定训练后,它的表现变得更加出色,大幅超越了之前的顶尖机器人模型(提升了 17.5%)。
为什么这很重要(用通俗的话说)
在此之前,人们认为对机器人进行预训练就像是给学生一个很高的 GPA——它有助于学生通过期末考试,但他们仍然需要为具体的测试进行复习。
Wall-OSS-0.5 表明,预训练本身就是一场考试。机器人在大规模训练阶段就已经习得了通用的“肌肉记忆”和“常识”。这就像一个孩子,在玩遍各种玩具并观察大人如何活动后,走进一个新房间时,不需要被明确告知具体做法,也能自己摸索出如何开门或拿起玩具。
技术“秘方”
- 大脑: 它基于一个 30 亿参数的“大脑”(大型语言模型),并经过升级以处理机器人运动。
- 数据: 他们利用来自 20 多种不同类型机器人的超过 100 万次机器人运动数据,以及海量的图像和文本库对其进行了训练。
- 速度: 他们让机器人的思考速度足以实时控制机械臂(每秒 15 次),这对于避免掉落物体至关重要。
总结
Wall-OSS-0.5 之所以是一项突破,是因为它证明了:如果使用正确的“桥接”技术在足够多样化的数据上训练机器人大脑,机器人就不再仅仅是一个聪明的观察者,而是一个能够立即成为胜任的执行者。它可以观察一个凌乱的桌面,理解“收拾一下”这条指令,然后开始分类物品,而无需为桌上的每一件物品都准备一份说明书。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。