✨ 要点🔬 技术摘要
这篇论文介绍了一个名为 Habilis-β 的机器人“大脑”。你可以把它想象成一个既跑得快、又特别皮实、还能在本地电脑上独立工作的超级机器人管家 。
现在的机器人虽然聪明,但有两个大毛病:要么动作太慢 (像树懒一样),要么跑一会儿就“死机”需要人帮忙重启 (像没电的玩具)。Habilis-β 就是为了解决这些问题而生的。
下面我用几个生活中的比喻来给你讲讲它是怎么做到的:
1. 它是怎么变“快”的?(Fast-Motion)
比喻:像老司机开车 vs. 新手教练 普通的机器人像刚拿驾照的新手,不管前面是空旷的高速公路还是狭窄的停车场,都小心翼翼地慢慢开,生怕撞车。
Habilis-β 的做法 :它学会了**“看路况开车”**。
在空旷的地方(比如从桌子走到椅子),它像老司机一样全速冲刺 (这叫“空间感知降采样”技术 ESPADA)。
一旦到了需要精细操作的地方(比如拿起一个易碎的杯子),它立刻切换成**“绣花模式”**,慢下来精准操作。
结果 :它把原本浪费在“慢吞吞走路”上的时间省下来了,干活效率直接翻倍。
2. 它是怎么变“皮实”的?(Long-Lasting)
比喻:像练过“打地鼠”的机器人 现在的机器人训练通常是这样:教它一次“把杯子放桌上”,成功了就结束。这就像只教学生做一道题,而且每次题目都重新摆好。 但在现实工厂里,机器人要连续工作一小时 ,杯子可能会歪,桌子可能会脏,状态会慢慢变差。普通机器人遇到这种情况就懵了,需要人过来帮忙。
Habilis-β 的做法 :它用了两种“特训”:
“玩耍”训练(Play Data) :在没教具体任务前,先让它像小孩一样乱玩(抓抓这个、推推那个)。这让它学会了**“怎么在出错后把自己救回来”**的通用本能。
“循环”训练(Cyclic Data) :不是教它做一次,而是让它连续做一千次 。它学会了处理“做完一次后,下一次开始时状态有点不一样”的情况。
结果 :它像是一个经验丰富的老员工,即使连续工作几小时,即使环境有点乱,也能自己调整,很少需要人插手。
3. 它是怎么在“本地”工作的?(On-Device)
比喻:像带“超级大脑”的智能手机 很多机器人需要连到云端服务器才能思考,就像手机没网就变砖头。如果网络卡顿,机器人反应就慢,甚至撞车。
Habilis-β 的做法 :它把原本巨大的“大脑”通过**“蒸馏”技术**(就像把一大锅浓汤熬成一小瓶高浓缩精华),压缩得足够小,可以直接装在机器人自带的芯片(像 NVIDIA Jetson)上。
结果 :它不需要联网,反应速度极快(高频控制),就像手机里的本地 AI 助手一样,随时待命,绝不卡顿。
4. 它是怎么“听指挥”又“有主见”的?(CFG 旋钮)
比喻:像调节“自动驾驶”的激进程度 有时候你需要机器人完全听话(比如“把那个红色的杯子拿过来”),有时候你需要它发挥一点本能(比如“如果杯子拿不稳,先调整一下”)。
Habilis-β 的做法 :它有一个**“指导旋钮”**(Classifier-Free Guidance)。
旋钮拧得高:机器人死板听话 ,严格按指令做。
旋钮拧得低:机器人更灵活 ,更多依赖它自己学到的“玩耍经验”来应对突发状况。
结果 :操作员可以根据现场情况,随时调整机器人的性格,是当个“听话的士兵”还是“灵活的专家”。
总结:它有多强?
论文里做了一个**“一小时连续工作”**的测试(就像让机器人连续搬砖一小时,看它能搬多少块,多久需要人帮忙):
普通机器人(π0.5) :一小时只能搬 19 次,平均 46 秒 就需要人帮忙一次。
Habilis-β :一小时能搬 124 次(快了近 7 倍!),平均 137 秒 才需要人帮忙一次(皮实了近 3 倍!)。
一句话总结 : Habilis-β 就是一个不用联网、反应神速、既能像风一样快跑、又能像老黄牛一样连续干活 的机器人新物种,它让机器人真正从“实验室里的玩具”变成了“工厂里的工人”。
1. 研究背景与问题 (Problem)
当前的 VLA 模型评估主要局限于单次尝试的成功率 (Single-trial success rate),且通常在精心重置的初始状态下进行。这种评估方式存在以下关键缺陷,无法反映真实工业场景的需求:
缺乏速度考量 :现有模型动作保守、时间密度高,未能利用自由空间(free-space)的快速运动,导致吞吐量低。
缺乏长时鲁棒性 :在连续运行中,初始状态会漂移,微小误差会累积,导致系统频繁失败并需要人工干预。单次成功率无法捕捉这种长期退化。
延迟瓶颈 :端到端推理延迟高,依赖云端或重型计算,难以在边缘设备上实现高频闭环控制。
核心目标 :开发一个具备 Fast-Motion(快速运动) 、Long-Lasting(长时运行) 和 On-Device(端侧部署) 能力的 VLA 模型。
2. 核心评估指标:生产力 - 可靠性平面 (PRP)
为了更真实地评估部署能力,作者提出了 生产力 - 可靠性平面 (Productivity-Reliability Plane, PRP) ,包含两个核心指标:
每小时任务数 (Tasks per Hour, TPH) :衡量生产力(Fast-Motion)。在连续运行协议下,单位时间内成功完成的任务数量。
干预平均间隔时间 (Mean Time Between Intervention, MTBI) :衡量可靠性(Long-Lasting)。系统在不需外部人工干预(如重置、急停)的情况下连续运行的平均时间。
该指标体系强调在连续运行中,系统不仅要做得对,还要做得快且持久。
3. 方法论 (Methodology)
Habilis-β 通过三阶段训练流程和多项技术创新来实现上述目标:
3.1 数据策略:从“玩耍”到“循环任务”
无语言预训练 (Play Data Pre-training) :利用大规模、无标签的“玩耍数据”(人类遥操作机器人进行非结构化交互的数据)。这使模型学习到通用的、任务无关的物理交互先验(Interaction Priors),增强了对状态漂移和恢复行为的理解。
循环任务微调 (Cyclic Data Post-training) :不同于传统的“成功即停止”的数据分段,循环数据记录机器人连续执行同一任务的轨迹,将一次成功的结束与下一次开始连接起来。这迫使模型学习状态漂移下的恢复策略,适应连续运行环境。
3.2 空间感知下采样 (ESPADA)
为了解决动作过于保守的问题,引入了 ESPADA (Execution Speedup via Semantics Aware Demonstration Downsampling)。
利用 VLM-LLM 流水线将轨迹语义分割为“休闲阶段”(自由空间移动)和“精度阶段”(接触/精细操作)。
对休闲阶段进行激进的时间压缩(加速),同时保留精度阶段的高频控制。这显著提高了物理执行速度,同时不牺牲任务成功率。
3.3 模型架构与推理优化
流匹配动作专家 (Flow Matching Action Expert) :使用流匹配(Flow Matching)建模连续动作块,替代传统的扩散模型,减少推理步数。
整流流蒸馏 (Rectified Flow Distillation) :将多步生成的教师模型蒸馏为两步 生成的学生模型。这大幅降低了推理成本,使得在边缘设备(如 NVIDIA Jetson Orin)上实现高频控制 (Shorter Chunking, High-Frequency Control)成为可能,从而提升闭环反应速度。
无分类器引导 (Classifier-Free Guidance, CFG) :在推理时作为调节旋钮,通过混合“有指令”和“无指令”的预测,动态平衡指令遵循度与学习到的交互先验。增加引导强度可提高执行速度和激进程度。
4. 实验结果 (Results)
作者在仿真(RoboTwin 2.0)和真实世界(Humanoid 物流工作流)中进行了 1 小时连续运行测试,并与最强基线 π 0.5 \pi0.5 π 0.5 和 GR00T N1.5 进行了对比。
4.1 仿真环境结果
TPH (生产力) :Habilis-β 达到 572.6 ,远超 π 0.5 \pi0.5 π 0.5 的 120.5。
MTBI (可靠性) :Habilis-β 达到 39.2s ,优于 π 0.5 \pi0.5 π 0.5 的 30.5s。
成功率 :Habilis-β 达到 78.5% ,π 0.5 \pi0.5 π 0.5 为 47.8%。
PRP 表现 :Habilis-β 在 PRP 平面上位于右上角(高生产力、高可靠性),且通过 ESPADA 显著提升了吞吐量。
4.2 真实世界结果 (RB-Y1 人形机器人)
在双 bin 传送带打包任务中:
TPH :Habilis-β 达到 124 ,是 π 0.5 \pi0.5 π 0.5 (19) 的 6.5 倍 。
MTBI :Habilis-β 达到 137.4s ,是 π 0.5 \pi0.5 π 0.5 (46.1s) 的 3 倍 。
成功率 :Habilis-β 达到 82.7% ,π 0.5 \pi0.5 π 0.5 仅为 19.6%。
4.3 标准基准测试
在 RoboTwin 2.0 的标准单次尝试基准测试中,Habilis-β 在 Dump Bin Bigbin, Place Dual Shoes, Stack Bowls Three 三个任务上均取得了目前报告的最高性能 。
5. 主要贡献 (Key Contributions)
提出了 PRP 评估框架 :引入了 TPH 和 MTBI 指标,将 VLA 评估从“单次成功率”转向“连续生产力与可靠性”,更贴合工业部署需求。
数据策略创新 :结合无标签“玩耍数据”预训练和“循环任务”微调,有效解决了连续运行中的状态漂移和恢复问题。
技术架构突破 :
利用 ESPADA 实现语义感知的动作加速。
利用 整流流蒸馏 实现端侧高频控制。
利用 CFG 实现部署时的动态策略调节。
实证性能 :在仿真和真实人形机器人上,Habilis-β 在生产力、可靠性和成功率上均大幅超越现有 SOTA 模型,证明了其作为工业级部署方案的可行性。
6. 意义与影响 (Significance)
填补了学术与工业的鸿沟 :该研究指出当前 VLA 研究过于关注单次成功率,而忽视了工业界最关心的“持续运行能力”和“干预频率”。PRP 平面为未来的机器人评估提供了新的标准。
端侧部署的可行性 :通过蒸馏和架构优化,证明了复杂的 VLA 模型可以在资源受限的边缘设备上实现高频、低延迟的闭环控制,减少了对云端的依赖。
实用化导向 :Habilis-β 展示了如何通过数据策略(玩耍 + 循环)和推理优化(ESPADA + 蒸馏)来平衡速度、精度和鲁棒性,为未来机器人进入复杂、动态的工业环境提供了技术蓝图。
总结 :Habilis-β 不仅仅是一个性能更强的模型,更是一套针对真实世界部署 的系统性解决方案,它重新定义了机器人如何被评估、训练和部署,向着“快速、持久、自主”的通用机器人迈出了关键一步。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。