← 最新论文
🤖 machine learning

Habilis-ββ: A Fast-Motion and Long-Lasting On-Device Vision-Language-Action Model

本文提出了专为实际部署设计的快速运动与长时运行设备端视觉 - 语言 - 动作模型 Habilis-β\beta,通过引入评估任务每小时吞吐量与平均干预间隔的“生产力 - 可靠性平面”(PRP),结合无语言预训练、循环任务微调及多种高效推理技术,在仿真与真实人形机器人物流场景中显著超越了现有模型(如π0.5\pi_{0.5})并刷新了 RoboTwin 2.0 排行榜成绩。

原作者: Tommoro Robotics, :, Jesoon Kang, Taegeon Park, Jisu An, Soo Min Kimm, Jaejoon Kim, Jinu Pahk, Byungju Kim, Junseok Lee, Namheon Baek, Sungwan Ha, Hojun Baek, Eduardo Ayerve Cruz, Wontae Kim, Junghyeo
发布于 2026-02-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Tommoro Robotics, :, Jesoon Kang, Taegeon Park, Jisu An, Soo Min Kimm, Jaejoon Kim, Jinu Pahk, Byungju Kim, Junseok Lee, Namheon Baek, Sungwan Ha, Hojun Baek, Eduardo Ayerve Cruz, Wontae Kim, Junghyeon Choi, Yousuk Lee, Joonmo Han, Sunghyun Cho, Sunghyun Kwon, Soyoung Lee, Jun Ki Lee, Seung-Joon Yi, Byoung-Tak Zhang, Theo Taeyeong Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 Habilis-β 的机器人“大脑”。你可以把它想象成一个既跑得快、又特别皮实、还能在本地电脑上独立工作的超级机器人管家。

现在的机器人虽然聪明,但有两个大毛病:要么动作太慢(像树懒一样),要么跑一会儿就“死机”需要人帮忙重启(像没电的玩具)。Habilis-β 就是为了解决这些问题而生的。

下面我用几个生活中的比喻来给你讲讲它是怎么做到的:

1. 它是怎么变“快”的?(Fast-Motion)

比喻:像老司机开车 vs. 新手教练
普通的机器人像刚拿驾照的新手,不管前面是空旷的高速公路还是狭窄的停车场,都小心翼翼地慢慢开,生怕撞车。

  • Habilis-β 的做法:它学会了**“看路况开车”**。
    • 在空旷的地方(比如从桌子走到椅子),它像老司机一样全速冲刺(这叫“空间感知降采样”技术 ESPADA)。
    • 一旦到了需要精细操作的地方(比如拿起一个易碎的杯子),它立刻切换成**“绣花模式”**,慢下来精准操作。
    • 结果:它把原本浪费在“慢吞吞走路”上的时间省下来了,干活效率直接翻倍。

2. 它是怎么变“皮实”的?(Long-Lasting)

比喻:像练过“打地鼠”的机器人
现在的机器人训练通常是这样:教它一次“把杯子放桌上”,成功了就结束。这就像只教学生做一道题,而且每次题目都重新摆好。
但在现实工厂里,机器人要连续工作一小时,杯子可能会歪,桌子可能会脏,状态会慢慢变差。普通机器人遇到这种情况就懵了,需要人过来帮忙。

  • Habilis-β 的做法:它用了两种“特训”:
    1. “玩耍”训练(Play Data):在没教具体任务前,先让它像小孩一样乱玩(抓抓这个、推推那个)。这让它学会了**“怎么在出错后把自己救回来”**的通用本能。
    2. “循环”训练(Cyclic Data):不是教它做一次,而是让它连续做一千次。它学会了处理“做完一次后,下一次开始时状态有点不一样”的情况。
    • 结果:它像是一个经验丰富的老员工,即使连续工作几小时,即使环境有点乱,也能自己调整,很少需要人插手。

3. 它是怎么在“本地”工作的?(On-Device)

比喻:像带“超级大脑”的智能手机
很多机器人需要连到云端服务器才能思考,就像手机没网就变砖头。如果网络卡顿,机器人反应就慢,甚至撞车。

  • Habilis-β 的做法:它把原本巨大的“大脑”通过**“蒸馏”技术**(就像把一大锅浓汤熬成一小瓶高浓缩精华),压缩得足够小,可以直接装在机器人自带的芯片(像 NVIDIA Jetson)上。
    • 结果:它不需要联网,反应速度极快(高频控制),就像手机里的本地 AI 助手一样,随时待命,绝不卡顿。

4. 它是怎么“听指挥”又“有主见”的?(CFG 旋钮)

比喻:像调节“自动驾驶”的激进程度
有时候你需要机器人完全听话(比如“把那个红色的杯子拿过来”),有时候你需要它发挥一点本能(比如“如果杯子拿不稳,先调整一下”)。

  • Habilis-β 的做法:它有一个**“指导旋钮”**(Classifier-Free Guidance)。
    • 旋钮拧得高:机器人死板听话,严格按指令做。
    • 旋钮拧得低:机器人更灵活,更多依赖它自己学到的“玩耍经验”来应对突发状况。
    • 结果:操作员可以根据现场情况,随时调整机器人的性格,是当个“听话的士兵”还是“灵活的专家”。

总结:它有多强?

论文里做了一个**“一小时连续工作”**的测试(就像让机器人连续搬砖一小时,看它能搬多少块,多久需要人帮忙):

  • 普通机器人(π0.5):一小时只能搬 19 次,平均 46 秒 就需要人帮忙一次。
  • Habilis-β:一小时能搬 124 次(快了近 7 倍!),平均 137 秒 才需要人帮忙一次(皮实了近 3 倍!)。

一句话总结:
Habilis-β 就是一个不用联网、反应神速、既能像风一样快跑、又能像老黄牛一样连续干活的机器人新物种,它让机器人真正从“实验室里的玩具”变成了“工厂里的工人”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →