这篇论文介绍了一个名为 HEX 的新系统,它的目标是让人形机器人(长得像人的机器人)不仅能走路,还能像人一样手脚并用、全身协调地干活。
为了让你更容易理解,我们可以把机器人想象成一个刚学跳舞的新手,而 HEX 就是它的超级大脑和教练。
1. 以前的机器人 vs. 现在的 HEX:从“拼凑”到“整体”
- 以前的做法(像拼积木):
以前的机器人控制程序通常是“分头行动”的。比如,控制腿走路是一个程序,控制手拿东西是另一个程序。这就像让一个人左手画圆、右手画方,虽然能勉强动起来,但一旦需要复杂配合(比如一边走路一边倒水),它们就容易“打架”,导致机器人摔倒或动作僵硬。
- HEX 的做法(像指挥交响乐):
HEX 认为,机器人应该像人类一样,把全身看作一个整体。它不仅仅看“手要拿什么”,还会想“为了拿稳这个杯子,我的腰要怎么扭,腿要怎么迈,重心要放在哪里”。它让机器人的全身动作像一支训练有素的交响乐团,而不是几个各干各的乐手。
2. HEX 的三大“超能力”
为了让机器人学会这种全身协调,HEX 用了三个聪明的招数:
招数一:给机器人一套“通用身体说明书”
- 问题: 世界上有各种各样的机器人,有的腿长,有的手短,有的甚至没有腿(轮式)。以前的模型每换一种机器人,就要重新学一遍,效率很低。
- HEX 的解法: 它发明了一种**“通用身体语言”**。不管机器人长什么样,HEX 都把它们拆解成标准的“零件包”:左臂、右臂、左腿、右腿、腰、头等。
- 比喻: 就像乐高积木。不管你是拼了一辆卡车还是拼了一只恐龙,HEX 都把它们看作是由相同的“积木块”组成的。这样,它在一个机器人身上学到的经验(比如“怎么保持平衡”),可以瞬间迁移到另一个机器人身上,不用重新从头学起。
招数二:拥有“读心术”和“预知未来”的能力
- 问题: 机器人看东西通常是“只看眼前”。比如它看到杯子,就伸手去抓。但如果杯子在动,或者它走路时地面在晃,只看眼前往往来不及反应,容易抓空或摔倒。
- HEX 的解法:
- 读心(记忆): 它有一个“轻量级记忆库”,能记住刚才几秒钟发生了什么(比如人刚才指了哪里),不用每次都把过去的视频重新看一遍,反应更快。
- 预知(预测): 这是 HEX 最厉害的地方。它不仅能看现在,还能预测未来几秒自己的身体状态。它会想:“如果我这样伸手,下一秒我的重心会偏到哪里?会不会摔倒?”
- 比喻: 就像打乒乓球。新手只看球现在在哪,高手能预判球下一秒会飞到哪里,并提前移动脚步。HEX 就是那个能预判自己身体重心变化的“高手”。
招数三:聪明的“专家会诊”机制
- 问题: 机器人的身体太复杂了,不同的任务需要不同的身体部位配合。有时候需要腿稳,有时候需要手快。用一个大脑处理所有情况,容易“顾此失彼”。
- HEX 的解法: 它内部有一个**“专家混合系统”(Mixture-of-Experts)。这就像医院里的会诊小组**。
- 当机器人需要走路时,系统自动呼叫“腿部专家”;
- 当需要精细操作时,呼叫“手部专家”;
- 当需要全身协调时,所有专家一起开会。
- 比喻: 以前是一个全能医生看所有病,容易累坏或误诊;现在是根据病情自动匹配最合适的专科医生,效率更高,配合更默契。
3. 实际效果:它有多强?
研究人员在真实的机器人身上做了很多测试,包括:
- 模仿人类: 让人做手势(比 V、L、A),机器人能立刻模仿,动作流畅。
- 倒水: 一边跟着人走,一边听指令给指定的杯子倒水,不洒出来。
- 长途搬运: 拿着箱子走很远,还要绕过障碍物,最后把箱子放好。
结果令人惊讶:
在长任务(比如搬运箱子要走很久)和快反应(比如突然有人挡路要停下)的场景下,HEX 的表现远超其他最先进的机器人模型。它不仅能完成任务,而且动作更自然、更不容易摔倒。
总结
简单来说,HEX 就是让人形机器人从“笨拙的机械臂”进化成了“协调的运动员”。
它不再把身体零件分开控制,而是通过通用的身体理解、预测未来的能力以及智能的专家分工,让机器人能够像人一样,在复杂的现实环境中,全身协调地干活。这为未来机器人进入家庭、学校,帮我们做家务、搬东西打下了坚实的基础。
HEX:面向全尺寸双足人形机器人的全身操作框架技术总结
1. 研究背景与核心问题 (Problem)
背景:
人形机器人有望进入家庭、学校等复杂的人类环境。然而,现有的研究主要集中在两个独立领域:
- 移动控制 (Locomotion): 专注于非结构化环境中的导航。
- 以手为中心的操作 (Hand-centric Manipulation): 下半身固定,仅控制手臂和手部。
核心挑战:
人类在执行复杂任务时,能够协调全身(包括移动和操作)进行同步运动。然而,现有的视觉 - 语言 - 动作 (VLA) 模型大多将机器人身体部位视为独立实体,缺乏对全身协调的控制。这导致在高自由度 (High-DoF) 的人形机器人上实现全身操作时面临巨大挑战,表现为:
- 动态平衡难以维持: 在物体交互过程中,机器人难以同时保持平衡并产生高维耦合运动。
- 现有范式的局限:
- 分解式设计: 将移动和操作分开控制,依赖人工先验,任务复杂时易出错且模块间误差累积。
- 分层式设计: 高层规划器生成指令,底层控制器执行。但现有 VLA 模型往往缺乏显式的身体部位交互建模,导致语义意图虽被理解,但无法生成协调的全身行为,特别是在快速反应和长视野 (Long-horizon) 场景中表现不稳定。
2. 方法论 (Methodology)
论文提出了 HEX (Humanoid-Aligned Experts),这是一个基于状态感知的全尺寸双足人形机器人全身操作框架。其核心架构包含高层 VLA 策略和底层 RL 全身控制器。
2.1 核心组件
人形对齐的通用状态表示 (Humanoid-Aligned Universal State Representation):
- 为了解决不同人形机器人(异构体)之间的迁移问题,HEX 定义了一组标准的身体部位槽位(如左/右臂、手、腿、头、腰等)。
- 将不同机器人的原始本体感知状态映射到共享的潜在空间,缺失的部位通过“缺失令牌”填充,实现了跨形态的标准化输入。
基于混合专家 (MoE) 的统一本体感知预测器 (Unified Proprioceptive Predictor, UPP):
- 功能: 在共享潜在空间中建模全身协调和短期运动动力学。
- 架构: 采用基于形态的 MoE 结构。输入是经过标准化的身体部位令牌,结合可学习的未来查询令牌。
- 机制: 通过 Top-k 路由机制,将令牌分配给特定的专家(Experts)以捕捉特定身体部位或形态的动态变化,同时保留共享专家以维持通用的动力学模型。
- 输出: 预测未来时间步的本体感知状态(未来状态预测),为动作生成提供“状态预见性”。
轻量级历史查询特征缓存 (Lightweight History Query Feature Cache):
- 问题: 传统方法在推理时重复编码历史图像,计算成本高。
- 方案: 在每一步,VLM 仅编码当前帧和指令,生成紧凑的查询特征(Query Feature),并将其存入固定长度的缓存中。后续步骤直接利用缓存中的特征进行上下文回顾,避免了重复编码。
自适应融合的动作专家 (Adaptive Fusion Action Expert):
- 架构: 基于流匹配 (Flow-Matching) 的动作生成头。
- 融合机制: 采用残差门控融合 (Residual-Gated Fusion)。动作令牌作为 Query,通过双路交叉注意力机制分别接收视觉 - 语言特征 (VLM 输出) 和本体感知特征 (UPP 输出)。
- 门控: 学习一个门控信号,自适应地调节本体感知分支对视觉 - 语言分支的注入程度,确保生成的动作既符合任务语义,又符合全身动力学约束。
2.2 训练策略
- 跨形态预训练: 在包含 7 种不同人形机器人(如 Tienkung 2.0/3.0, Unitree G1/H1, AgiBot 等)的 1200 万 + 帧数据上进行预训练。
- 多任务目标: 联合优化动作生成目标(流匹配)和辅助的未来状态预测目标,使模型能够利用异构数据学习通用的全身协调策略。
3. 主要贡献 (Key Contributions)
- 首个全尺寸双足人形全身 VLA 框架: 提出了 HEX,这是首个针对全尺寸双足人形机器人设计的全身 VLA 框架,能够处理从移动到手部操作的复杂全身任务。
- 跨形态人形对齐状态表示与预测建模: 提出了基于标准身体部位槽位的通用状态表示,结合 MoE 架构的本体感知预测器,实现了在异构机器人数据上的可扩展预训练。
- “回顾与预测” (Review-and-Forecast) 范式: 创新性地结合了视觉历史总结(轻量级缓存)和未来状态预测(UPP),通过自适应多模态融合生成动作,解决了长视野任务中的时序一致性问题。
- 实证性能突破: 在真实世界的人形机器人操作基准测试中,HEX 在任务成功率和泛化能力上达到了最先进水平 (SOTA),特别是在快速反应和长视野场景中表现卓越。
4. 实验结果 (Results)
实验在 Tienkung 2.0 和 Tienkung 3.0 机器人上进行,对比了 ACT, SwitchVLA, GR00T N1.5, π0.5 等强基线模型。
5. 意义与影响 (Significance)
- 理论突破: 证明了在人形机器人控制中,显式建模身体部位间的结构化交互(通过共享平衡和姿态)比单纯依赖视觉 - 语言语义理解更为关键。
- 技术路线: 提出的“人形对齐状态 + 预测性动力学 + 自适应融合”范式,为未来通用机器人基础模型(Foundation Models)的设计提供了新的方向,特别是如何解决异构数据利用和全身协调问题。
- 实际应用: HEX 在真实世界复杂任务(如快速反应、长序列操作)中的成功,推动了人形机器人从简单的移动或抓取向真正的“家庭/学校助手”迈进,使其能够处理更动态、更复杂的物理交互任务。
总结: HEX 通过引入人形对齐的通用状态表示和预测性本体感知建模,成功解决了现有 VLA 模型在全身控制中缺乏协调性和稳定性的痛点,为全尺寸双足人形机器人的通用智能操作奠定了坚实基础。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。