이 논문은 **'HEX'**라는 이름의 새로운 인공지능 시스템을 소개합니다. 이 시스템은 인간형 로봇 (휴머노이드) 이 우리처럼 온몸을 다 써서 복잡한 일을 할 수 있도록 도와줍니다.
기존의 로봇들은 팔만 움직이거나, 걷는 것과 물건 잡는 것을 따로따로 배웠습니다. 하지만 HEX 는 인간처럼 "온몸을 하나로 연결해서" 생각하고 행동하는 방법을 배웠습니다.
이 복잡한 내용을 일상적인 비유로 쉽게 설명해 드릴게요.
1. 문제점: "손만 쓰는 로봇" vs "전신 운동선수"
기존의 로봇 AI 는 마치 무릎을 대고 앉아서 팔만 열심히 움직이는 사람과 같습니다.
기존 방식: "물건을 집어라"라고 하면 팔만 움직이고, "걸어라"라고 하면 다리만 움직입니다. 두 가지 명령이 섞이면 (예: 걸으면서 물건을 집는 것) 로봇은 어리둥절해지거나 넘어집니다.
HEX 의 접근: 인간은 물건을 들면서 동시에 균형을 잡고, 발을 옮기고, 고개를 돌립니다. HEX 는 이 전신 운동선수처럼, 몸의 모든 부위가 서로 대화하며 움직이는 법을 배웁니다.
2. HEX 의 핵심 기술 3 가지 (비유로 설명)
① "몸의 지도" (Humanoid-Aligned State Representation)
비유: 서로 다른 키와 팔 길이를 가진 사람들도 모두 "머리, 팔, 다리, 허리"라는 공통된 부위로 설명할 수 있죠?
설명: HEX 는 다양한 로봇 (키가 크거나 작거나, 바퀴가 달린 로봇 등) 이 모두 같은 '몸의 지도'를 공유하도록 만듭니다. 그래서 한 로봇이 배운 지식을 다른 로봇도 쉽게 따라 할 수 있습니다. 마치 모든 로봇이 같은 '운동 의상'을 입고 훈련을 받는 것과 같습니다.
② "미래를 보는 눈" (Predictive Proprioceptive Predictor)
비유: 공을 잡으려 할 때, 우리는 공이 어디로 날아갈지 미리 상상하고 몸을 준비합니다. 지금 눈으로 보이는 것만 보고 반응하면 늦습니다.
설명: HEX 는 단순히 "지금 눈앞에 뭐가 있나?"만 보는 게 아니라, **"앞으로 1 초 뒤 내 몸이 어떻게 움직일지"**를 미리 예측합니다.
"손을 뻗으면 몸이 앞으로 쏠릴 테니, 다리를 살짝 구부려 균형을 잡아야지"라고 미리 계산합니다.
이 덕분에 로봇이 넘어지지 않고 빠르게 반응할 수 있습니다.
③ "과거의 요약 노트" (Lightweight History Tokens)
비유: 긴 영화를 볼 때, 매번 처음부터 다시 보지 않고 "아까 그 장면에서 주인공이 화났었지"라고 요약된 기억만 떠올리면 훨씬 빠르죠?
설명: 로봇이 영상을 계속 보려면 컴퓨터가 너무 무거워집니다. HEX 는 과거의 영상을 다 저장하지 않고, **핵심 내용만 요약한 '메모' (토큰)**만 기억합니다. 그래서 과거의 상황을 잊지 않으면서도, 생각할 시간이 훨씬 빨라집니다.
3. 어떻게 작동할까요? (마스터와 조수)
HEX 는 두 명의 조수가 함께 일하는 구조입니다.
지휘자 (고수준 AI): "상자를 들고 테이블로 가라"는 큰 명령을 듣고, 팔과 손의 움직임을 계획합니다.
현장 지휘관 (저수준 AI): 지휘자의 명령을 받으면, 로봇이 넘어지지 않도록 균형을 잡는 미세한 다리 움직임을 실시간으로 조절합니다. 이 두 명이 완벽하게 호흡을 맞춰서, 로봇은 걷다가도 물건을 집거나, 물건을 쏟으면서도 균형을 잃지 않습니다.
4. 실제 성과: 얼마나 잘할까요?
실제 실험에서 HEX 는 다른 최신 AI 들보다 훨씬 잘했습니다.
빠른 반응: 사람이 갑자기 길을 막으면, 다른 로봇은 멈추거나 넘어지지만 HEX 는 재빨리 멈추고 다시 걷습니다.
긴 작업: "상자를 들고, 돌아서서, 테이블에 놓고, 정리하라"는 긴 순서의 작업에서도 실수가 거의 없었습니다. 다른 로봇들은 중간에 길을 잃거나 넘어졌지만, HEX 는 끝까지 성공했습니다.
새로운 상황: 조명이나 사물이 바뀌어도 (예: 테이블에 다른 물건이 놓여도) 당황하지 않고 임무를 수행했습니다.
5. 결론: 왜 이 기술이 중요할까요?
이전까지 로봇은 "특정 자리에서 팔만 움직이는 공장 로봇"이나 "길만 걷는 로봇"이었습니다. 하지만 HEX 는 우리 집이나 학교처럼 복잡하고 예측 불가능한 환경에서도 인간처럼 온몸을 써서 일할 수 있는 첫 번째 '전천후' 로봇 AI 입니다.
한 줄 요약:
HEX 는 로봇에게 "팔만 쓰는 게 아니라, 온몸의 균형을 생각하며 미래를 내다보고 움직이는 법"을 가르쳐서, 이제 로봇도 인간처럼 복잡한 일을 척척 해낼 수 있게 만든 기술입니다.
HEX: 인간형 로봇을 위한 전신 조작을 위한 인간형 정렬 전문가 (Humanoid-Aligned Experts) 기술 요약
이 논문은 인간형 로봇 (Humanoid Robots) 이 복잡한 환경에서 locomotion(이동) 과 manipulation(조작) 을 동시에 수행하는 전신 제어 (Whole-Body Control) 문제를 해결하기 위해 제안된 새로운 프레임워크인 HEX에 대해 다룹니다. 기존의 비전 - 언어 - 액션 (VLA) 모델들이 로봇의 신체 부위를 독립적으로 다루거나 이동과 조작을 분리하여 제어하는 한계를 극복하고, 인간과 유사한 전신 협응 능력을 갖춘 인간형 로봇을 구현하는 것을 목표로 합니다.
1. 문제 정의 (Problem)
기존의 인간형 로봇 연구는 주로 이동 (locomotion) 에 집중하거나, 하체가 고정된 상태에서의 팔/손 조작 (hand-centric manipulation) 에 국한되어 있었습니다. 반면, 인간은 이동과 조작을 동시에 수행하며 전신의 협응을 통해 복잡한 작업을 처리합니다.
기존 접근법의 한계:
분해된 설계 (Decomposed Design): 이동과 조작을 별도의 정책으로 제어합니다. 이는 수동 작업 사전 지식에 의존하며, 작업이 복잡해질수록 모듈 간 오류가 누적되어 견고성이 떨어집니다.
계층적 설계 (Hierarchical Design): 고수준 계획자와 저수준 제어기를 사용하지만, 대부분의 VLA 모델은 신체 부위 간의 상호작용 (공유 균형, 자세) 을 명시적으로 모델링하지 않습니다.
결과: 빠른 반응이 필요한 상황이나 긴 시간 범위 (long-horizon) 의 작업에서 전신 협응이 불안정해지거나 실패하는 경우가 많습니다.
2. 방법론 (Methodology)
HEX 는 상태 중심 (State-centric) 프레임워크로, 인간형 로봇의 전신 조작을 위해 다음과 같은 핵심 기술들을 도입했습니다.
2.1 인간형 정렬 보편적 상태 표현 (Humanoid-Aligned Universal State Representation)
다양한 인간형 로봇 (이종 embodiment) 간의 학습을 가능하게 하기 위해, 신체 부위 (팔, 다리, 손, 허리 등) 를 **표준화된 보편적 슬롯 (Canonical Body-Part Slots)**으로 매핑합니다.
특정 로봇의 센서 구성이나 관절 수와 관계없이, 누락된 부위는 학습된 토큰으로 채워 공유 잠재 공간 (Shared Latent Space) 에서 처리합니다.
2.2 혼합 전문가 기반 통합 고유감각 예측기 (MoE-based Unified Proprioceptive Predictor, UPP)
목적: 전신 협응과 시간적 운동 역학을 모델링합니다.
구조:
Mixture-of-Experts (MoE): 입력 및 출력 단계에 경량화된 형태 인식 (Morphology-aware) MoE 모듈을 도입합니다. 이는 특정 신체 부위나 이종 로봇의 통계적 특성에 맞는 전문가 (Expert) 를 동적으로 선택하여 적응력을 높입니다.
공유 백본: 모든 토큰에 공통적으로 적용되는 트랜스포머 백본을 통해 이종 로봇 간 재사용 가능한 역학을 학습합니다.
예측 기능: 현재 상태와 시각 - 언어 컨텍스트를 기반으로 미래의 고유감각 상태 (Proprioceptive State) 를 예측하여, 행동 생성에 '미래 상태 시야 (State Foresight)'를 제공합니다.
2.3 리뷰 - 예측 패러다임 (Review-and-Forecast Paradigm)
시각적 컨텍스트 요약: 긴 이미지 히스토리를 매번 인코딩하는 대신, **경량화된 히스토리 쿼리 토큰 (Lightweight History Query Tokens)**을 캐시에 저장하여 과거의 시각 - 언어 정보를 효율적으로 요약합니다.
적응형 융합 (Adaptive Fusion): 비전 - 언어 특징과 예측된 고유감각 동역학을 잔여 게이트 퓨전 (Residual-Gated Fusion) 메커니즘을 통해 통합합니다. 이는 작업 수행에 필요한 의미적 맥락과 전신 균형에 필요한 동역학적 맥락을 적절히 조절하여 액션을 생성합니다.
2.4 액션 전문가 (Action Expert)
Flow-Matching: 디퓨전 (Diffusion) 기반의 흐름 매칭 (Flow-Matching) 방식을 사용하여 노이즈가 포함된 액션 토큰을 점진적으로 정제합니다.
이중 조건부 (Dual Conditioning): 시각 - 언어 특징과 UPP 에서 예측된 미래 상태 특징을 동시에 조건으로 받아, 팔과 손의 제어 명령을 생성하며 하위 수준의 전체 신체 제어기와 일관성을 유지합니다.
3. 주요 기여 (Key Contributions)
최초의 전신 VLA 프레임워크: 풀 사이즈 이족 보행 인간형 로봇을 위한 최초의 전체 신체 (Whole-Body) VLA 프레임워크를 제안했습니다.
이종 로봇 간 전신 프리트레이닝: 이종 로봇 (Cross-embodiment) 데이터에서 확장 가능한 전신 프리트레이닝을 위한 인간형 정렬 상태 표현과 예측적 고유감각 모델링을 도입했습니다.
새로운 패러다임: 시각 히스토리 요약, 미래 상태 예측, 적응형 멀티모달 융합을 결합한 리뷰 - 예측 (Review-and-Forecast) 패러다임을 제시하여 행동 생성의 효율성과 정확도를 높였습니다.
실증적 성과: 실제 인간형 로봇 (Tienkung 2.0/3.0) 을 통한 실험에서 기존 SOTA 모델들을 능가하는 성능을 입증했습니다.
4. 실험 결과 (Results)
HEX 는 Tienkung 2.0 및 3.0 로봇을 사용하여 다양한 실제 작업 (거울 모방, 술 따르기, 상자 운반, 물건 정리 등) 에서 평가되었습니다.
성능 (Seen Scenarios):
ACT, SwitchVLA, GR00T N1.5, π0.5 등 강력한 베이스라인 대비 **평균 작업 성공률 (79.8%)**에서 가장 높은 성능을 기록했습니다.
특히 빠른 반응이 필요한 작업 (거울 모방) 과 긴 시간 범위 작업 (상자 운반) 에서 우수한 안정성을 보였습니다.
일반화 능력 (Generalization):
보이지 않는 환경 변화 (조명 변화, 시각적 방해물, 인간 개입, 동적 객체 위치 변경 등) 에 대해 기존 모델들보다 훨씬 강력한 일반화 능력을 입증했습니다 (평균 성공률 61.8% vs π0.5 의 44.3%).
인간이 방해하는 상황에서도 손동작을 유지하는 등 뛰어난 견고성을 보였습니다.
효율성:
RTX 4090 GPU 기준 약 73ms 의 지연 시간 (Latency) 을 유지하면서 가장 높은 성공률을 달성하여, 실시간 적용 가능성도 높게 평가받았습니다.
Ablation Study:
UPP(예측기) 와 MoE 설계가 성능 향상에 가장 큰 기여를 했으며, 프리트레이닝은 학습 수렴 속도를 크게 개선했습니다.
5. 의의 및 결론 (Significance)
HEX 는 인간형 로봇이 복잡한 인간 환경 (가정, 학교 등) 에서 이동과 조작을 동시에 수행할 수 있는 핵심 기술적 도약을 이루었습니다.
핵심 통찰: 단순한 시각 - 언어 이해를 넘어, 신체 부위 간의 구조화된 상호작용과 미래 상태 예측을 명시적으로 모델링하는 것이 전신 협응 제어의 핵심임을 증명했습니다.
확장성: 다양한 형태의 인간형 로봇 데이터에 대해 하나의 공통된 잠재 공간에서 학습할 수 있는 아키텍처를 제공하여, 로봇 학습의 데이터 효율성과 확장성을 크게 높였습니다.
미래 전망: 이 연구는 인간형 로봇이 단순한 이동이나 고정된 조작을 넘어, 인간과 유사한 유연하고 안정적인 전신 행동을 수행할 수 있는 기반을 마련했다는 점에서 의의가 큽니다.