← 최신 논문
🤖 AI

Commanding Humanoid by Free-form Language: A Large Language Action Model with Unified Motion Vocabulary

이 논문은 인간과 로봇의 운동 원리를 공유된 이산 공간에 정렬하고, 우선권 정책을 증류하며, 역학 인식 보상을 통한 강화학습을 결합하여 자연스럽고 물리적으로 타당한 전신 동작을 자유로운 언어 명령으로 생성하는 대규모 언어 행동 모델 'Humanoid-LLA'를 제안합니다.

원저자: Zhirui Liu, Kaiyang Ji, Ke Yang, Jingyi Yu, Ye Shi, Jingya Wang

게시일 2026-04-13
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhirui Liu, Kaiyang Ji, Ke Yang, Jingyi Yu, Ye Shi, Jingya Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 문제: "말은 잘하지만 몸이 따라주지 않는 로봇"

기존의 로봇들은 언어를 이해하는 능력 (LLM) 이나 물리 법칙을 따르는 능력 (로봇 제어) 은 각각 좋았지만, 이 둘을 연결하는 데 큰 벽이 있었습니다.

  • 비유: 마치 **유명한 요리사 (언어 모델)**가 "매콤하고 바삭한 치킨을 만들어줘"라고 주문을 내렸는데, **실제 주방 (로봇)**에는 그걸 만들 수 있는 재료가 없거나, 요리사가 만든 레시피대로 하면 로봇이 넘어져 버리는 상황과 같습니다.
  • 기존 방법들은 인간의 움직임을 로봇에게 그대로 옮기려다 보니, 로봇의 몸 구조와 달라서 넘어지거나 (물리 불가능) 혹은 명령과 다른 엉뚱한 행동을 하거나 (의도 불일치) 하는 문제가 있었습니다.

2. 해결책: "Humanoid-LLA"라는 3 단계 마법 주문

저자들은 이 문제를 해결하기 위해 세 가지 단계로 이루어진 새로운 시스템을 만들었습니다.

1 단계: "공통 언어 사전 만들기" (Unified Motion Vocabulary)

로봇과 인간은 몸이 다르기 때문에 서로의 움직임을 바로 이해하지 못합니다. 그래서 저자들은 **두 종족이 모두 이해할 수 있는 '공통의 동작 단어장'**을 만들었습니다.

  • 비유: 인간이 "손을 흔들어라"라고 하면 로봇은 "어떤 각도로, 얼마나 빠르게?"를 몰라 헤매지만, 이 시스템은 **"손 흔들기"라는 하나의 '공통 코드 (토큰)'**를 정의해 둡니다. 인간이든 로봇이든 이 코드를 받으면 서로 다른 몸매임에도 불구하고 똑같은 의미의 동작을 수행합니다.
  • 마치 **모든 나라의 사람들이 사용하는 '에스페란토 (인공어)'**처럼, 인간과 로봇이 서로의 몸짓을 오해 없이 주고받을 수 있는 공통 언어를 만든 것입니다.

2 단계: "명령을 실행 가능한 기술로 번역하기" (Distillation)

이제 로봇이 그 '공통 코드'를 보고 실제로 움직일 수 있도록 훈련시킵니다.

  • 비유: **명예로운 사관학교 교수 (Teacher)**가 로봇에게 "이 코드를 보고 어떻게 움직여야 넘어지지 않는지"를 완벽하게 가르칩니다. 그다음, 그 지식을 **신입생 (Student)**에게 전달합니다. 신입생은 복잡한 수학 공식 (연속적인 궤적) 을 외울 필요 없이, **간단한 코드 (단어)**만 보고도 교수처럼 똑똑하게 움직일 수 있게 됩니다.
  • 이 과정을 통해 로봇은 "코드를 받으면 넘어지지 않고 자연스럽게 움직이는 법"을 체득하게 됩니다.

3 단계: "최고의 지휘자 AI" (Large Language Action Model)

마지막으로, 우리가 말한 명령 (예: "군인처럼 행진해") 을 이 시스템이 이해하고, 위에서 만든 '공통 코드'들을 이어붙여 로봇에게 전달합니다.

  • 비유: 이 AI 는 정교한 지휘자입니다. 사용자가 "군인처럼 행진해"라고 하면, 지휘자는 단순히 "걷기"라고만 하지 않습니다.
    1. 생각 (Chain of Thought): "군인 행진은 발을 딱딱 구르며, 팔을 일정 각도로 흔들고, 일렬로 나아가야 해."라고 먼저 생각합니다.
    2. 코드 생성: 그 생각을 바탕으로 "발 구르기 코드", "팔 흔들기 코드", "일렬로 가기 코드"를 순서대로 나열합니다.
    3. 실행: 이 코드들을 로봇에게 보내면, 로봇은 2 단계에서 배운 대로 넘어지지 않고 완벽한 군인 행진을 합니다.

3. 왜 이 기술이 특별한가요? (실제 결과)

이 시스템은 시뮬레이션뿐만 아니라 **실제 로봇 (Unitree G1, Booster T1)**에서도 테스트되었습니다.

  • 결과: "팔을 흔들어 교통을 지시해"나 "군인 행진"처럼 아주 추상적이고 새로운 명령을 줘도 로봇이 넘어지지 않고 자연스럽게 수행했습니다.
  • 핵심: 기존 방법들은 "넘어지지 않는 것"과 "명령을 잘 듣는 것" 중 하나만 선택해야 했지만, 이 기술은 둘 다 달성했습니다. 마치 유리알처럼 매끄럽게 움직이면서도, 사용자의 말 한마디에 즉각 반응하는 로봇을 만든 것입니다.

요약

이 논문은 **"로봇이 인간의 말을 듣고, 넘어지지 않고 자연스럽게 움직이게 하는 방법"**을 제시합니다.

  1. 인간과 로봇이 이해할 수 있는 공통 동작 단어장을 만들고,
  2. 그 단어로 로봇이 넘어지지 않게 움직이는 법을 가르치고,
  3. AI 가 사용자의 말을 이 단어로 번역하게 함으로써,
    마치 마법처럼 로봇을 자유자재로 조종할 수 있게 했습니다.

이제 로봇은 단순한 기계가 아니라, 우리가 말로 지시하면 바로 알아듣고 실행하는 현명한 파트너가 될 수 있게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →