← 최신 논문
💻 computer science

Imagine2Real: Towards Zero-shot Humanoid-Object Interaction via Video Generative Priors

Imagine2Real 은 로봇과 물체의 운동을 4 차원 점 궤적으로 통합하고 행동 기반 모델의 잠재 공간을 희소 키 포인트 추적을 위해 활용하여 데이터 부족과 리타게팅 복잡성을 극복하는 전체 신체 인간형 - 물체 상호작용을 위한 제로샷 프레임워크로, 유연하고 기하학적 제약이 없는 물리적 배포를 가능하게 합니다.

원저자: Jiahe Chen, ZiRui Wang, Feiyu Jia, Xiao Chen, Xiaojie Niu, Weishuai Zeng, Tianfan Xue, Xiaowei Zhou, Jiangmiao Pang, Jingbo Wang

게시일 2026-05-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jiahe Chen, ZiRui Wang, Feiyu Jia, Xiao Chen, Xiaojie Niu, Weishuai Zeng, Tianfan Xue, Xiaowei Zhou, Jiangmiao Pang, Jingbo Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 상자 들어 올리기, 문 밀기, 심지어 아이언맨처럼 기둥을 치는 법을 가르치고 싶다고 상상해 보세요. 하지만 로봇이 이러한 특정 작업을 수행하는 수천 개의 비디오가 담긴 라이브러리가 없다고 가정해 봅시다. 사실, 로봇이 물체와 상호작용하는 방법에 대한 데이터는 거의 없습니다. 이것이 바로 "Imagine2Real"이라는 논문이 해결하려는 문제입니다.

다음은 이를 단순한 개념과 비유로 풀어낸 그들의 방법론 이야기입니다.

큰 문제: "부재하는 매뉴얼"

보통 로봇에게 복잡한 무언가를 가르치려면, 로봇이 원하는 대로 움직이는 완벽한 디지털 트윈과 같은 방대한 양의 고품질 3D 데이터가 필요합니다. 하지만 이러한 데이터는 매우 희귀하고 제작 비용이 매우 비쌉니다.

이 데이터가 없으면 로봇은 막힙니다. 로봇은 잘 걷기는 하지만, 물체를 만지거나 움직이려 하는 순간 혼란에 빠집니다. 기존 방법들은 2D 비디오를 사용하여 이를 해결하려 하지만, 두 가지 큰 난관에 부딪힙니다:

  1. 기하학적 함정: 비디오를 이해하기 위해 기존 방법들은 물체의 완벽한 3D 청사진 (CAD 모델) 이 필요합니다. 청사진이 없으면 로봇은 길을 잃습니다.
  2. "신축성 있는 옷" 문제: 인간 비디오를 로봇에 적용하려면, 수학적으로 인간 몸을 로봇 몸에 맞게 "변형 (morph)"해야 합니다. 이는 인간용 옷을 로봇에게 늘려 입히려는 것과 같아서, 종종 찢어지거나 왜곡되거나 어색하고 부자연스러운 움직임을 만들어냅니다.

해결책: Imagine2Real

저자들은 Imagine2Real이라는 새로운 방식을 제안합니다. 이를 "꿈에서 현실로 (Dream-to-Reality)" 이어지는 파이프라인이라고 생각하세요. 완벽한 3D 매뉴얼이 필요한 대신, 로봇이 먼저 행동을 "상상"하게 한 후, 어떻게 수행할지 파악하게 합니다.

다음은 세 단계로 이루어진 과정입니다:

1. 꿈꾸는 자 (비디오 생성)

먼저 시스템에 로봇과 물체의 사진, 그리고 "상자를 들어 올리세요"와 같은 텍스트 지시를 입력합니다.

  • 마법: 비디오 생성기 (비디오를 만드는 AI) 가 로봇이 정확히 그 작업을 수행하는 짧은 클립을 생성합니다.
  • 단점: 이 비디오는 단순히 픽셀로만 이루어져 있을 뿐, 로봇의 관절이나 물리 법칙을 알지 못합니다. 이는 단순히 시각적인 꿈일 뿐입니다.

2. 추적자 (희박한 "눈")

이제 로봇은 그 비디오를 실제 움직임으로 바꿔야 합니다.

  • 기존 방식: 로봇과 물체의 모든 관절을 추적하려 합니다. 이는 모든 손가락과 발가락을 지켜보며 춤을 따라 하려는 것과 같습니다. 이는 번거롭고 앞서 언급한 "신축성 있는 옷 (리타게팅)"이 필요합니다.
  • Imagine2Real 방식: 그들은 로봇의 발 (베이스), 왼쪽 손, 오른쪽 손이라는 세 개의 중요한 점만 추적합니다. 또한 물체도 추적합니다.
  • 비유: 안개 낀 방에서 춤추는 사람을 따라가려 한다고 상상해 보세요. 온몸을 보려고 노력하는 대신, 코끝과 손만 따라가면 됩니다. 그 부분들이 올바르게 움직이면, 나머지 몸은 자연스럽게 따라옵니다. 이는 "신축성 있는 옷" 문제를 완전히 피하게 해줍니다.

3. 두뇌 (행동 기초 모델)

여기에 비법이 있습니다. 로봇에게 "손을 여기로 움직여"라고만 말하면, 균형을 잡는 법을 모르기 때문에 다리를 휘두르며 넘어질 수 있습니다.

  • 해결책: 로봇은 **행동 기초 모델 (Behavior Foundation Model, BFM)**이라는 사전 훈련된 "두뇌"를 사용합니다.
  • 비유: BFM 을 수년 동안 걷기와 균형 잡기를 연습해 온 마스터 댄서라고 생각하세요. 로봇은 걷는 법을 다시 배울 필요가 없습니다. BFM 은 자연스러운 움직임을 위한 "안전망"을 제공합니다. 로봇은 BFM 에게 "손을 이렇게 움직여야 합니다. 그렇게 하면서 균형을 잡으려면 어떻게 해야 하나요?"라고만 묻습니다.
  • 이를 통해 로봇은 넘어지지 않고, 그 몇 개의 "점" (희박한 키포인트) 을 사용하여 매끄럽고 자연스러운 전신 움직임을 생성할 수 있습니다.

훈련 과정: 레이어별 학습

상자를 들어 올리는 특정 작업을 위한 충분한 데이터가 없기 때문에, 그들은 비디오 게임에서 레벨을 올리는 것처럼 세 단계로 로봇을 가르칩니다:

  1. 레벨 1 (걷는 자): 그들은 BFM 을 수천 시간의 일반적인 인간 걷기 데이터로 훈련시킵니다. 로봇은 자연스럽게 걷는 법을 배웁니다.
  2. 레벨 2 (추적자): 그들은 로봇이 걷는 동안 그 세 개의 "점" (손과 발) 을 따르도록 가르칩니다. 로봇은 그 목표 지점을 맞추기 위해 몸을 조율하는 법을 배웁니다.
  3. 레벨 3 (상호작용자): 마지막으로, 상자 잡기에 관한 아주 적은 양의 구체적인 데이터를 제공합니다. 로봇은 레벨 1 과 2 의 기술을 기반으로 하여, 실제로 물체를 잡기 위해 움직임에 약간의 "비틀림"을 추가하는 법을 배웁니다.

현실 세계 테스트

그들은 모션 캡처실 (움직임을 완벽하게 추적하는 카메라가 있는 방) 안에 있는 실제 로봇 (Unitree G1) 으로 이를 테스트했습니다.

  • 결과: 로봇은 생성된 비디오를 성공적으로 시청하고, 손과 발을 어디에 두어야 할지 파악하여 실제로 상자를 들어 올리고, 밀고, 심지어 기둥을 치는 데 성공했습니다. 이는 실제 인간이 먼저 수행하는 것을 본 적이 없음에도 불구하고 가능했습니다. 이는 **제로샷 (zero-shot)**으로, 로봇이 비디오에서 행동을 "상상"함으로써 특정 작업을 배운 것을 의미합니다.

한계 (세부 사항)

이 논문은 아직 작업이 필요한 두 가지 주요 사항을 인정합니다:

  1. "맹점": 현재 시스템은 로봇이 실제 세계의 위치를 알기 위해 모션 캡처실이 필요합니다. 로봇이 상자를 밀 때 카메라가 마커를 볼 수 없게 되면 (상자가 마커를 가리는 경우), 로봇은 혼란에 빠집니다.
  2. "일방통행": 현재 프로세스는 개방형 루프 (open-loop) 입니다. 로봇은 비디오를 기반으로 계획을 세우고 실행합니다. "상자가 실제로 움직이고 있는가?"를 지속적으로 확인하고 실시간으로 조정하지는 않습니다. 로봇과 비디오 생성기가 지속적으로 대화하는 진정한 폐쇄형 루프 (closed-loop) 시스템을 만드는 것이 다음 큰 과제입니다.

요약

Imagine2Real은 로봇이 다음을 통해 물체와 상호작용하는 법을 배울 수 있게 하는 프레임워크입니다:

  1. 비디오 생성을 통해 행동을 꿈꾸기.
  2. 복잡한 수학을 피하기 위해 가장 중요한 부분 (손/발) 만 관찰하기.
  3. 균형을 유지하고 자연스럽게 움직이도록 사전 훈련된 "댄스 강사 (BFM)"에 의존하기.

이를 통해 로봇은 방대한 양의 사전 기록된 로봇 데이터 라이브러리가 필요 없이 새로운 작업을 즉시 배울 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →