← 최신 논문
💻 computer science

Robots Need More than VLA and World Models

본 포지션 페이퍼는 범용 로봇 지능을 달성하기 위해서는 단순한 정책 스케일링을 넘어, 오토레이블링(autolabelling), 모션 리타겟팅(motion retargeting), 물리 기반 추론(physics-grounded reasoning), 그리고 보상 추론(reward inference)이라는 네 가지 핵심 인터페이스를 통해 비정형 행동 데이터를 접지된 로봇 감독(grounded robot supervision)으로 변환하는 결정적인 병목 현상을 해결해야 한다고 주장한다.

원저자: Elis Karcini, Faisal Mehrban, Quang Nguyen, Mac Schwager, Arash Ajoudani, Cesar Cadena, Jan Peters, Marco Hutter, Haitham Bou-Ammar

게시일 2026-06-08
📖 5 분 읽기🧠 심층 분석

원저자: Elis Karcini, Faisal Mehrban, Quang Nguyen, Mac Schwager, Arash Ajoudani, Cesar Cadena, Jan Peters, Marco Hutter, Haitham Bou-Ammar

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 글은 "Robots Need More Than VLAs & World Models"라는 논문을 일상적인 언어와 비유를 사용하여 쉽게 설명한 것입니다.

거대한 문제: 로봇은 "교과서" 세상에 갇혀 있다

당신이 아이에게 요리하는 법을 가르치려 한다고 상 imagine 해보세요. 현재 가장 좋은 방법은 숙련된 요리사가 아이 옆에 서서 양파를 어떻게 써는지를 정확히 보여주고, 아이가 그 손동작을 그대로 따라 하게 하는 것입니다. 로보틱스에서는 이를 **로봇 네이티브 감독(Robot-Native Supervision)**이라고 부릅니다. 우리는 로봇이 실제로 과업을 수행하는 데이터를 수집하고, AI에게 그 특정 움직임을 복제하도록 가르칩니다.

이 논문은 이러한 방식이 로봇을 더 똑똑하게 만들었지만, 이제 한계에 부딪혔다고 주장합니다. 단순히 로봇이 모든 것을 수행하도록 하는 "요리사 시연"을 계속해서 더 많이 수집할 수는 없기 때문입니다. 그 이유는 다음과 같습니다:

  1. 로봇이 모든 것을 하도록 만드는 것은 비용이 엄청나게 많이 들고 속도가 느립니다.
  2. 현실 세계에는 학습할 수 있는 다른 방법들이 가득합니다. 인터넷에는 인간이 요리하거나, 공장이 돌아가거나, 사람들이 무언가를 고치는 수십억 개의 영상이 있습니다.

비유: 당신이 새로운 언어를 배우려고 노력하고 있다고 상상해 보세요.

  • 현재의 접근 방식 (로봇 네이티브): 당신은 오직 당신만을 위해 특정 교과서를 들고 교실에서 말하는 선생님으로부터만 배웁니다. 당신은 거리에서, 영화에서, 혹은 친구들로부터 그 언어가 사용되는 것을 전혀 듣지 못합니다.
  • 논문의 주장: 세상은 그 언어를 말하는 사람들(영상, 인간의 움직임, 시뮬레이션)로 가득 차 있습니다. 하지만 현재 로봇은 이 "거리의 대화"를 이해하지 못합니다. 왜냐하면 가공되지 않은 소음을 로봇이 사용할 수 있는 무언가로 번역해 줄 사전과 문법 규칙이 없기 때문입니다.

저자들은 이렇게 말합니다: "우리는 단순히 더 큰 뇌(더 큰 AI 모델)를 필요로 하는 것이 아닙니다. 우리는 혼란스러운 현실 세계를 로봇이 학습할 수 있는 언어로 바꿔줄 더 나은 번역기가 필요합니다."


누락된 "번역 키트"

이 논문은 차세대 로봇을 실현하기 위해서는 현실 세계를 로봇의 명령어로 번역할 네 가지 구체적인 도구(또는 인터페이스)가 필요하다고 제안합니다. 이것들을 번역 키트의 누락된 부품이라고 생각해보세요.

1. "오토라벨링 엔진" (탐정)

문제점: 만약 당신이 사람이 병을 따는 영상을 본다면, 영상은 픽셀이 움직이는 것을 보여줄 뿐입니다. 영상은 로봇에게 "손이 뚜껑에 닿았다", "힘이 5뉴턴이었다", 또는 "현재 과업 단계는 '뚜껑 돌려 따기'이다"라고 알려주지 않습니다.
해결책: 우리는 슈퍼 탐정처럼 작동하는 시스템이 필요합니다. 이 시스템은 지저-분한 영상, 인간의 동작 센서, 또는 로봇의 실패 사례를 관찰하고 자동으로 중요한 메모를 작성합니다.

  • 하는 일: 흐릿한 영상 속 사람이 컵을 떨어뜨리는 장면을 구조화된 보고서로 바꿉니다: "이벤트: 접촉 상실. 물체: 컵. 상태: 파손. 과업 단계: 실패."
  • 중요한 이유: 이는 가공되지 않은 무질서한 영상을 로봇이 실제로 공부할 수 있는 "교과서"로 바꿔줍니다.

2. "리타겟팅 인터페이스" (번역가)

문제점: 인간은 두 팔과 다섯 손가락을 가지고 있습니다. 로봇은 하나의 집게를 가졌거나 관절의 개수가 다를 수 있습니다. 만약 단순히 로봇에게 "인간의 팔 각도를 복사하라"고 명령한다면, 로봇은 자신의 팔을 부러뜨리거나 물체를 잡는 데 실패할 수도 있습니다.
해결책: 우리는 '움직임'을 복사하는 것이 아니라 '결과'를 복사하는 번역기가 필요합니다.

  • 비유: 당신이 문을 열고 싶다고 가정해 봅시다. 당신은 사람이 팔꿈치로 밀든 손으로 밀든 상관하지 않습니다. 당신은 단지 '문이 열린다'는 결과에 관심이 있습니다.
  • 하는 일: 이 시스템은 인간이 달성한 것(문이 열림)을 보고, 이 특정 로봇이 자신만의 독특한 몸을 사용하여 어떻게 동일한 결과를 달성할 수 있는지 알아냅니다. 즉, "목표"는 보존하되 "방법"은 변경합니다.

3. "물리 기반 월드 모델" (시뮬레이터)

문제점: 어떤 AI 모델은 미래의 모습을 예쁘게 만드는 영상(예: "컵이 떨어질 것이다")을 만드는 데는 뛰어나지만, 물리 법칙을 무시할 수 있습니다. 컵이 테이블을 뚫고 지나가거나 공중에 떠 있는 모습을 보여줄 수도 있습니다. 로봇은 컵이 실제로 깨질지, 아니면 미끄러질지를 알아야 합니다.
해결책: 단순히 그림이 어떻게 보일지 추측하는 것이 아니라, 물리 법칙을 예측하는 "수정구슬"이 필요합니다.

  • 하는 일: 이 시스템은 "내가 이 블록을 여기로 밀면, 기울어질까? 벽에 부딪힐까? 마찰력이 충분해서 멈출 수 있을까?"와 같은 질문에 답합니다.
  • 중요한 이유: 이를 통해 로봇은 실제 세상에서 무언가를 부수지 않고도 다양한 결과를 "상상"하고 실수로부터 배울 수 있습니다.

4. "리워드 그라운딩 루프" (코치)

문제점: 로봇이 실패했을 때, 로봇은 그저 엉망이 된 영상만을 봅니다. 로봇은 왜 실패했는지 모릅니다. 너무 느렸던 걸까요? 너무 세게 밀었던 걸까요? 목표를 오해했던 걸까요?
해결책: 우리는 스포츠 코치처럼 작동하는 시스템이 필요합니다. 이 시스템은 로봇의 시도를 관찰하고 목표에 근거하여 구체적인 피드백을 줍니다.

  • 비유: 농구 선수가 슛을 놓쳤을 때, 일반적인 관찰자는 단순히 "놓쳤다"라고 말합니다. 하지만 코치는 "공을 너무 일찍 놓았고, 팔꿈치가 바깥으로 나왔다"라고 말합니다.
  • 하는 일: 이 시스템은 결과를 보고 이렇게 말합니다. "손잡이에 충분한 힘을 가하지 못해서 실패했습니다" 또는 "컵을 올바르게 정렬했기 때문에 성공했습니다." 이는 실패를 다음 시도를 위한 구체적인 레슨으로 바꿔줍니다.

핵심 요약

이 논문은 로봇의 미래가 단순히 말하고 볼 수 있는 더 크고 똑똑한 AI 모델(VLA)을 만드는 것에 있지 않다고 결론짓습니다. 그것은 해당 모델을 혼란스러운 물리적 현실과 연결하는 인프라를 구축하는 것에 관한 것입니다.

최종 비유:
현재의 로보틱스 상태를 아주 똑똑한 학생(AI 모델)이 매우 구체적이고 오래된 교과서 하나(로봇 시연 데이터)만을 가진 도서관에 앉아 있는 모습이라고 생각해 보세요. 학생은 똑똑하지만, 그 책에 의해 제한되어 있습니다.

이 논문은 현실 세계가 수십억 개의 책, 영상, 경험들로 이루어진 거대하고 시끄럽고 혼란스러운 도서관이라고 주장합니다. 이 학생이 이 거대한 도서관으로부터 배울 수 있게 하려면, 단순히 더 큰 학생을 만드는 것만으로는 부족합니다. 우리는 다음의 도구들이 필요합니다:

  1. 지저분한 책들을 정리해 줄 사서 (오토라벨링).
  2. 책을 읽는 법을 설명해 줄 번역가 (리타겟팅).
  3. 이야기 속의 내용을 이해할 수 있는 정신적 지도 (월드 모델).
  4. 학생의 숙제를 채점하고 오류를 설명해 줄 튜터 (리워드 그라운딩).

이 네 가지 도구가 없다면, 로봇은 이 방대하고 경이로우며 혼란스러운 세상으로부터 배울 수 없이, 작고 비싼 도서관 안에 계속 갇혀 있게 될 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →