← 최신 논문
💻 computer science

Large Video Planner Enables Generalizable Robot Control

본 논문은 인터넷 규모의 인간 활동 데이터로 훈련된 대규모 비디오 기반 모델을 소개하며, 이 모델은 새로운 로봇 작업에 대한 제로샷 비디오 계획을 생성하고 이를 실행 가능한 동작으로 변환하여 강력한 일반화 능력과 실제 세계의 실현 가능성을 입증합니다.

원저자: Boyuan Chen, Tianyuan Zhang, Haoran Geng, Caiyi Zhang, Peihao Li, Kiwhan Song, William T. Freeman, Jitendra Malik, Pieter Abbeel, Russ Tedrake, Vincent Sitzmann, Yilun Du

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Boyuan Chen, Tianyuan Zhang, Haoran Geng, Caiyi Zhang, Peihao Li, Kiwhan Song, William T. Freeman, Jitendra Malik, Pieter Abbeel, Russ Tedrake, Vincent Sitzmann, Yilun Du

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 "Large Video Planner Enables Generalizable Robot Control"라는 논문을 간단한 언어와 창의적인 비유로 풀어낸 설명입니다.

핵심 아이디어: 로봇이 행동하기 전에 "상상"하도록 가르치기

로봇이 본 적 없는 문을 여는 법을 가르친다고 상상해 보세요.

  • 옛날 방식 (VLA 모델): 수천 장의 문 사진과 "손잡이를 잡고", "돌리고", "밀어라" 같은 텍스트 명령 목록을 보여 주며 가르칩니다. 이는 물에 관한 책을 읽으며 수영을 배우려는 것과 같습니다. 로봇은 물이 어떻게 움직이는지 실제로 본 적이 없기 때문에 어려움을 겪습니다.
  • 새로운 방식 (Large Video Planner): 사진과 텍스트만 보여주는 대신, 그 특정 문을 여는 인간의 영상을 보여줍니다. 로봇은 영상을 보고 움직임의 흐름을 이해한 뒤, 그 춤을 따라 하려고 시도합니다.

이 논문은 Large Video Planner(LVP) 라는 새로운 시스템을 소개합니다. 이 시스템은 영상을 단순한 오락이 아니라 로봇에게 움직임을 가르치는 주요 언어로 취급합니다.


작동 원리: 세 단계 레시피

저자들은 이 시스템을 세 가지 주요 재료로 구축했습니다.

1. "영화 제작자" (모델)

LVP 를 수백만 시간의 유튜브 영상, 요리 쇼, 로봇 시연 영상을 시청한 고도로 숙련된 영화 감독으로 생각하세요.

  • 입력: 로봇에게 지저분한 책상 한 장의 사진과 "파란색 컵을 집어 올려라"라는 음성 명령을 줍니다.
  • 마법: 로봇의 "뇌"는 즉시 수학 공식을 계산하는 대신, 머릿속에 짧은 영상 클립을 생성합니다. 이 영상은 인간 손이 뻗어 컵을 잡고 들어 올리는 모습을 보여줍니다.
  • 비밀 재료: 이 모델은 140 만 개의 영상으로 구성된 방대한 데이터셋 (LVP-1M) 으로 훈련되었습니다. 이 데이터셋은 단순한 무작위 영화가 아니라, 행동(손 잡기, 도구 움직이기) 에 초점을 맞추도록 신중하게 선별되었으며, 카메라 흔들림이 심하지 않도록 정제되었습니다.

2. "번역기" (동작 추출)

로봇은 물리적으로 인간 손이 될 수 없으므로 번역기가 필요합니다.

  • 로봇이 인간 손의 움직임을 담은 "영화"를 생성하면, 특수 도구를 사용해 손의 경로를 추적합니다.
  • 영상을 보며 "좋아, 1 프레임에서 손은 여기 있었어. 2 프레임에서는 저기로 움직였지"라고 말합니다.
  • 그런 다음 이 인간 동작을 로봇의 특정 신체 부위 (그리퍼나 다재다능한 손 등) 를 위한 명령어로 변환합니다. 이는 인간을 위해 고안된 춤 안무를 로봇 개가 할 수 있도록 단계별로 다시 쓰는 안무가와 같습니다.

3. "배우" (실제 실행)

마지막으로 로봇이 계획을 실행합니다.

  • 논문은 로봇이 테이프 한 조각 찢기, 냉장고 열기, 커피 원두 퍼내기와 같이 본 적 없는 작업을 성공적으로 수행하는 모습을 보여줍니다.
  • 결정적으로 로봇은 이러한 움직임을 단순히 암기한 것이 아니라, 일반화했습니다. 생성된 영상에서 '찢는'이나 '열는' 개념이 어떻게 펼쳐지는지 보았기 때문에 그 개념을 이해한 것입니다.

이것이 다른 점은 무엇인가? (비유)

"교과서" 대 "리허설"

  • 이전 로봇 (교과서 학습자): 이 로봇들은 교과서를 외운 학생과 같습니다. "문을 연다"는 정의는 알지만, 손잡이가 이상한 모양이거나 문이 걸려 있으면 당황합니다. 왜냐하면 그 움직임을 "느낀" 적이 없기 때문입니다.
  • 이 로봇 (리허설 학습자): 이 로봇은 배우와 같습니다. 공연 전에 머릿속에서 장면을 돌려봅니다 (영상을 생성함). 그것은 고군분투, 파지, 움직임을 시각화합니다. 시각적으로 움직임을 "리허설"했기 때문에, 실제 무대가 대본과 다르게 보일 때 적응할 수 있습니다.

그들이 증명한 것

연구자들은 이를 컴퓨터 시뮬레이션에서만 테스트한 것이 아니라, 실제 로봇을 이용해 현실 세계에서 테스트했습니다.

  • 테스트: 무작위 사람들 (제 3 자 평가자) 에게 "테이프 찢기"나 "문 열기"와 같이 이상하고 어려운 과제를 생각해 내도록 요청했습니다.
  • 결과: 로봇의 영상 계획기가 작동하는 계획을 세웠습니다. 다른 최상위 로봇들과 비교했을 때, 이 새로운 시스템은 특히 밀거나 당기는 것과 같은 접촉이 필요한 까다로운 작업에서 일을 끝내기 위해 어떻게 움직일지 파악하는 데 훨씬 뛰어났습니다.

한계점 (세부 사항)

이 논문은 아직 무엇을 할 수 없는지 솔직하게 밝힙니다.

  • 속도: "영화"를 생성하는 데는 강력한 컴퓨터에서도 몇 분이 걸립니다. 로봇이 실시간으로 생각할 수 있을 만큼 (순간적인 반응처럼) 빠르지 않습니다.
  • 불완전한 번역: 때때로 인간 손 영상을 로봇 명령어로 바꾸는 "번역기"가 실수를 하여 로봇이 어설픈 행동을 하기도 합니다.
  • 오픈 루프: 로봇은 전체 영화를 한 번에 계획한 뒤 행동합니다. 컵을 떨어뜨리는 경우 인간이 하듯, 행동 중 문제가 생기면 눈을 계속 확인하며 조정하지는 않습니다.

요약

간단히 말해, 이 논문은 다음과 같이 말합니다: 로봇이 똑똑하고 적응력이 있게 만들려면, 단어와 그림만 가르치지 마세요. 사물이 어떻게 움직이는지 보여주는 영상으로 가르치세요. 로봇이 먼저 해결책을 영상으로 "상상"하게 함으로써, 현실 세계에서 실제로 일을 수행하는 방법을 파악하는 능력이 훨씬 향상됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →