← 최신 논문
💻 computer science

Native Video-Action Pretraining for Generalizable Robot Control

LingBot-VA 2.0은 로봇의 체화(embodiment)를 위해 밑바닥부터 설계된 비디오-액션 파운데이션 모델로, 시맨틱 시각-액션 토크나이저, 인과적 사전 학습, 희소 MoE 백본, 그리고 비동기 추론 스킴을 특징으로 하여 실제 환경에서 견고하고 적은 데이터로도 일반화 가능한 제어를 달성합니다.

원저자: Qihang Zhang, Lin Li, Luyao Zhang, Shuai Yang, Yiming Luo, Shuaiting Li, Ruilin Wang, Junke Wang, Jiahao Shao, Gangwei Xu, Jiaming Zhou, Yishu Shen, Yudong Jin, Fangyi Xu, Shuailei Ma, Jiaqi Liao, Gua
게시일 2026-07-10
📖 4 분 읽기☕ 가벼운 읽기

원저자: Qihang Zhang, Lin Li, Luyao Zhang, Shuai Yang, Yiming Luo, Shuaiting Li, Ruilin Wang, Junke Wang, Jiahao Shao, Gangwei Xu, Jiaming Zhou, Yishu Shen, Yudong Jin, Fangyi Xu, Shuailei Ma, Jiaqi Liao, Guanxing Lu, Zifan Shi, Yongkun Wen, Yujie Zhao, Weixuan Tang, Xinyang Wang, Chaojian Li, Jiapeng Zhu, Ka Leong Cheng, Nan Xue, Xing Zhu, Yujun Shen, Yinghao Xu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 비디오 게임을 하는 법을 가르치려 한다고 상상해 보세요. 오늘날 대부분의 사람들은 매우 똑똑한 영화 제작용 AI를 가져온 뒤, 여기에 "왼쪽으로 이동"이나 "물건 집기" 같은 몇 개의 추가 버튼을 달아주고 나머지는 알아서 깨우치기를 바라는 방식으로 이 작업을 수행하려 합니다. 하지만 이 논문의 저자들은 이러한 방식이 마치 물고기에게 안장을 채워주며 자전거를 타는 법을 가르치려는 것과 같다고 주장합니다. 그것은 목적에 맞지 않는 도구입니다.

대신, 그들은 물리적 세계가 어떻게 움직이고 반응하는지를 이해하도록 밑바닥부터 설계된 로봇 두뇌인 LingBot-VA 2.0을 구축했습니다. 이것을 영화 감독이 아니라, 장면을 관찰하고 아주 짧은 순간 뒤에 상황이 정확히 어떻게 변할지 예측하며, 그 미래를 실현하기 위해 로봇이 정확히 무엇을 해야 하는지 알려주는 "미래를 보는" 코치라고 생각하십시오.

기존 방식이 작동하지 않았던 이유

이 논문은 비디오 생성기를 "재활용"하는 현재의 추세를 명시적으로 반박합니다. 기존 모델들은 단순히 사실적으로 보이기 위해 만들어진 예쁜 영상을 만드는 데 특화되어 있습니다. 이 모델들은 "양방향성(bidirectional)"을 가집니다. 즉, 과거를 예측하기 위해 미래를 볼 수 있는데, 이는 영화를 편집하는 데는 훌륭하지만, 지금 보고 있는 것에 기반하여 '지금 당장' 행동해야 하는 로봇에게는 최악입니다.

저자들은 기존 방식에서 세 가지 큰 문제를 발견했습니다:

  1. 너무 예쁘기만 하고 물리적이지 않음: 기존 모델들은 픽셀을 보기 좋게 만드는 데 집중할 뿐, 컵을 밀면 미끄러진다는 물리적 법칙을 이해하지 못합니다. 즉, 인과관계를 제대로 파악하지 못합니다.
  2. 너무 느림: 실제 로봇은 초당 수백 번 생각해야 합니다. 기존 모델들은 비디오 프레임을 "디노이징(노이즈 제거)"하는 데 너무 오래 걸려 로봇이 멈추거나 지연되는 현상을 유발합니다.
  3. 규칙을 잊어버림: 영화 제작 모델에 로봇의 움직임을 강제로 학습시키려 하면, 수십억 시간의 인터넷 영상을 통해 배웠던 일반적인 지식을 잊어버리는 경우가 많습니다.

새로운 비결: 네 가지 마법 같은 기술

이를 해결하기 위해 팀은 네 가지 영리한 설계 원칙을 사용하여 LingBot-VA 2.0을 구축했습니다.

1. "의미 있는 번역가" (Semantic Tokenizer)
단순히 단어를 번역하는 것이 아니라 문장의 '느낌'까지 번역하는 번역가가 있다고 상상해 보십시오. 기존 모델은 비디오를 수많은 작은 픽셀 조각으로 번역했습니다. 하지만 LingBot-VA 2.0은 비디오를 사물이 '무엇'인지, 그리고 '어떻게' 움직이는지를 이해하는 압축된 고차원 요약본으로 번역하는 새로운 "토크나이저"를 사용합니다. 이는 로봇의 시각을 거대한 사전 학습된 "시각 두뇌"와 정렬시켜, 로봇이 "컵"을 단순한 색상의 집합이 아닌 하나의 '컵'으로 이해하게 합니다. 결정적으로, 이 모델은 인간이 모든 움직임을 일일이 라벨링할 필요 없이, 컵을 잡는 손의 보이지 않는 힘과 같이 두 순간 사이의 '변화'를 나타내는 비밀 코드인 "잠재 행동(latent actions)"을 학습합니다.

2. "일방통행로" (Causal Pretraining)
영화 편집자는 시간을 앞뒤로 넘나들 수 있지만, 로봇은 그럴 수 없습니다. 저자들은 엄격한 "일방통행(인과적)" 경로를 통해 모델을 훈련했습니다. 그들은 단순히 기존 모델을 수정하는 데 그치지 않고, 웹 규모의 데이터로 이 전체 시스템을 처음부터 훈련시켰습니다. 이를 통해 로봇의 두뇌가 자연스럽게 미래를 향해 생각하도록 설계되었으며, 역방향 모델을 강제로 순방향으로 작동시키려 할 때 발생하는 "기억 상실" 문제를 방지했습니다.

3. "부지런한 벌" 네트워크 (Sparse MoE)
로봇이 날아오는 공을 잡을 수 있을 만큼 빠르게 만들기 위해, 모델은 "전문가 혼합(Mixture of Experts, MoE)" 백본을 사용합니다. 모든 사서가 모든 책을 읽는 대신, 필요한 특정 전문가만 호출되는 거대한 도서관을 상상해 보십시오. 이를 통해 모델은 130억 개의 파라미터를 가진 거대하고 똑똑한 모델임에도 불구하고, 각 단계마다 전체의 일부(약 19억 개)만을 활성화하여 지능을 유지하면서도 매우 빠르게 작동할 수 있습니다.

4. "수정구슬" 추론 (Foresight Reasoning)
이 부분이 가장 놀라운 부분입니다. 보통 로봇은 컴퓨터가 생각을 마칠 때까지 기다렸다가 움직이고, 다시 카메라가 업데이트되기를 기다렸다가 다시 생각합니다. 이는 너무 느립니다. LingBot-VA 2.0은 "선견지명 추론(Foresight Reasoning)"을 사용합니다. 로봇이 물리적으로 작업 A를 수행하는 동안, 컴퓨터는 배경에서 이미 작업 B를 예측하고 있습니다.
하지만 여기에는 안전장치가 있습니다. 만약 로봇의 예측이 실제와 어긋나면(예: 컵이 실제로는 바닥에 있는데 테이블 위에 있다고 상상하는 경우), 시스템은 최신 실제 카메라 이미지를 사용하여 즉시 "재접지(re-grounding)"합니다. 이는 조종사가 창밖을 보면서 동시에 계기판을 확인하며, 현실이 예측과 다를 경우 즉시 경로를 수정하는 것과 같습니다.

실제로 얼마나 잘 작동하는가?

저자들은 단순히 이론에 그치지 않고 엄격하게 테스트했습니다.

  • 실제 환경: 연구진은 로봇을 실험실에 배치하여 과일 분류, 펜 수집, 서랍 정리 등의 작업을 수행하게 했습니다. LingBot-VA 2.0은 이전의 최고 모델들(π0.5\pi0.5 및 오리지널 LingBot-VA)을 크게 앞질렀습니다. 예를 들어, "과일 분류" 작업에서 77%의 성공률을 기록하며, 차순위 모델의 64%를 제쳤습니다.
  • 시뮬레이션: 두 팔을 가진 복잡한 로봇 시뮬레이션인 RoboTwin에서 테스트한 결과, **93.6%**의 성공률을 달성하며 모든 경쟁 모델을 압도했습니다.
  • 속도: 속도 최적화 기술 덕분에 로봇은 최대 225 Hz의 빈도로 의사 결정을 내릴 수 있습니다. 이는 초당 200번 이상으로, 에어 하키를 하거나 떨어지는 물체를 잡기에 충분한 속도입니다.
  • 빠른 학습: 로봇은 매우 적은 사례만으로도 새로운 작업을 배울 수 있습니다. 한 테스트에서 로봇은 단 15번의 시연만 보고도 접시와 컵을 정리하는 법을 배웠으며, 인간의 영상을 보는 것만으로도 본 적 없는 물체 조합에 적응하는 "인컨텍스트 학습(in-context learning)" 능력을 보여주었습니다.

결론

이 논문은 진정한 범용 로봇을 만들기 위해서는 기존의 비디오 도구를 로봇 팔에 단순히 덧붙이는 것으로는 부족하다는 점을 시사합니다. 우리는 물리 법칙을 이해하고, 빠르게 움직이며, 인터넷의 방대한 비디오 데이터와 실제 로봇 데이터를 동시에 학습할 수 있는 새로운 종류의 두뇌를 구축해야 합니다. LingBot-VA 2.0은 이것이 가능하다는 것을 증명하며, 로봇이 빠른 사고와 정밀한 실행력을 동시에 갖추어 단 몇 가지의 지시만으로도 복잡한 현실 세계의 일들을 처리할 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →