← 최신 논문
🤖 machine learning

WorldBagel: Uncovering the Power of Unified Multimodal Models for Vision-Language-Action-World Modeling

이 논문은 BAGEL 아키텍처를 기반으로 구축된 통합 시각-언어-행동-월드(Vision-Language-Action-World) 모델링 프레임워크인 WorldBagel을 소개하며, 이는 멀티모달 생성과 월드 모델링을 통합하는 것이 다양한 로봇 조작 작업에 걸쳐 작업 특화형 대안들보다 더 우수한 성능과 더 구조화된 행동 표현을 이끌어낸다는 것을 입증한다.

원저자: Zelin Zhao, Min Shi, Bo Yuan, Haotian Xue, Jialuo Li, Lama Moukheiber, Humphrey Shi, Yongxin Chen

게시일 2026-07-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zelin Zhao, Min Shi, Bo Yuan, Haotian Xue, Jialuo Li, Lama Moukheiber, Humphrey Shi, Yongxin Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 요리하는 법을 가르치고 있다고 상상해 보세요. 현재 대부분의 로봇은 레시피(언어)와 재료(시각)만을 보고 다음 행동을 결정하는 요리사와 같습니다. 이들은 지시를 따르는 데는 뛰어나지만, 주방이 실제로 어떻게 돌아가는지에 대한 "이해"는 부족합니다. 예를 들어, 냄비를 너무 세게 밀면 조리대 아래로 미끄러질 것이라거나, 끓는 팬에서 김이 피어오를 것이라는 점을 직관적으로 알지 못합니다.

WorldBagel은 이를 변화시키는 새로운 종류의 로봇 두뇌입니다. 이 로봇은 단순히 명령을 따르는 요리사가 아니라, 로봇의 머릿속에 존재하는 하나의 시뮬레이터처럼 작동합니다. 단순히 무엇을 할지 결정하는 것에 그치지 않고, 어떤 행동을 했을 때 세상이 어떻게 변할지를 끊임없이 상상합니다.

다음은 논문의 주장들을 바탕으로 한 작동 원리의 간단한 설명입니다.

1. "두 개의 타워" 구조의 두뇌

로봇의 두뇌를 같은 사무실에서 일하는 두 명의 전문 기술자로 생각해보세요.

  • "이해" 전문가 (UND): 이 전문가는 사진을 보고 문장을 읽어 지금 당장 로봇이 무엇을 해야 하는지 파악하는 데 능숙합니다. 즉, "행동하는 자"입니다.
  • "생성" 전문가 (GEN): 이 전문가는 꿈꾸는 자입니다. 현재의 장면과 로봇의 의도된 행동을 보고, "내가 이 행동을 한다면, 1초 뒤의 주방 모습은 어떻게 변할까?"라고 자문합니다. 미래를 예측하는 역할입니다.

WorldBagel은 이 두 전문가가 동일한 노트를 공유하도록 강제합니다. 이들은 단순히 나란히 일하는 것이 아니라, 서로로부터 배웁니다. 미래를 예측하려고 노력함으로써, 로봇은 현재를 이해하는 능력이 더 좋아집니다.

2. 비법 소스: "푸리에(Fourier)" 행동

로봇은 부드럽고 연속적인 방식(예: 공중을 미끄러지듯 움직이는 손)으로 움직이지만, 컴퓨터는 보통 단계나 블록 단위로 생각합니다. 이 논문은 **푸리에 특징 토큰화(Fourier Feature Tokenization)**라는 영리한 기법을 도입했습니다.

부드러운 파동을 묘사하려고 시도한다고 상상해 보세요. 울퉁불퉁한 레고 블록(이산화)으로 그리려고 하면 모양이 거칠고 부정확할 것입니다. 하지만 특정 음악적 음표(주파수)들을 조합하여 부드러운 파동을 완벽하게 재현해낼 수 있습니다.

WorldBagel은 로봇의 움직임에 이 "음악적 음표" 접근 방식을 사용합니다. 이는 로봇의 부드러한 물리적 행동을 구조화된 주파수의 언어로 번역해 줍니다. 이를 통해 WorldBagel은 다음과 같은 성과를 냅니다:

  • 자신의 움직임을 훨씬 더 정밀하게 예측할 수 있습니다.
  • 다른 방법들보다 과업의 "형태"를 더 잘 이해할 수 있습니다.

3. "시퀀스 플랜" (이야기꾼)

이 로봇을 가르치기 위해 연구진은 단순히 무작위 데이터를 입력하지 않았습니다. 대신 **시퀀스 플랜(Sequence Plan)**이라 불리는 특정한 구조를 가진 이야기책처럼 학습 과정을 조직했습니다.

만ภาพ들이 뒤섞인 만화 칸을 상상해 보세요. 때로는 로봇이 사진을 먼저 보고, 그다음 지시사항, 행동, 그리고 결과를 봅니다. 또 다른 때는 결과부터 먼저 보아서 무엇이 그 결과를 일으켰는지 학습하기도 합니다. WorldBagel은 이러한 "칸"(시각 정보, 단어, 행동, 미래 예측)을 학습 과정에서 다양한 순서로 섞어서 보여줍니다. 이를 통해 로봇은 다음을 학습합니다:

  • 행동은 세상의 변화를 일으킨다.
  • 언어는 그러한 행동을 안내한다.
  • 미래는 과거의 논리적인 결과이다.

4. 연구 결과는 어떠했는가?

연구진은 세 가지 서로 다른 "주방"(로봇 환경)에서 WorldBagel을 테스트했습니다:

  1. LIBERO: 다양한 과업이 포함된 복잡한 시뮬레이션.
  2. Language Table: 로봇이 음성 명령에 따라 블록을 미는 실제 환경의 테이블.
  3. Franka: 특정 로봇 팔이 있는 물리 중심의 시뮬레이션.

결과:

  • 모든 면에서 우수함: WorldBagel은 행동에만 집중하거나 미래 예측에만 집중하는 로봇들보다 과업을 더 잘 수행했습니다. 즉, 모든 것을 마스터한 "팔방미인"이었습니다.
  • 더 날카로운 예측: 다음 영상 프레임이 어떻게 보일지 예측하라는 요청에 대해, WorldBagel은 경쟁 모델들보다 훨씬 더 정확했습니다.
  • 더 견고함: 연구진이 "노이즈"(예: 로봇의 손을 흔들거나 움직임의 속도를 바꾸는 것)를 추가했을 때, WorldBagel은 혼란에 빠지지 않았습니다. 단순히 시각적 패턴을 따르는 것이 아니라 움직임의 물리 법칙을 이해하고 있었기에 미래를 정확하게 예측할 수 있었습니다.

핵심 요약

이 논문은 시각(보는 것), 언어(읽는 것), 행동(하는 것), 그리고 월드 모델링(미래를 상상하는 것)을 하나의 통합된 시스템으로 결합함으로써 로봇이 더 빠르게 배우고 더 신뢰할 수 있게 된다고 주장합니다.

WorldBagel은 자신의 행동이 가져올 결과를 상상하도록 가르치면, 로봇이 훨씬 더 똑똑하고 유능한 일꾼이 된다는 것을 증명합니다. 이 모델과 코드는 다른 이들이 이 "통합적" 접근 방식을 활용해 발전시킬 수 있도록 공개될 예정입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →