← 최신 논문
💬 NLP

VisualPatchWorld: Code World Models as Latent Structured Representations for Planning

VisualPatchWorld는 역학을 실행 가능한 코드로 표현함으로써 월드 모델을 구축하는 새로운 접근 방식을 도입하며, 이는 질적 탐색을 통해 선택되고 데이터로부터 피팅되어 기존의 코드 기반 베이스라인을 능가하는 해석 가능하고 편집 가능하며 매우 효과적인 계획 수립을 가능하게 합니다.

원저자: Jiaxin Bai, Jiaxuan Xiong

게시일 2026-07-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jiaxin Bai, Jiaxuan Xiong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 지저로한 방을 돌아다니고, 컵을 집어 들고, 내용물을 흘리지 않고 음료를 따르는 법을 가르치려 한다고 상상해 보십시오. 이를 위해 로봇은 '세계 모델(world model)'—세상이 어떻게 돌아가는지에 대한 정신적 지도—이 필요합니다. 이것은 마치 로봇의 뇌 안에서 실행되는 비디오 게임 엔진과 같습니다. 만약 로봇이 의자를 밀면 어떤 일이 일나 궁금하다면, 단순히 추측하는 것이 아니라 머릿속에서 먼저 그 밀기 동작을 시뮬레이션해 보아야 합니다.

오랫동안 과학자들은 이 정신적 지도를 구축하기 위해 매우 다른 두 가지 방식을 시도해 왔습니다. 첫 번째 방식은 매우 똑똑하지만 신비로운 학생을 훈련시키는 것과 같습니다. 로봇에게 세상에서 일어나는 일들을 담은 수천 개의 영상을 보여주며, 숨겨진 수학적 공간 속에서 패턴을 찾아 미래를 예측하도록 학습시킵니다. 이는 예측 능력은 뛰어나지만, 만약 실수를 했을 때 왜 그런 결과가 나왔는지 알 수 없습니다. 마치 규칙이 보이지 않는 블랙박스처럼 작동하기 때문입니다. 두 번째 방식은 상세하고 수동적인 청사진을 만드는 것과 같습니다. 엔지니어들이 중력, 마찰력, 충돌과 같은 모든 물리 법칙을 코드로 직접 작성합니다. 이는 매우 명확하고 수정하기 쉽지만, 세상의 모든 방이나 물체에 대한 청사진을 일일이 작성하는 것은 엄청나게 어려운 일입니다. 여기서 큰 질문이 생깁니다. 우리는 두 세계의 장점을 모두 취할 수 있을까요? 로봇이 영상을 보고 세상의 규칙을 배우되, 신비로운 블랙박스 대신 명확하고 읽을 수 있는 명령어 세트를 갖추게 할 수는 없을까요?

이것이 바로 "VisualPatchWorld"라는 논문이 다루는 핵심 주제입니다. 연구자들인 바이 자신(Jiaxin Bai)과 슝 자쉬안(Jiaxuan Xiong)은 세상의 규칙을 코드로 취급하는 새로운 방법을 제안합니다. 로봇이 숨겨진 수학적 공간에서 미래를 추측하게 하는 대신, 물체가 어떻게 움직이는지를 설명하는 간단하고 실행 가능한 프로그램을 작성하도록 가르치는 것입니다. 예를 들어, 공이 경사로를 따라 굴러가는 영상을 보고 로봇에게 "만약 공이 경사면에 있다면, 이동 속도를 더하라"라고 말하는 짧은 파이썬 스립트를 작성하도록 시키는 것과 같습니다.

팀의 접근 방식은 두 가지 영리한 단계로 작동합니다. 먼저, 로봇은 탐정이 용의자를 찔러보며 이론을 테스트하듯 몇 가지 빠른 "능동적 탐사(active probes)"를 수행합니다. 로봇은 다양한 유형의 움직임 규칙(예: "물체가 얼음 위처럼 미끄러지는가, 아니면 모래 위처럼 달라붙는가?")을 시험하여 규칙의 질적 형태를 파악합니다. 일단 적절한 규칙의 "스케치"를 선택하면, 두 번째 단계로 로봇이 움직이는 모습이 담긴 녹화 영상을 관찰하여 구체적인 숫자(예: 정확히 얼마나 빨리 미끄러지는지)를 채워 넣습니다. 그 결과물은 로봇이 미니 시뮬레이터처럼 실행할 수 있는 코드 조각이 됩니다. 로봇은 이 코드를 보고, 이해하고, 다음 동작을 계획하는 데 사용할 수 있습니다.

결과는 상당히 유망합니다. 미로 찾기, 물체 잡기, 물체 밀기, 큐브 쌓기 등 네 가지 서로 다른 작업에 대해 테스트했을 때, 이들의 방법론인 VisualPatchWorld(VPW)는 계획 수립에서 **69.0%**의 성공률을 달enc성했습니다. 이는 기존의 최고 수준의 코드 기반 방식보다 23.5 퍼센트 포인트나 높은 수치입니다. 가장 큰 개선은 움직임의 유형을 아는 것이 결정적이었던 작업에서 나타났습니다. 예를 들어, 로봇 팔이 무언가에 도달해야 하는 작업에서 기존 방식은 **8%**의 성공률에 그쳤으나, VPW는 **72%**까지 뛰어올랐습니다. 블록을 미는 작업의 경우, 기존의 코드 방식은 거의 작동하지 못했지만(성공률 0에 가까움), VPW는 **22%**를 달성했습니다.

하지만 이 논문은 이것이 아직 모든 것에 대한 완벽한 해결책은 아니라는 점을 주의 깊게 언급합니다. 로봇이 스스로 작성한 코드가 내비게이션과 잡기 작업에서는 완벽한 물리 엔진만큼 훌륭했으나, 물체들이 충돌하고 튀어 오르는 복잡한 밀기 작업에서는 여전히 다소 어려움을 겪었습니다. 이를 해결하기 위해 저자들은 "하이브리드" 접근 방식을 제 니다. 즉, 로봇의 코드가 계획 수립의 핵심적인 역할을 수행하게 하되, 로봇이 실제로 움직이기 전에 가장 좋은 상위 몇 가지 계획을 완벽한 물리 엔진으로 다시 한번 검증하는 것입니다. 이 작은 확인 절차가 남은 격차를 대부분 메워줍니다.

궁극적으로 이 논문은 우리가 추측하는 신비로운 AI와 모든 규칙을 직접 써 내려가는 경직된 엔지니어 사이에서 하나를 선택할 필요가 없음을 시사합니다. 로봇에게 세상의 구조를 먼저 배우게 한 뒤 세부 사항을 채우도록 가르침으로써, 우리는 복잡한 행동을 계획할 만큼 강력하면서도 인간이 읽고 이해하며 잘못되었을 때 수정할 수 있을 만큼 명확한 세계 모델을 만들 수 있습니다. 이는 로봇이 단순히 어떻게 움직여야 하는지를 "아는" 것을 넘어, 자신이 플레이하고 있는 게임의 규칙을 실제로 설명할 수 있게 되는 단계로 향하는 길입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →