← 최신 논문
💻 computer science

Latent World Models with Monotone Planning Costs for Image-Goal Navigation

이 논문은 고정된 DINO 인코더와 신뢰할 수 있는 행동 시퀀스 계획을 보장하기 위한 새로운 단조 비용 순위(Monotone Cost Ranking) 손실을 사용하는 이미지 목표 탐색을 위한 잠재 세계 모델을 소개하며, GNM 데이터셋에서 최첨단 성능을 달성하고 물리적 로봇에서의 성공적인 제로샷 배포를 실현한다.

원저자: Amirhosein Chahe, Siwei Cai, Lifeng Zhou

게시일 2026-08-11
📖 7 분 읽기🧠 심층 분석

원저자: Amirhosein Chahe, Siwei Cai, Lifeng Zhou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 미로를 통과하는 법을 가르치고 있다고 상상해 보세요. 하지만 당신은 로봇에게 지도도, GPS도, 심지어 나침반도 줄 수 없습니다. 당신이 가진 유일한 단서는 목적지를 찍은 사진 한 장뿐입니다. 이것이 바로 **이미지 목표 내비게이션(image-goal navigation)**의 과제입니다. 이를 해결하기 위해 로봇은 단순히 사진을 보고 추측하는 것을 넘어, 약간의 '몽상가'가 되어야 합니다. 로봇에게는 "내가 왼쪽으로 한 걸음 가면 세상이 어떻게 보일까? 오른쪽으로 돌면 어디에 도착하게 될까?"라고 물을 수 있는 '세계 모델(world model)'—즉, 정신적 시뮬레이터—이 필요합니다. 이러한 정신적 시뮬레이션을 수천 번 실행함으로써, 로봇은 실제로 바퀴를 굴리기도 전에 최선의 경로를 선택할 수 있습니다. 하지만 여기에는 함정이 있습니다. 만약 로봇의 정신적 시뮬레이터가 미래를 예측하는 데 서툴거나, '좋은' 경로와 '나쁜' 경로를 구분하지 못한다면, 로봇은 길을 잃게 될 것입니다. 로봇은 자신의 백일몽을 순위 매길 방법, 즉 실제 사진의 모습으로 이어지는 경로가 가장 높은 점수를 받도록 보장하는 방법이 필요합니다.

이 논문은 정확히 이 문제를 다룹니다. 즉, 로봇의 정신적 시뮬레이터가 미래를 정확하게 예측할 뿐만 아니라, 자신의 예측을 스스로 '채점'할 수 있도록 만드는 방법입니다. 연구진은 단순히 다음 단계를 예측하도록 로봇을 훈련시키는 것만으로는 충분하지 않다는 것을 발견했습니다. 만약 로봇이 완벽한 실제 데이터(이를 '교사 강요(teacher forcing)'라고 합니다)를 바탕으로 미래를 예측하도록 훈련받는다면, 로봇은 외부의 정답(ground truth)에 의존하게 되어, 자신의 불완전한 추측을 바탕으로 미래를 예측해야 할 때 실패하게 됩니다. 또한, 특정 유형의 대조 학습(contrastive learning)을 사용하여 로봇의 예측을 더 '변별력' 있게 만들려고 하면 오히려 정신적 지도의 기하학적 구조를 망가뜨려 계획 수립을 어렵게 만든다는 사실을 발견했습니다. 대신, 그들은 로봇이 자신의 이전 추측을 사용하여 미래를 예측하도록 강제하는 새로운 훈련 방법(자기회귀적 롤아웃, autoregressive rollout)을 제안했으며, 여기에 특별한 규칙을 추가했습니다. 즉, 경로가 목표에서 멀어질수록 더 높은 '비용'이나 페널티를 받도록 하는 것입니다. 이는 로봇이 최선의 경로를 향해 쉽게 미끄러져 내려갈 수 있는 부드럽고 단조로운(monotone) 지형을 만들어 줍니다.

로봇의 백일몽 문제

목표 이미지를 향해 항해하려는 로봇을, 오직 정상에서의 풍경 사진만을 가지고 특정 산봉우리에 도달하려는 등산가에 비유해 보세요. 등산가는 지도가 없고, 나침반도 없으며, 현재 자신이 어디에 있는지도 모릅로 합니다. 그들에게 있는 것은 오직 눈과 목적지의 정신적 이미지뿐입니다. 그곳에 도달하기 위해 등산가는 다음과 같이 상상해야 합니다: "북쪽으로 걸어가면 나무들이 사진과 똑같이 보일까? 남쪽으로 걸어가면 절벽이 보일까?"

로봇 공학의 세계에서 이 정신적 시뮬레이션은 **세계 모델(World Model)**이라고 불립니다. 이는 수정구슬처럼 작동하는 신경망입니다. 당신이 "지금 보이는 것은 이것이고, 내가 하려는 행동은 이것이다"라고 말하면, 모델은 "다음에 보게 될 모습은 이것이다"라고 답합니다. 이 예측들을 사슬처럼 엮음으로써, 로봇은 머릿속에서 전체 여정을 시뮬레이션할 수 있습니다.

하지만 까다로운 점은 바로 **계획(Planning)**입니다. 단순히 수정구슬을 가지고 있는 것만으로는 부족합니다. 어떤 경로가 최선인지 알아야 합니다. 로봇은 수백 가지의 서로 다른 가상 경로를 시도합니다. 로봇에게는 이 경로들의 점수를 매길 방법이 필요합니다. 이 논문에서 점수는 **코사인 거리(cosine distance)**를 기준으로 합니다. 이는 두 이미지(또는 그들의 디지털 '지문')가 얼마나 유사한지를 측정하는 세련된 방식입니다. 만약 경로의 끝에 대한 로봇의 정신적 시뮬레이션이 목표 사진과 매우 유사하다면 점수는 높습니다. 만약 전혀 닮지 않았다면 점수는 낮습니다.

저자들이 발견한 문제는 기존의 많은 로봇이 이 점수 매기기 게임에 매우 서투르다는 것입니다. 로봇은 한 단계 앞의 미래는 정확하게 예측할 수 있을지 몰라도, 열 단계 앞을 예측하려고 하면 예측이 궤도를 벗어납니다. 더 심각한 것은, 설령 미래를 어느 정도 잘 예측하더라도, 서로 다른 경로에 부여하는 '비용'이 혼란스러울 수 있다는 점입니다. 절벽으로 이어지는 경로가 '훌륭한' 점수를 받고, 산봉우리로 가는 경로가 '끔찍한' 점수를 받는 등산가를 상상해 보세요. 그 등산가는 절벽으로 걸어 들어갈 것입니다! 이는 "당신이 목표에서 얼마나 멀어졌는가"와 "당신의 점수" 사이의 관계가 부드럽거나 단조롭지(monotone) 않을 때 발생합니다.

해결책: 더 나은 백일몽가

Drexel 대학교의 Amirhosein Chahe, Siwei Cai, Lifeng Zhou 저자들은 이를 해결하기 위해 새로운 종류의 로봇 두뇌를 구축했습니다. 그들은 이를 **단조적 계획 비용을 가진 잠재 세계 모델(Latent World Model with Monotone Planning Costs)**이라고 부릅니다. 그들이 무엇을 했는지 몇 가지 비유를 통해 살펴보겠습니다.

1. 얼어붙은 렌즈와 훈련 가능한 두뇌

먼저, 그들은 이미지를 디지털 지문으로 변환하는 데 매우 뛰어난 사전 훈련된 '눈'(DINO 계열 인코더)을 사용했습니다. 이 눈은 변하지 않고 오직 세상을 명확하게 보기만 합니다. 그런 다음, 그들은 그 디지털 지문을 받아 로봇이 움직인 후의 모습이 어떻게 변할지 예측하는 '두뇌'(훈련 가능한 예측기)를 구축했습니다.

2. "연습이 완벽을 만든다" 훈련 (자기회귀적 롤아웃)

대부분의 로봇은 교사가 모든 질문 뒤에 바로 정답지를 주는 교실에서 공부하는 학생처럼 훈련됩니다. 이를 **교사 강요(teacher forcing)**라고 합니다. 로봇은 현재 이미지를 보고, 교사가 "왼쪽으로 움직였다"라고 말하면, 로봇은 다음 이미지를 예측합니다. 그러면 교사는 즉시 이를 수정해 줍니다.

문제는, 로봇이 실제 세상에 나갔을 때 옆에서 정답을 알려주는 교사가 없다는 것입니다. 로봇은 자신의 이전 예측을 바탕으로 다음 이미지를 추측해야 합니다. 만약 첫 번째 단계에서 작은 실수를 한다면, 그 실수는 두 번째 단계에서 더 커지고, 열 번째 단계에 이르면 로봇은 완전히 다른 세상을 꿈꾸고 있게 됩니다. 이를 **훈련-테스트 불일치(train-test mismatch)**라고 합니다.

저자들은 로봇이 스스로의 예측을 바탕으로 백일몽을 연습하도록 함으로써 이 문제를 해결했습니다. 로봇이 1단계 예측을 바탕으로 2단계를 예측하고, 다시 2단계 예측을 바탕으로 3단계를 예측하도록 만든 것입니다. 이를 **자기회귀적 롤아웃(autoregressive rollout)**이라고 합니다. 이는 마치 정답지 없이 시험을 치러야 하는 학생처럼, 자신의 실수를 스스로 다루는 법을 배우도록 강제하는 것과 같습니다. 또한, 그들은 '역방향 커리큘럼(counter-curriculum)'을 사용하여 짧은 백일몽(2단계)에서 시작해 로봇이 숙달됨에 따라 점차 긴 백일몽(최대 8단계)으로 늘려가며, 로봇이 압도당하지 않도록 조절했습니다.

3. "단조적 비용" 규칙

더 나은 백일몽을 갖게 되었음에도 불구하고, 로봇은 여전히 경로를 순위 매길 더 나은 방법이 필요했습니다. 저자들은 **단조적 비용 순위(Monotone Cost Ranking, MCR)**라고 불리는 규칙을 도입했습니다.

바닥이 목표 지점인 언덕을 상상해 보세요. 목표에서 멀어질수록 당신은 더 높은 곳에 있게 됩니다. 이것이 단조로운(monone) 지형입니다. 즉, 목표에서 멀어지면 당신의 '비용'(높이)은 항상 높아집니다. 결코 낮아졌다가 다시 높아지는 일이 없습니다.

많은 기존 모델에서 이 '언덕'은 울퉁불퉁했습니다. 약간 빗나간 경로가 우연히 '골짜기'(낮은 비용)처럼 보여서, 로봇이 올바른 궤도에 있다고 착각하게 만들 수도 있었습니다. 저자들은 로봇에게 "경로에서 벗어나면 반드시 페널티가 높아져야 한다"라고 가르치는 특별한 훈련 손실 함수를 추가했습니다. 그들은 수많은 약간 어긋난 경로들을 생성하고, "더 많이 벗어날수록 페널티가 더 커져야 한다"라고 로봇에게 알려줌으로써 이를 수행했습니다. 이는 정신적 지도를 매끄럽게 만들어, 로봇이 **교차 엔트로피 방법(Cross-Entropy Method, CEM)**이라는 기술(수많은 경로를 샘플링하여 최선의 것을 고르는 방식)을 사용하여 최저점(목표)을 쉽게 찾을 수 있도록 했습니다.

4. 놀라운 "금지 구역"

연구진은 좋은 아이디어처럼 보였던 **행동 대조 학습(Action-Contrastive Learning)**도 테스트했습니다. 이는 로봇에게 '좋은' 행동과 '나쁜' 행동의 쌍을 보여줌으로써 두 행동을 구분하는 법을 가르치는 기술입니다. 그들은 이것이 로봇의 정신적 지도를 더 날카롭게 만들 것이라고 생각했습니다.

그러나 결과는 반대였습니다. 행동의 순서를 섞는 방식(temporal permutation negatives)을 사용하는 특정 유형의 대조 학습을 사용했을 때, 오히려 로봇의 계획 능력을 망가뜨렸습니다. 그것은 마치 망치로 칼을 갈려고 하는 것과 같았습니다. 지도가 왜곡되어 로봇이 더 이상 목표를 찾을 수 없게 되었습니다. 이 논문은 이 방법이 이 특정 작업에는 적합하지 않음을 명시적으로 밝히며, 때로는 표현을 '변별력 있게(discriminative)' 만드는 것이 계획에 필요한 '기하학적 구조(geometry)'를 파괴할 수 있음을 보여줍니다.

결과: 실제로 길을 찾는 로봇

연구팀은 6가지 유형의 로봇이 실제 환경을 항해하는 데 사용된 시간 단위 영상이 담긴 GNM 데이터셋을 사용하여 새로운 로봇 두뇌를 테스트했습니다. 그들은 NWM(전체 비디오 프레임을 예측함), DINO-WM(이전의 잠재 모델), OmniVLA(거대한 반응형 정책)를 포함한 여러 최고 경쟁 모델들과 비교했습니다.

결과는 인상적이었습니다. DINOv2 인코더를 사용한 그들의 모델은 이전 최고의 잠재 모델인 DINO-WM과 비교했을 때 **방향 오차(orientation error)**를 2.7배 감소시켰습니다. 쉬운 말로, 로봇이 목적지에 도착했을 때 훨씬 더 정확한 방향을 향하고 있었다는 뜻입니다.

  • 방향 오차 (AOE): 그들의 최적 모델은 **7.63°**를 기록한 반면, 이전 최고 모델(DINOv2를 사용한 DINO-WM)은 **20.27°**를 기록했습니다.
  • 변위 오차 (ADE): 그들은 로봇이 목표로부터 떨어진 거리 또한 줄였습니다.

더 중요한 것은, 그들이 실제 물리적 로봇(Clearpath Husky)을 사용하여, 해당 위치의 훈련 데이터를 전혀 보여주지 않은 상태에서 실제 세계를 테스트했다는 점입니다. 이것을 제로샷(zero-shot) 배포라고 합니다. 로봇은 본 적 없는 실내외 환경을 성공적으로 항해하며, 경쟁 모델들보다 훨씬 더 논리적이고 목표 지향적인 경로를 따라 이동했습니다. 다른 모델들이 벽에 부딪히거나 너무 일찍 멈춰 서는 동안, 이 모델은 목표 이미지를 향해 계속 움직였습니다.

이것이 왜 중요한가

이 논문은 로봇이 오직 목표 이미지만을 사용하여 효과적으로 항해하려면, 단순히 좋은 예측기를 갖는 것 이상의 것이 필요함을 시사합니다. 즉, 자신의 실수를 처리하도록 훈련된 예측기와 부드럽고 신뢰할 수 있는 점수 체계가 필요합니다. 훈련 방식(자기회귀적 롤아웃)을 개선하고 비용 지형(단조적 순위)을 형성함으로써, 저자들은 반응형 정책(다음 동작을 단순히 추측함)과 이전의 세계 모델들을 모두 능가하는 시스템을 만들어냈습니다.

하지만 저자들은 이것이 모든 상황에 적용되는 마법의 해결책은 아니라는 점을 주의 깊게 언급합니다. 이 모델은 정적이거나 유동 인구가 적은 환경에서 가장 잘 작동합니다. 움직이는 보행자나 차량이 있는 혼잡한 장면에서는 아직 테스트되지 않았습니다. 또한, 로봇이 계획을 위해 자신의 예측에 의존하기 때문에, 매우 긴 여정(매우 긴 호라이즌)은 여전히 도전적인 과제입니다. 작은 오류가 결국 쌓일 수 있기 때문입니다. 하지만 현재로서는, 이 접근 방식은 로봇이 목적지를 향해 꿈을 꾸며 나아가는 법을 가르치는 데 있어 중요한 진전을 나타냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →