← 최신 논문
💻 computer science

OmniNWM: Omniscient Driving Navigation World Models

OmniNWM은 정렬된 파노라마 멀티모달 비디오를 생성함으로써 상태, 행동, 보상 차원을 동시에 다루고, 기하학적 행동 인코딩을 통해 정밀한 제로샷 궤적 제어를 가능하게 하며, 3D 점유(occupancy)로부터 내재적인 조밀한 보상을 도출하여 강건한 폐루프 계획 평가를 가능케 하는 통합된 확률론적 세계 모델을 도입한다.

원저자: Bohan Li, Zhuang Ma, Dalong Du, Baorui Peng, Zhujin Liang, Zhenqiang Liu, Xianda Guo, Zheng Zhu, Chao Ma, Yueming Jin, Xin Jin, Hao Zhao, Wenjun Zeng

게시일 2026-06-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Bohan Li, Zhuang Ma, Dalong Du, Baorui Peng, Zhujin Liang, Zhenqiang Liu, Xianda Guo, Zheng Zhu, Chao Ma, Yueming Jin, Xin Jin, Hao Zhao, Wenjun Zeng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 자동차 운전하는 법을 가르치려 한다고 상상해 보세요. 이를 안전하게 수행하기 위해서는 단순히 몇 개의 영상을 보여주는 것만으로는 부족합니다. 로봇이 실제 자동차를 충돌시키지 않고도 운전을 연습하고, 실수하고, 그 실수로부터 배울 수 있도록 컴퓨터 안에 가상 세계를 구축해야 합니다.

이 논문은 이전 버전들보다 훨씬 더 똑똑한 새로운 유형의 "가상 주행 시뮬레이터"인 OmniNWM을 소개합니다. 저자들은 이 모델이 단순히 도로의 모습만을 추측하는 것이 아니라, 도로와 자동차의 움직임, 그리고 자신의 행동에 따른 결과까지 동시에 이해하기 때문에 "전지전능한(Omniscient)" 월드 모델이라고 부릅니다.

작동 원리는 일상적인 비유를 사용하여 세 가지 간단한 부분으로 나눌 수 있습니다.

1. "모든 것을 보는 눈" (상태, State)

문제점: 기존의 시뮬레이터들은 한 번에 한 가지만 볼 수 있는 눈을 가린 사람과 같았습니다. 도로 영상을 생성할 수는 있었지만, 나무까지의 거리나 표지판의 색상을 예측하려고 하면 그 예측이 영상과 일치하지 않는 경우가 많았습니다. 이는 마치 배경이 무작위로 변하는 영화를 보는 것과 같았습니다.

OmniNWM의 해결책: OmniNWM은 하나의 캔버스 위에 네 가지 다른 버전의 장면을 동시에 그려내는 거장 화가처럼 행동합니다.

  1. 사진 (RGB): 카메라가 보는 모습.
  2. 지도 (Semantics): 사물의 정체 (예: "저것은 자동차다", "저것은 도로다").
  3. 자 (Depth): 사물이 얼마나 멀리 있는지.
  4. 3D 블록 (Occupancy): 공간의 입체적 모델 (공간이 비어 있는지, 아니면 벽이 있는지).

이 네 가지를 동시에 그리기 때문에 서로 완벽하게 일치합니다. 만약 로봇이 "거리(depth)" 버전에서 자동차가 10미터 떨어져 있다고 생각한다면, "사진(photo)" 버전에서도 자동차가 적절한 크기로 보여야 합니다. 이는 가상 세계가 물리적으로 일관성을 갖도록 보장합니다.

2. "만능 리모컨" (행동, Action)

문제점: 기존 시뮬레이터에서 로봇에게 좌회전을 가르치는 것은 특정 브랜드의 TV에서만 작동하는 리모컨으로 운전을 가르치는 것과 같았습니다. 만약 카메라 설정(즉, "TV")을 바꾸면 리모컨은 작동을 멈췄습니다. 로봇은 '회전'이라는 개념이 아니라 '카메라의 형태'를 학습했기 때문에 혼란에 빠졌습니다.

OmniNWM의 해결책: 저자들은 **"정규화된 파노라마 레이 맵(Normalized Panoramic Ray-map)"**이라는 **"만능 리모컨"**을 발명했습니다.

  • 도시 지도를 상상해 보세요. 지도를 북쪽에서 보든, 남쪽에서 보든, 혹은 거꾸로 보든 도시의 구조는 변하지 않습니다.
  • OmniNWM은 모든 운전 명령(예: "좌회전" 또는 "직진")을 이 만능 지도 언어로 변환합니다.
  • 이를 통해 로봇은 한 도시(특정 카메라 세트)에서 운전을 배웠더라도, 카메라 구성이 완전히 다른 전혀 새로운 도시에서 즉시 운전할 수 있습니다. 로봇은 단순히 카메라 각도를 배우는 것이 아니라, 회전의 기하학적 구조를 이해하기 때문입니다.

3. "타고난 양심" (보상, Reward)

문제점: 보통 로봇을 가르칠 때는 사람이 매 동작마다 "잘했어!" 또는 "못했어!"라고 말해줘야 합니다. 컴퓨터 시뮬레이션에서 이 선생님 역할을 하는 프로그램은 종-종 별도의 '블랙박스' 프로그램이며, 이는 틀리거나 일관성이 없을 수 있습니다.

OmniNWM의 해결책: OmniNWM은 로봇에게 내장된 양심을 부여합니다.

  • 시뮬레이터가 세상의 완벽한 3D 모델(앞서 언급한 "Occupancy")을 생성하기 때문에, 로봇은 즉각적으로 스스로 확인할 수 있습니다: "내가 벽에 부딪혔나?" 또는 "내가 인도 위로 달리고 있나?"
  • 컴퓨터는 물리 법칙에 기반하여 자동으로 "점수(보상)"를 계산합니다. 로봇이 가상의 나무를 들이받으면 벌점을 받고, 차선을 잘 유지하면 보너스를 받습니다.
  • 이는 **폐쇄 루프(closed loop)**를 형성합니다. 로봇은 운전하고, 세상은 안전 여부를 확인하여 점수를 부여하며, 로봇은 그 점수를 바탕으로 다음 움직임을 계획합니다. 이는 게임 엔진 자체가 인간 심판 없이도 당신이 이기고 있는지 지고 있는지를 알려주는 비디오 게임을 하는 것과 같습니다.

이것이 왜 중요한가요?

논문에 따르면, OmniNWM은 이 세 가지 요소(모든 것을 명확하게 보고, 움직임을 보편적으로 이해하며, 안전을 자동으로 판단함)를 결합함으로써 다음과 같은 성과를 낼 수 있습니다.

  • 훨씬 더 오래 주행 가능: 기존 모델처럼 몇 초 만에 길을 벗어나거나 혼란에 빠지지 않고 오랫동안 주행할 수 있습니다.
  • 새로운 상황 대처: 학습한 데이터에 국한되지 않고 운전의 보편적인 규칙을 이해하기 때문에, 본 적 없는 도시(nuPlan 데이터셋 등)에서도 운전할 수 있습니다.
  • 상호작용 시뮬레이션: 로봇이 트럭 앞으로 끼어들려고 하면, 시뮬레이터는 누군가 스크립트를 짠 대로 움직이는 것이 아니라 실제 운전자들이 반응하는 방식을 학습했기에 자연스럽게 트럭이 "속도를 줄이거나" "양보하는" 모습을 보여줍니다.

요약하자면, OmniNWM은 로봇이 수 시간 동안 연습하고, 자신의 실수로부터 배우며, 인간의 도움이나 특정 카메라 설정 없이도 안전한 운전자가 될 수 있는 자기 완결적이고 고도로 정밀한 운전 학교입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →