← 최신 논문
🤖 AI

OmniDrive: An LLM-Choreographed Multi-Agent World Model with Unified Latent Co-Compression for Multi-View Driving Video Generation

이 논문은 공유된 잠재 토큰 시퀀스와 공동 압축 전략을 통해 이종의 주행 제어와 다중 뷰 기하학을 통합함으로써 최첨단 일관성을 달성하고 자율 주행 작업에 대한 상당한 다운스트림 유용성을 입증하는, LLM이 안무를 맡은 멀티 에이전트 월드 모델인 DRIVE-CHOREO를 소개한다.

원저자: Zijie Meng, Yufei Liu, Chengqian Ma, Zhiyu Li, Jiyuan Liu, Wenhua Nie, Bingcai Wei, Shuqin Chen, Weichen Xu, Jiquan Yuan, Miao Zhang

게시일 2026-06-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zijie Meng, Yufei Liu, Chengqian Ma, Zhiyu Li, Jiyuan Liu, Wenhua Nie, Bingcai Wei, Shuqin Chen, Weichen Xu, Jiquan Yuan, Miao Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 도로 영상을 보여주며 자동차 운전하는 법을 가르치려 한다고 상상해 보세요. 로봇은 세 가지를 동시에 이해해야 합니다: 운전자가 무엇을 말하고 있는지(언어), 자동차와 도로가 어디에 있는지(기하학), 그리고 카메라가 실제로 무엇을 보고 있는지(픽셀)입니다.

오랫동안 AI 연구자들은 이 세 가지가 어떻게 매끄럽게 함께 작동하게 만들 것인가를 두고 어려움을 겪었습니다. 이것은 마치 바이올린 연주자는 악보를 읽고 있고, 드러머는 팟캐스트를 듣고 있으며, 가수는 즉흥 연주를 하고 있는 오케스트라를 지휘하려는 것과 같습니다. 그 결과는 종종 자동차가 갑자기 순간 이동하거나, 카메라 사이에서 하늘의 색이 변하거나, 로봇이 교통 신호를 무시하는 등 엉망진창인 공연이 됩니다.

이 논문은 이 혼란을 해결하기 위해 마스터 영화 감독 역할을 하는 새로운 시스템인 OMNIDRIVE를 소개합니다. OMNIDRIVE가 어떻게 작동하는지 간단한 개념으로 나누어 설명하면 다음과 같습니다.

1. 문제점: "연결되지 않은" 제작진

현재의 자율주행 비디오 AI 모델들은 보통 '무엇인지'(언어)와 '어디에 있는지'(지도)를 '어떻게 보이는지'(비디오)와 별개로 처리합니다.

  • 문제점: 이들은 비디오가 거의 다 만들어진 후에 이 분리된 부분들을 하나로 붙이려고 시도합니다. 이것은 영화가 이미 상영 중인데 영화 화면 위에 지도를 덧붙이려는 것과 같습니다. 그 결과, 왼쪽 카메라에는 나무가 보이는데 오른쪽 카메라에는 건물이 보이는 식의 '드리프트(밀림)' 현상이 발생하거나, 차가 이상하게 튀는 현상이 나타납니다.

2. 해결책: "3인 에이전트" 감독

OMNIDRIVE는 엉성한 접착제 대신, 비디오 생성 전과 도중에 함께 작동하는 세 명의 전문화된 AI 에이전트(대규모 언어 모델 기반) 팀을 도입합니다. 이들을 영화 제작팀이라고 생각해보세요.

  • 설계자 (시나리오 작가): 당신이 "비 오는 밤의 도시를 주행하라"와 같은 간단한 프롬프트를 입력하면, 설계자는 이를 **월드스크립트(WORLDSCRIPT)**라는 엄격하고 구조화된 대본으로 번역합니다. 이 대본은 날씨가 어떤지, 자차(ego-car)가 어디로 가는지, 다른 차량들이 어디에 있는지 정확하게 나열합니다.
  • 지도 제작자 (세트 디자이너): 이 에이전트는 스크립트를 받아 희소한 형태의 지도(blueprint)를 그립니다. 전체 비디오를 그리는 것이 아니라, 도로의 선, 차선, 그리고 다른 차량 주변의 박스만을 그립니다. 이는 텍스트를 카메라 각도에 맞는 시각적 지도로 변환하는 과정입니다.
  • 감사관 (품질 관리 검사관): 비디오가 제작되는 동안, 이 에이전트는 각 카메라 뷰를 감시합니다. 만약 앞쪽 카메라는 빨간색 차를 보고 있는데 옆쪽 카메라는 파란색 차를 보고 있다면, 감사관은 "이건 맞지 않아요!"라고 외치며 시스템에 즉시 수정하도록 지시합니다.

3. 핵심 기술: "잠재 공동 압축 (Latent Co-Compression)"

이것은 이 논문에서 가장 기술적이면서도 결정적인 혁신입니다. 보통 AI는 자동차에 달린 6개의 카메라를 각각 하나의 창문을 통해 하나씩 보는 것처럼 따로 처리합니다.

하지만 OMNIDRIVE는 다르게 행동합니다. 6개의 카메라 영상과 지도 제작자가 만든 '청사진'을 가져와서, AI가 비디오를 생성하기 전부터 이 모든 것을 하나의 길고 긴 데이터 스트립으로 꿰매어 버립니다.

  • 비유: 여러분에게 여섯 개의 퍼즐 조각이 있다고 상상해 보세요. 색칠을 다 한 뒤에 조각들을 맞추려고 하는 대신, 먼저 이 조각들을 하나의 커다란 판 위에 테이프로 붙여 놓는 것입니다. 그런 다음 판 전체를 한꺼번에 색칠합니다. 조각들이 판 위에 물리적으로 연결되어 있기 때문에, 페인트(비디오)는 틈이나 오류 없이 자연스럽게 한 카메라에서 다음 카메라로 흘러갑니다.
  • 결과: AI는 6개의 개별적인 2D 이미지가 아니라, 하나의 통합된 3D 객체로서 세상을 '봅니다'. 이를 통해 왼쪽 카메라에 차가 있다면, 그 차는 오른쪽 카메라에서도 정확히 있어야 할 위치에 있게 됩니다.

4. 결과: 완벽하게 정렬된 영화

언어, 지도, 그리고 비디오가 첫 단계부터 모두 함께 '안무(choreographed)'되었기 때문에 다음과 같은 결과가 나타납니다:

  • 고스트 현상 제거: 자동차가 카메라 뷰 사이에서 사라지거나 순간 이동하지 않습니다.
  • 완벽한 일관성: 6개의 모든 카메라에서 조명과 그림자가 완벽하게 일치합니다.
  • 실제 활용 가능성: 이 논문은 만약 자율주행차의 두뇌를 오직 OMNIDRIVE가 만든 비디오로만 학습시킨다면, 그 자동차가 실제 영상만으로 학습한 자동차보다 실제 세상에서 더 잘 운전할 수 있음을 보여줍니다.

요약

OMNIDRIVE는 자율주행 비디오 생성을 위한 **슈퍼 컨덕터(초전도체/지휘자)**와 같습니다. 언어, 지도, 카메라가 서로 다투게 두는 대신, 이들이 같은 테이블에 앉아 같은 언어로 말하며 완벽하게 동기화되도록 강제합니다. 그 결과, 실제 자동차가 안전하게 운전하는 법을 가르칠 수 있을 만큼 매우 사실적이고 일관된 드라이빙 시뮬레이션을 만들어냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →