← 최신 논문
💻 computer science

InfiniVerse: Occupancy Guided Unbounded Scene Generation for Autonomous Driving

InfiniVerse는 단일 프레임으로부터 3D 점유(occupancy)를 재구성하고, 이를 자기회귀적으로 확장하며, 비디오 확산 모델의 출력을 3D 공간 표현과 정렬시키는 계층적 스케치-및-정제(sketch-and-refine) 패러다임을 통해 정제함으로써, 자율 주행을 위한 현실적이고 제어 가능하며 시간적 일관성을 갖춘 장거리 도시 장면을 생성하는 통합 파이프라인이다.

원저자: Xiaoyu Ye, Leheng Li, Xinyu Ji, Yingjie Cai, Hongda He, Xu Yan, Guanyi Zhao, Ying-Cong Chen, Bingbing Liu, Shuguang Cui, Zhen Li

게시일 2026-07-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xiaoyu Ye, Leheng Li, Xinyu Ji, Yingjie Cai, Hongda He, Xu Yan, Guanyi Zhao, Ying-Cong Chen, Bingbing Liu, Shuguang Cui, Zhen Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 자율주행 자동차가 학습할 수 있도록, 결코 끝나지 않는 현실적인 도시 거리 영상을 만들려는 건축가라고 상상해 보십시오. 보통 이 작업은 믿기 힘들 정도로 어렵습니다. 단순히 컴퓨터에게 "영상을 계속 만들어"라고 요청하면, 결국 컴퓨터는 환각을 일으키기 시작합니다. 도로는 불가능한 모양으로 뒤틀리고, 건물은 사라지며, 자동차는 허공 속으로 달려들 수도 있습니다. 만약 엄격한 지도에 따라 움직이도록 강제하려고 하면, 영상은 딱딱하고 가짜처럼 보입니다.

InfiniVerse거친 스케치와 고화질 카메라를 모두 사용하는 숙련된 설계자처럼 행동함으로써 이 문제를 해결하는 새로운 시스템입니다.

작동 방식은 다음과 같습니다.

1. "3D 골격" (점유 그리드, Occupancy Grid)

먼저, 시스템은 거리의 단일 스냅샷(자동차의 카메라처럼 여러 각도에서 촬영된 것)을 살펴봅니다. 단순히 평면적인 사진을 보는 것이 아니라, 세상의 **3D "골격"**을 구축합니다. 이것은 거대한 투명한 블록 격자라고 생각하면 됩니다. 컴퓨터는 여기서 "이 블록은 도로이고, 저 블록은 건물이며, 이 블록은 빈 공기이다"라고 결정합니다.

  • 이것이 중요한 이유: 이는 시스템이 물리적인 구조를 붙잡을 수 있게 해주어, 영상이 길어져도 길을 잃지 않도록 해줍니다.

2. "거친 스케치" (자기회귀 확장, Autoregressive Extension)

이제, 원래 사진에는 존재하지 않는 새로운 도로로 차를 운전하고 싶다고 가정해 봅시다. 당신은 지도의 한 지점에 가고자 하는 경로를 나타내는 간단한 선(스케치)을 그립니다.

  • InfiniVerse는 이 스케치를 사용하여 3D 골격을 앞으로 확장합니다. 이는 당신의 경로를 따라 도시의 새로운 블록들을 채워 넣습니다.
  • 이 단계에서 도시는 여전히 다소 투박하고 저해상도입니다(마치 마인크래프트 세계처럼). 하지만 형태와 레이아웃은 올바른 상태입니다.

3. "고화질 카메라" (비디오 생성, Video Generation)

다음으로, 시스템은 이 투박한 3D 골격을 가져와 강력한 AI 비디오 생성기에게 요청합니다. "이것을 실제처럼 사실적인 영화처럼 만들어줘."

  • 시스템은 투박한 블록들을 매끄러운 아스팔트, 빛나는 자동차, 그리고 사실적인 나무로 변환합니다.
  • 결정적으로, 시스템은 당신이 스케치한 경로를 따라 카메라가 정확하게 움직이는 동안 이 작업을 수행합니다.

4. "피드백 루프" (비법/핵심 요소)

이 부분이 가장 중요합니다. 보통 AI 비디오 생성기는 자신의 창의성에 취해 시간이 지나면서 현실에서 벗어나게 됩니다. InfiniVerse는 양방향 대화를 통해 이를 방지합니다.

  1. 3D가 2D를 안내함: 거친 3D 골격이 비디오 생성기에게 "도로 위에 머물러라; 건물이 공중에 떠 있게 만들지 마라"라고 지시합니다.
  2. 2D가 3D를 안내함: 영상이 제작된 후, 시스템은 아름답고 사실적인 이미지를 살펴보고 이를 3D 골격에 다시 투영합니다. 시스템은 "헤이, 영상에 여기에 나무가 있으니, 나무를 포함하도록 3D 골격을 업데이트해"라고 말합니다.

이것은 **폐쇄 루프(Closed Loop)**를 만듭니다. 3D 구조는 비디오가 이상해지는 것을 막아주고, 사실적인 비디오는 3D 구조를 정확하게 유지해 줍니다. 이들은 서로의 작업을 끊임없이 확인합니다.

결과

이 논문은 이 시스템이 이전 방식들보다 훨씬 더 오랫동안 현실적이고 물리적으로 일관된 길고 연속적인 주행 영상을 생성할 수 있다고 주장합니다.

  • 마법 같은 지도가 필요 없음: 세상에 대한 미리 만들어진 완벽한 지도가 필요하지 않습니다. 단 하나의 시작 사진만으로 세상을 스스로 구축해 나갑니다.
  • 안정성: 도로가 벽으로 굽어지거나 하늘이 초록색으로 변하는 등의 "드리프트(표류)" 현상이 발생하지 않습니다.
  • 제어 가능성: 당신이 왼쪽으로 꺾거나, 직진하거나, 오른쪽으로 돌라고 명령하면, 시스템은 그 경로를 따르는 현실적인 도시를 구축할 것입니다.

요약하자면, InfiniVerse는 세트(3D)를 만들고 장면(2D)을 촬영하는 일을 동시에 수행하며, 배우들이 여전히 세트 위에 있는지, 그리고 세트가 여전히 영화처럼 보이는지를 끊임없이 확인하는 자기 수정형 영화 감독과 같습니다. 이를 통해 자율주행 자동차가 연습할 수 있는 끝없는 현실적 주행 시나리오를 만들어낼 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →