← 최신 논문
💻 computer science

USR-Drive: Unified Driving Scene Representation via Joint Denoising of 3D Gaussians and Boxes

본 논문은 상호 기하학적 및 구조적 제약을 활용하여 최첨단 동적 재구성(dynamic reconstruction)과 3D 객체 탐지를 동시에 달성하기 위해, 공유된 디퓨전 트랜스포머를 통해 3D 가우시안 프리미티브와 바운딩 박스를 공동으로 디노이징하는 통합 조건부 생성 프레임워크인 USR-Drive를 제안한다.

원저자: Li-Heng Chen, Haokai Pang, Chengye Su, Jiarun Liu, Qifeng Chen, Ziqian Ni, Jianxin Huang, Shi-Sheng Huang, Hongbo Fu, Sheng Yang

게시일 2026-08-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Li-Heng Chen, Haokai Pang, Chengye Su, Jiarun Liu, Qifeng Chen, Ziqian Ni, Jianxin Huang, Shi-Sheng Huang, Hongbo Fu, Sheng Yang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

자율주행 자동차가 세상을 어떻게 보는지 이해하려면, 먼저 그 자동차가 무엇을 구축하려고 하는지를 이해해야 합니다. 차량은 단순히 사진을 찍는 것이 아니라, 실시간으로 주변 환경의 3차원 지도를 구축합니다. 이 지도가 유용해지려면 두 가지 뚜렷한 요소가 필요합니다. 첫째, 도로, 연석, 건물이 정확히 어디에 있는지 보여주는 조밀하고 연속적인 표면이 필요하며, 이를 통해 자동차는 모든 사물이 얼마나 멀리 떨어져 있는지 알 수 있습니다. 둘째, 자동차나 보행자와 같은 특정 객체를 식별하고, 이들의 움직임을 추적하고 다음 행보를 예측할 수 있도록 투명한 상자(box)로 감싸야 합니다. 수년간 엔지니어들은 이 두 작업을 별개의 업무로 취급해 왔습니다. 한 팀의 알고리즘은 3D 지도를 구축하고, 다른 팀은 상자를 찾아내는 식이었습니다. 이러한 분리는 종 often 오류를 초래했습니다. 지도는 움직이는 물체 주변에서 흐릿해질 수 있고, 상자는 놓일 수 있는 단단한 표면이 없어 빈 공간에 떠 있는 것처럼 보일 수 있었습니다.

NIO, 홍콩 과학기술대학교, 그리고 북경사범대학교의 연구진이 개발한 새로운 접근 방식은 이 두 작업을 하나의 과정으로 통합함으로써 이를 해결하고자 합니다. 그들은 이 시스템을 USR-Drive라고 부릅니다. 이 시스템은 지도를 만든 후 차를 찾거나, 차를 찾은 후 지도에 맞추려 하는 대신, 상세한 3D 표면과 객체 상자를 동시에 생성합니다. 연구진은 이 두 요소가 함께 생성될 때 서로를 돕는다는 사실을 발견했습니다. 조밀한 지도는 상자가 놓일 수 있는 단단한 지면을 제공하며, 상자는 자동차가 움직일 때 지도가 흐려지거나 뒤틀리지 않도록 유지하는 구조적 골격 역할을 합니다.

이 시스템의 핵심은 노이즈를 제거하는 법을 배우는 일종의 인공지능입니다. 신호가 잡히지 않는 오래된 텔레비전 화면처럼 노이즈(static)로 가득 찬 화면에서 시작한다고 상상해 보십시오. 시스템은 그 노이즈를 천천히 제거하여 그 아래에 있는 선명한 주행 장면을 드러내도록 훈련됩니다. 여기서 '그림'은 단순한 평면 이미지가 아니라, 도로와 건물을 형성하는 수백만 개의 미세한 점들과 그 안의 자동차와 사람을 정의하는 일련의 투명한 상자들을 포함하는 복잡한 3D 장면입니다. 연구진은 이 두 가지 서로 다른 유형의 정보, 즉 매끄러운 도로 표면과 자동차의 날카로운 모서리가 동일한 물리적 공간에 속한다는 것을 AI에게 가르치는 특별한 방법을 설계했습니다. 그들은 도로 위의 모든 점과 자동차 상자의 모든 모서리가 서로에 대해 정확히 어디에 위치하는지 아는 공유 좌표계를 만들었습니다.

이전 방식에서 AI는 오직 형태만을 바탕으로 자동차의 위치를 추측하거나, 오직 카메라의 시야만을 바탕으로 도로를 구축하려 했을 수 있습니다. 이는 종종 '시간적 번짐(temporal smearing)' 현상을 야기했는데, 이는 시스템이 매 순간 위치에 대해 합의를 이루지 못해 움직이는 물체가 시간이 지남에 따라 녹아내리거나 늘어지는 것처럼 보이는 시각적 결함입니다. 이 시스템은 도로와 자동차를 함께 생성하도록 강제함으로써 이를 방지합니다. 도로는 AI에게 자동차가 얼마나 깊이 있는지 정확히 알려주고, 자동차는 AI에게 해당 지점의 도로가 물결치거나 끊어져서는 안 된다는 것을 알려줍니다. 이러한 상호 합의는 기하학적으로 정확하면서도 논리적으로 일관된 장면을 만들어냅니다.

연구진은 두 가지 주요 주행 데이터 집합, 즉 오스틴 시의 실제 세계 데이터셋과 시뮬레이션 환경을 사용하여 이 시스템을 테스트했습니다. 그들은 결과를 기존의 최상위 3D 매핑 및 객체 탐지 방법들과 비교했습니다. 새로운 시스템은 이들보다 뛰어난 성능을 보였습니다. 더 선명하고 상세한 도로 및 주변 환경 3D 지도를 생성했으며, 객체가 떨어져 있는 거리에 대한 오류도 적었습니다. 동시에, 전체 3D 지도에 접근할 수 없는 전용 탐지 시스템보다 더 높은 정밀도로 움직이는 객체를 식별하고 추적했습니다. 시스템은 자동차가 어디에 있는지에 대한 사전 레이블 정보 없이도, 주변 세계의 형태를 이해함으로써 자동차를 찾아내는 법을 배웠습니다.

가장 중요한 발견 중 하나는 이 통합된 접근 방식이 학습 과정에서 본 적 없는 데이터로 테스트했을 때도 작동한다는 점입니다. 연구진이 학습하지 않은 합성 주행 환경에 모델을 적용했을 때도, 시스템은 여전히 정확한 3D 지도를 생성하고 차량을 올바르게 식별해 냈습니다. 이는 시스템이 단순히 특정 패턴을 암기하는 것이 아니라, 주행 장면이 어떻게 구조화되어 있는지에 대한 근본적인 이해를 학습했음을 시사합니다. 단순한 비디오 피드로부터 완전하고 물리적으로 일관된 3D 세계를 생성하는 능력은 자율주행 차량이 환경을 인식하는 방식의 변화를 나타냅니다. 이는 인식을 단절된 단계들의 연속으로 취급하는 것에서 벗어나, 도로와 교통이 하나의 일관된 현실로서 이해되는 통합된 관점으로 나아가는 것입니다.

연구진은 현재 시스템이 오프라인 처리를 위해 설계되었음을 인정합니다. 즉, 장면을 생성하는 데 시간이 걸리며 아직 고속 주행 중인 자동차가 실시간으로 사용하기에는 속도가 충분하지 않습니다. 그러나 이 방식의 성공은 기하학적 구조와 객체 탐지를 하나의 생성 과정으로 결합하는 것이 두 기능을 분리하는 것보다 우수한 결과를 낸다는 것을 증명합니다. 3D 세계와 그 안의 객체들을 동일한 상태의 공진화하는 부분으로 취급함으로써, 시스템은 이전에는 도달하기 어려웠던 명확성과 안정성을 달 achieves 합니다. 이 연구는 자율주행 시스템이 세상을 단순히 픽셀의 집합이나 객체의 목록이 아니라, 모든 요소가 서로를 뒷받받하는 견고하고 항해 가능한 공간으로 인식하게 될 미래의 토대를 마련합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →