← 최신 논문
💻 computer science

GeoWAM: Visual Geometry World Action Models for Autonomous Driving

이 논문은 픽셀 기반의 미래 예측을 대신하여 공간 구조와 움직임을 더 잘 포착할 수 있는 포인트 클라우드를 이용한 미래 기하학적 예측을 도입함으로써, 이미지 기반 대안들보다 훨씬 더 강력한 주행 정책을 이끌어내는 자율 주행을 위한 월드 액션 모델인 GeoWAM을 소개한다.

원저자: Yiren Lu, Xin Ye, Jiaming Liu, Jin Yao, Yi-chung Chen, Liam Merino, Dhruva Dixith Kurra, Min Cai, Tom Lampo, Yu Yin, Danhua Guo, Burhan Yaman

게시일 2026-08-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yiren Lu, Xin Ye, Jiaming Liu, Jin Yao, Yi-chung Chen, Liam Merino, Dhruva Dixith Kurra, Min Cai, Tom Lampo, Yu Yin, Danhua Guo, Burhan Yaman

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

자율 주행은 근본적으로 예측의 게임입니다. 안전하게 주행하기 위해서 차량은 단순히 눈앞의 도로를 보는 것 이상의 것을 해야 합니다. 즉, 그 도로와 그 위의 객체들이 몇 초 후에 어떻게 변할지를 이해해야 합니다. 보행자가 어디로 발을 내디딜지, 앞차는 어떻게 속도를 줄일지, 그리고 자신의 경로가 환경 속에서 어떻게 변화할지를 예측해야 합니다. 수년 동안 연구자들은 컴퓨터에게 끝없는 비디오 스트림을 보여줌으로써 이 기술을 가르치려 노력해 왔으며, 기계가 영화의 다음 프레임을 추측하는 법을 배우기를 기대했습니다. '월드 모델(world models)'이라 불리는 이러한 시스템은 미래를 시뮬레이션할 수 있다는 점에서 강력하지만, 종종 특정한 결함으로 인해 어려움을 겪습니다. 바로 세상을 평면적인 그림으로 본다는 점입니다. 이들은 색상, 질감, 조명에 집중하며, 이는 객체의 진정한 3차원 형태와 움직임을 가릴 수 있습니다. 컴퓨터가 단지 변화하는 픽셀만을 바탕으로 차가 어떻게 회전하고 있는지 파악하려고 노력하는 것은, 벽에 비친 그림자를 보고 시계의 기계적 구조를 이해하려는 것과 같습니다. 정보는 존재하지만, 그것은 간접적이며 풀어내기 어렵습니다.

Uber AV Labs와 케이스 웨스턴 리저브 대학교(Case Western Reserve University)의 연구팀은 이와 다른 접근 방식을 제안했습니다. 이는 평면적인 그림을 완전히 건너뛰고 세상의 형태를 직접 들여다보는 방식입니다. 그들은 GeoWAM이라는 새로운 시스템을 도입했는데, 이는 주행 환경을 예측해야 할 비디오가 아니라 시간이 흐름에 따라 변형되고 이동하는 3D 점들의 집합으로 취급합니다. 거리의 사실적인 미래 이미지를 생성하는 대신, 이 시스템은 그 거리의 기하학적 구조, 즉 모든 연석, 나무, 차량의 정밀한 3차원 공간 위치를 예측하도록 훈련됩니다. 연구진은 이러한 공간적 구조에 집중함으로써 자율 주행 차량이 세상이 어떻게 진화하는지에 대해 훨씬 더 명확한 이해를 가질 수 있음을 발견했습니다. 이들의 연구는 주행 에이전트가 시각적 외형이 아닌 물리적 형태의 미래를 예측하는 법을 배울 때, 더 안전하고 매끄러운 궤적을 계획하는 능력이 현저히 향상된다는 것을 시사합니다.

이 새로운 방법의 핵심 아이디어는 픽셀이 움직임을 설명하기에는 부적절한 언어라는 점입니다. 표준 비디오 월드 모델은 한 순간에서 다음 순간으로 빛과 색상이 어떻게 변할지를 예측하는 법을 배웁니다. 이는 시각적으로 설득력 있는 결과를 만들어낼 수는 있지만, 실제 물리적 움직임—예를 들어 바퀴의 실제 회전이나 공간 속 자동차의 이동—은 변화하는 색상 속에 숨겨져 있게 됩니다. 새로운 시스템인 GeoWAM은 포인트 클라우드(point clouds)를 직접 다룸으로써 이러한 혼란을 우회합니다. 수백만 개의 작은 점들로 이루어진 3D 지도를 상상해 보십시오. 각 점은 자동차, 건물 또는 도로의 특정 지점을 나타냅니다. 이 시스템은 차량 카메라로부터 얻은 일련의 과거 뷰를 가져와 그 점들이 미래에 어디에 있을지를 학습합니다. 이 시스템은 차가 빨간색인지 혹은 햇빛이 비치는지에는 관심이 없습니다. 오직 차가 어디에 있으며 공간 속에서 어떻게 움직이고 있는지에만 관심을 가집 니다. 이러한 직접적인 표현 방식은 3차원 세계를 항해하는 것이 본질적인 과제인 주행 작업과 완벽하게 일치합니다.

이러한 능력을 구축하기 위해 연구진은 시스템을 두 단계로 나누어 훈련시켰습니다. 첫째, 그들은 모델에게 '기하학자'가 되는 법을 가르쳤습니다. 여러 카메라에서 얻은 방대한 주행 데이터를 사용하여, 시스템은 과거 장면의 시퀀스를 보고 몇 초 후의 3D 구조를 정확하게 예측하는 법을 배웠습니다. 시스템은 하늘의 모습이나 아스팔트의 질감을 재현하라는 요청을 받지 않았으며, 오직 객체들의 위치를 지도화하는 데 집중했습니다. 시스템이 미래의 형태를 예측하는 능력을 마스터하자, 연구진은 두 번째 단계인 '액션 플래너(action planner)'를 추가했습니다. 이 새로운 구성 요소는 예측된 3D 지도를 가져와 다음과 같은 단순한 질문을 던집 만듭니다. "세상이 어떻게 변할 것인지 주어진다면, 차는 다음에 무엇을 해야 하는가?" 시스템은 이미 3차원 움직임의 관점에서 생각하고 있기 때문에, 그 답은 자연스럽게 도출됩니다. 시스템은 진화하는 기하학적 구조로부터 자동차의 미래 움직임을 직접 추론하며, 비디오의 시각적 패턴이 아닌 도로의 물리적 실체에 기반한 계획을 생성합니다.

이 접근 방식의 결과는 표준 주행 벤치마크를 통해 엄격하게 테스트되었습니다. 장면의 미래 형태를 예측하도록 요청받았을 때, 이 새로운 시스템은 비디오 생성을 활용하는 기존 방식들을 능가했습니다. 시간 지평이 더 먼 미래로 확장되더라도 객체를 올바른 3D 공간에 배치하는 데 있어 더 정확했습니다. 더 중요한 것은, 이 기하학적 예견이 시뮬레이션 환경에서 차량을 제어하는 데 사용되었을 때 주행 성능이 크게 향상되었다는 점입니다. 시스템이 환경과 상호작용하지 않고 경로를 계획하는 오픈 루프(open-loop) 테스트와, 실시간으로 자신의 실수를 인지하고 반응해야 하는 클로즈드 루프(closed-loop) 테스트 모두에서, GeoWAM은 이미지 기반 모델들보다 일관되게 더 안전하고 신뢰할 수 있는 궤적을 생성했습니다. 이 시스템은 특히 실제 공간 배치를 이해하는 것이 결정적인 역할을 하는 급커브 주행이나 장애물 회피와 같은 복잡한 시나리오에서 탁월한 강점을 보여주었습니다.

연구진은 시각적 예측에서 기하학적 예측으로의 이러한 전환이 기계가 주행에 대해 배우는 데 더 자연스러운 방식이라고 주장합니다. 외형이라는 방해 요소를 제거하고 구조에 집중함으로써, 시스템은 움직임의 규칙을 더욱 직접적으로 학습합니다. 시스템은 젖은 도로에 빛이 어떻게 반사될지를 추측할 필요 없이, 차가 미끄러지는 것을 알기 위해 단순히 차의 위치가 미끄러짐을 나타내는 방식으로 변하는 것을 봅니다. 이러한 명확성은 차량이 견고하고 일관된 결정을 내릴 수 있게 합니다. 이 연구는 비디오 생성이 많은 작업에 강력한 도구일 수는 있지만, 자율 주행을 위한 이상적인 기초는 아니라는 점을 확인시켜 줍니다. 대신, 세상을 역동적인 3차원 구조로 이해하는 모델이 실제 세계를 항해하는 데 더 적합하며, 진정한 자율 주행 차량 개발을 향한 유망한 길을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →