← 최신 논문
💻 computer science

WorldRover: A Scalable Synthetic Video Data Engine for World Exploration with Rich Annotations

본 논문은 아티스트가 구축한 환경으로부터 장거리의 풍부하게 주석이 달린 합성 비디오 시퀀스를 생성하여, 일관된 세계 탐사 및 재구성을 위한 모델 학습용으로 동기화된 RGB, 미터법 기반 깊이(metric depth), 카메라 궤적 및 다양한 시점 데이터를 제공하는 언리얼 엔진 기반의 확장 가능한 데이터 엔진인 WorldRover를 소개한다.

원저자: Xiaojie Xu, Zhengyuan Lin, Runyi Li, Yihao Liu, Kaipeng Zhang, Yongtao Ge

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xiaojie Xu, Zhengyuan Lin, Runyi Li, Yihao Liu, Kaipeng Zhang, Yongtao Ge

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

기계가 세상을 탐색하는 법을 어떻게 배울 수 있는지 이해하려면, 먼저 그 세상을 본다는 것이 무엇을 의미하는지 이해해야 합니다. 컴퓨터가 공간을 이동하기 위해서는 단순히 눈앞에 있는 모습의 사진 이상의 것이 필요합니다. 물체가 얼마나 멀리 떨어져 있는지, 카메라 자체가 어떻게 움직이고 있는지, 그리고 사물들이 서로의 뒤로 지나갈 때 그 형태가 어떻게 변하는지를 알아야 합니다. 현실 세계에서 이 모든 정보를 한꺼번에 포착하는 것은 매우 어렵습니다. 카메라는 영상을 기록할 수는 있지만, 나무까지의 정확한 거리가 얼마인지, 혹은 카메라를 들고 있는 사람이 걸은 정확한 경로가 무엇인지를 자동으로 알려주지는 못합니다. 과학자들은 종종 사후에 이러한 세부 사항들을 추측해야 하며, 특히 물체가 시야를 가릴 때 그러한 추측은 틀릴 수 있습니다. 완벽한 기하학적 구조와 움직임에 대한 지식 없이는, 컴퓨터가 탐험하고 다시 돌아올 수 있는 안정적이고 일관된 장소의 정신적 지도를 구축하도록 가르치기가 어렵습니다.

이것이 바로 Alaya Lab, 도쿄 대학교, 그리고 상하이 혁신 연구소의 연구팀이 '월드로버(WorldRover)'라고 불리는 새로운 시스템으로 해결하고자 했던 과제입니다. 이들은 무질서한 실제 영상에서 완벽한 데이터를 추출하려고 노력하는 대신, 처음부터 데이터를 생성하는 기계를 만들었습니다. 이들은 예술가들이 만든 가상 환경을 가져와 그 안에서 카메라를 아주 미세한 단위의 긴 여정으로 보내는 파이프라인을 구축했습니다. 핵심적인 혁신은 이 시스템이 단순히 영상을 녹화하는 것에 그치지 않고, 여정의 전체 역사를 동시에 기록한다는 점입니다. 카메라가 이동함에 따라, 시스템은 카메라가 이동한 정확한 경로, 모든 지점까지의 정밀한 거리, 그리고 이미지 속의 한 픽셀이 이전 프레임의 픽셀과 어떻게 연관되는지를 포착합니다. 세계가 합성된 것이기 때문에, 연구자들은 모든 프레임의 진실을 알고 있습니다. 그들은 카메라가 정확히 어디에 있었는지, 빛이 벽에 어떻게 부딪혔는지, 그리고 모든 물체가 3차원 공간의 어디에 위치해 있는지를 정확히 알고 있습니다.

이 노력의 결과물은 '월드로버-10M(WorldRover-10M)'이라는 거대한 데이터 모음입니다. 여기에는 도시 거리, 지하철역, 숲, 성당에 이르기까지 32개의 서로 다른 가상 환경에서 추출된 6,000개 이상의 독특한 비디오 시퀀스가 포함되어 있습니다. 총합으로 보면 2,100만 프레임 이상의 영상을 보유하고 있으며, 이는 200시간 이상의 분량에 달합니다. 이 컬렉션을 특별하게 만드는 것은 동일한 여정을 세 가지 다른 관점에서 제공한다는 점입니다. 즉, 세상을 걸어 다니는 듯한 1인칭 시점, 캐릭터를 뒤에서 따라가는 3인칭 시점, 그리고 관찰자 주변의 모든 것을 포착하는 360도 파노라마 뷰입니다. 모든 단일 프레임에 대해 시스템은 일치하는 라벨 세트를 제공합니다. 여기에는 장면의 정확한 깊이를 나타내는 지도, 카메라가 어떻게 움직였는지에 대한 기록, 그리고 이미지의 지점들이 한 순간에서 다음 순간으로 어떻게 이동하는지에 대한 조밀한 추적 정보가 포함됩니다.

연구자들은 특정한 문제를 해결하기 위해 이 엔진을 설계했습니다. 그것은 바로 시각적 변화의 원인이 결코 혼동되지 않는 데이터가 필요하다는 점입니다. 일반적인 영상에서는 픽셀이 움직인 이유가 물체가 움직였기 때문인지 아니면 카메라가 회전했기 때문인지 구별하기 어렵습니다. 월드로버에서 연구자들은 동일한 경로를 다양한 조건 하에서 재현할 수 있습니다. 그들은 밝은 낮의 도시를 걷는 동일한 경로를 안개가 자욱한 날로, 혹은 질감은 사라지고 형태만 남은 중립적인 흰색 모델로 보여줄 수 있습니다. 경로와 기하학적 구조는 동일하게 유지되면서 외형만 변하기 때문에, 이 데이터로부터 학습하는 컴퓨터는 세상의 구조와 그것이 보이는 방식을 분리하여 학습할 수 있습니다. 이러한 분리는 세상을 깊이 이해하여 이를 탐색하거나 3차원으로 재구성해야 하는 모델을 훈련하는 데 필수적입니다.

이를 구축하기 위해 팀은 일반적으로 비디오 게임을 만드는 데 사용되는 도구인 강력한 게임 엔진을 사용했지만, 이를 과학적 데이터 생성을 위해 재용도화했습니다. 그들은 예술가들이 만든 32개의 독특한 환경을 준비했으며, 이 환경들이 실제 장소처럼 세부 사항과 복잡함이 풍부하도록 보장했습니다. 그런 다음 이 공간들을 통과하는 세 가지 다른 이동 방식을 프로그래밍했습니다. 한 방법은 효율적인 경로를 계획하기 위해 미리 계산된 보행 가능한 경로 지도를 사용했습니다. 다른 하나는 움직이면서 장애물을 감지하는 반응형 에이전트를 사용했는데, 이는 마치 새로운 방을 탐색하는 사람처럼 때로는 방황하거나 막히기도 했습니다. 세 번째 방법은 인간이 수동으로 경로를 기록하는 방식이었습니다. 이러한 경로들은 오프라인으로 렌더링되었습니다. 즉, 컴퓨터가 실시간 이미지를 빠르게 만들어내는 대신, 시간적 여유를 가지고 모든 빛의 광선과 그림자를 높은 정밀도로 계산했다는 의미입니다. 이 과정을 통해 그들은 시간이 흐름에 따라 빛이 어떻게 변하는지 또는 날씨가 변함에 따라 빛이 어떻게 달라지는지와 같이 물리적으로 정확한 데이터를 생성할 수 있었습니다.

이 데이터셋은 다양한 과제에 맞춤화된 특정 하위 집합들을 포함합니다. 3인칭 시퀀스는 캐릭터가 카메라와 독립적으로 움직인다는 점 때문에 특히 가치가 높습니다. 이를 통해 연구자들은 기계가 관찰자의 움직임과 세상 속 물체의 움직임을 어떻게 구별할 수 있는지 연구할 수 있습니다. 시스템 또한 캐릭터와 배경 위의 지점들을 장기간 추적하며, 심지어 그 지점들이 벽이나 다른 물체 뒤에 숨겨져 있을 때도 추적합니다. 데이터는 어떤 지점이 보일 때뿐만 아니라, 만약 여전히 보인다면 그 지점이 어디에 있을 것인지에 대한 개념, 즉 '아모달 트래킹(amodal tracking)'을 컴퓨터에게 알려줍니다. 이는 건물 뒤에 있는 자동차가 보이지 않더라도 여전히 존재하며 특정한 위치를 가지고 있다는 것을 이해하는 데 매우 중요합니다.

월드로버-10M은 단순한 영상 모음이 아닙니다. 모든 정보가 캡처된 정확한 순간과 연결된 구조화된 라이브러리입니다. 깊이 지도는 미터 단위로 측정되며, 광학 흐름(optical flow)은 정밀한 단위로 픽셀의 움직임을 기록하고, 카메라 경로는 높은 충실도로 기록됩니다. 연구팀은 연구자들이 추측하거나 추정할 필요 없이 원시 정보에 쉽게 접근할 수 있는 형식으로 이 데이터를 공개했습니다. 그들은 이 데이터를 대중에게 공개하여, 다른 이들이 탐색 가능한 세상을 이해하고, 탐색하며, 재구성할 수 있는 모델을 구축할 수 있는 토대를 제공했습니다. 세상 탐색의 문제를 확장 가능한 데이터 생성 과제로 전환함으로써, 연구자들은 인공지능 분야에 새로운 도구를 제공했으며, 이는 실제 세계의 녹화만으로는 달성할 수 없는 명확성과 통제력을 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →