UrbanWorld2.0: A Multimodal Agentic Framework for Reality-Aligned 3D World Generation at City-Scale
이 논문은 반복적인 자기 성찰과 다양한 파운데이션 도구를 활용하여 기존 방식보다 우수한 현실 정렬성과 지각 품질을 갖춘 고충실도 도시 규모의 3D 환경을 생성하는 에이전트 기반 멀티모달 프레임워크인 UrbanWorld2.0을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
디지털 세계를 믿을 수 있게끔 구현하는 것은 오랫동안 영화 제작자, 게임 디자이너, 그리고 과학자들의 꿈이었습니다. 수십 년 동안 이러한 환경을 구축하는 과정은 인간의 손에 크게 의존해 왔습니다. 예술가들은 나무, 도로, 건물을 일일이 수동으로 배치해야 했으며, 이는 느리고 비용이 많이 드는 작업으로 가상 도시가 얼마나 커지거나 상세해질 수 있는지를 제한했습니다. 컴퓨터가 이미지를 생성하는 능력은 향상되었지만, 실제처럼 느껴지는 전체 도시를 만드는 것은 여전히 큰 난제로 남아 있습니다. 과제는 단순히 예쁜 그림을 그리는 것이 아닙니다. 레이아웃이 타당하고, 질감이 사실적이며, 로봇을 훈련시키거나 교통 상황을 시뮬레이션하는 데 유용할 만큼 규모가 방대한 공간을 구축하는 것입니다. 이를 해결하기 위해 연구자들은 컴퓨터 프로그램을 단순한 도구가 아니라 계획을 세우고, 자신의 작업을 점검하며, 실수로부터 배울 수 있는 지능적인 조수로 취급하는 새로운 접근 방식에 주목하고 있습니다.
칭화 대학교의 연구진은 실제 세계와 밀접하게 일치하는 고충실도 도시 규모 3D 환경을 자동으로 생성하도록 설계된 UrbanWorld2.0이라는 시스템을 선보였습니다. 불연속적인 그리드, 거친 질감, 또는 빈 공간에 떠 있는 건물들을 자주 만들어냈던 기존 방식들과 달리, 이 새로운 프레임워크는 몰입형 미디어와 로보틱스에서 즉시 사용 가능한 전체 도시 경관을 만들어냅니다. 이 시스템은 실제 데이터, 예를 들어 지도와 거리 뷰 사진으로부터 시작하여 단계별로 똑똑한 단계를 거쳐 기초부터 도시를 건설하는 디지털 건축가로서 작동합니다. 이 시스템은 단순히 도시가 어떻게 보여야 하는지 추측하는 것이 아니라, 정보를 수집하고, 누락된 세부 사항을 상상하며, 자신의 창작물을 비판하고, 그것이 정확하고 시각적으로 멋질 때까지 정교하게 다듬습니다.
과정은 시스템이 실제 세계로부터 원재료를 수집하는 것으로 시작됩니다. 시스템은 도로와 건물이 어디에 위치하는지 이해하기 위해 오픈 소스 지도에서 지리 데이터를 가져오고, 해당 건물들이 실제로 어떻게 생겼는지 보기 위해 파노라마 거리 뷰 이미지를 수집합니다. 그러나 이러한 원본 이미지에는 건물의 시야를 가리는 자동차, 나무 또는 건설 장비 등이 섞여 있을 수 있습니다. 시스템의 첫 번째 임무는 세심한 편집자로서 이러한 장애물들을 제거하고 건물의 가장 선명한 뷰를 선택하는 것입니다. 그다음에는 '상상'의 단계로 넘어가 빈틈을 채웁니다. 단일 거리 사진은 건물의 뒷면이나 윗면을 보여줄 수 없기 때문에, 시스템은 제한된 시각적 단서를 바탕으로 구조물의 부피와 건축 양식을 추론하여 건물의 완전한 3차원 형태를 정신적으로 재구성하는 고급 인공지 intelligence를 사용합니다.
시스템이 건물의 명확한 이미지를 갖추게 되면, 실제 3D 모델을 생성합니다. 여기서 프레임워크의 독특한 설계가 빛을 발합니다. 전체 도시를 한 번에 만드는 대신, 시스템은 조각조각 나누어 구축합니다. 각 건물의 형태를 만들고, 그 위에 고품질의 질감을 입힌 다음, 실제 세계의 정확한 위치에 배치합니다. 이 워크플로우의 핵심적인 부분은 내장된 '성찰' 메커니즘입니다. 건물을 생성한 후, 시스템은 스스로의 작업을 검토하는 엄격한 비평가 역할을 합니다. 구조가 물리적으로 가능한지, 질감이 현실적인지, 그리고 원래의 지침을 따르고 있는지 확인합니다. 만약 벽과 맞지 않는 창문이나 뒤틀린 지붕과 같은 오류를 발견하면, 시스템은 자동으로 오류를 수정하고 다시 시도합니다. 이러한 생성과 자기 수정의 순환은 결과물이 높은 품질 기준을 충족할 때까지 계속됩니다.
이러한 접근 방식의 결과는 놀랍습니다. 3D 도시 생성을 위한 다른 방법들과 비교했을 때, UrbanWorld2.0은 훨씬 더 사실적이고 일관된 장면을 만들어냈습니다. 직접적인 비교에서 시스템의 출력물은 기존 기술보다 86% 이상의 높은 비율로 선호되었습니다. 생성된 도시는 정밀한 형태와 세밀한 표면을 가진 건물들, 논리적으로 연결된 도로, 그리고 가로등이나 교통 표지판과 같은 미세한 요소들이 올바른 위치에 배치된 모습을 보여주었습니다. 또한 시스템은 시뮬레이션된 교통량과 움직이는 차량과 같은 동적인 요소들을 성공적으로 통합하여, 정적인 모델이 아닌 살아있는 환경을 만들어냈습니다. 이러한 수준의 세부 사항과 정확성은 이 시스템이 디지털 시뮬레이션과 물리적 세계 사이의 간극을 효과적으로 메울 수 있음을 시사하며, 이는 자율 주행 차량과 로봇이 복잡한 도시 환경을 탐색하도록 훈련시키는 데 필수적인 능력입니다.
실제 데이터와 다단계의 자기 수정 워크플로우를 결려함으로써, UrbanWorld2..0은 품질을 희생하지 않고도 대규모의 사실적인 3D 세계를 자동화하여 생성하는 것이 가능하다는 것을 보여줍니다. 이 시스템은 창의성을 제한하는 경직된 사전 프로그래밍 규칙에 의존하지 않으며, 구하기 어려운 방대한 양의 훈련 데이터에도 의존하지 않습니다. 대신, 참조 자료를 수집하고, 아이디어를 스케치하고, 작업을 검토하고, 개선을 수행하는 인간 디자이너의 접근 방식을 모방하는 유연하고 지능적인 프로세스를 활용합니다. 이 획기적인 성과는 전체 도시를 고정밀도로 시뮬레이션할 수 있는 디지털 트윈의 미래와, 기계가 우리와 똑같이 보이고 행동하는 환경에서 작동하는 법을 배우는 체화된 지능(embodied intelligence)의 발전을 위한 유망한 토대를 제공합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.