← 최신 논문
💻 computer science

MeSS: City Mesh-Guided Outdoor Scene Generation with Cross-View Consistent Diffusion

이 논문은 도시 메쉬 모델을 기하학적 사전 정보로 활용하고 교차 뷰 일관성 모듈을 갖춘 다단계 이미지 확산 파이프라인을 채택하여 가상 내비게이션 및 자율 주행을 위한 고품질의 스타일 일관된 실외 장면을 생성하는 새로운 프레임워크인 MeSS를 소개한다.

원저자: Xuyang Chen, Zhijun Zhai, Kaixuan Zhou, Zengmao Wang, Jianan He, Dong Wang, Yanfeng Zhang, mingwei Sun, Rüdiger Westermann, Konrad Schindler, Liqiu Meng

게시일 2026-08-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xuyang Chen, Zhijun Zhai, Kaixuan Zhou, Zengmao Wang, Jianan He, Dong Wang, Yanfeng Zhang, mingwei Sun, Rüdiger Westermann, Konrad Schindler, Liqiu Meng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 실제 도시의 완벽하고 걸어 다닐 수 있는 디지털 트윈을 구축하려고 한다고 상상해 보십시오. 당신은 모든 건물, 도로, 나무의 3D 형태가 담긴 청사진을 가지고 있지만, 이들은 모두 평범하고 지루한 회색으로 칠해져 있습니다. 마치 페인트칠을 기다리는 점토 모델처럼 보입니다. 이것이 바로 '메쉬 모델(mesh models)'의 세계인데, 이는 도시를 구현하는 데 흔히 사용되지만, 도시를 살아 숨 쉬게 만드는 사실적인 질감(벽돌, 유리, 그래피티 등)이 결여되어 있습니다. 이러한 질감이 없다면, 가상 현실 투어를 하거나 자율주행 자동차를 훈련시키는 데 사용할 수 없습니다. 왜냐하면 이러한 시스템은 단순히 형상의 집합체가 아니라 세상이 실제로 어떻게 보이는지를 보아야 하기 때문입니다.

이를 해결하기 위해 과학자들은 '생성형 AI', 구체적으로는 '확산 모델(diffusion model)'이라 불리는 유형의 모델을 사용하는 방법을 시도해 왔습니다. 이 모델들을 간단한 설명으로부터 그림을 그려내는 매우 재능 있는 화가라고 생각해 보십시오. 하지만 이 화가들에게 도시의 거리 전체를 따라 걸으며 그려달라고 요청하면, 그들은 종-종 혼란에 빠지곤 합니다. 어떤 프레임에서는 건물 왼쪽에 문을 그렸다가, 다음 프레임에서는 갑자기 오른쪽으로 문을 옮겨 그리거나, 이동함에 따라 하늘의 색을 바꿔버리기도 합니다. 이를 '드리프트(drift, 표류)' 현상이라고 합니다. 또 다른 큰 문제는 이 화가들이 청사진을 완전히 무시한다는 점입니다. 건물이 공중에 떠 있게 그리거나 실제 도시의 모양과 일치하지 않게 그리기도 합니다. 따라서 목표는 AI 화가에게 실제처럼 보이고, 이동할 때 일관성을 유지하며, 건물의 3D 형태에 완벽하게 밀착하여 도시를 그리도록 가르치는 것입니다.

여기에 등장한 것이 바로 화웨이(Huawei), 뮌헨 공과대학교(Technical University of Munich) 등의 연구진이 개발한 새로운 방법론인 MeSS(Mesh-Guided Scene Synthesis)입니다. MeSS를 단순히 그림을 그리는 것이 아니라, 당신이 실제로 걸어 다닐 수 있는 3D 세계를 구축하는 똑똑한 건설 팀이라고 생각하십시오. MeSS는 건물이 어디에 있는지 추측하는 대신, 도시의 '뼈대'인 질감이 없는 메쉬 모델을 시작점으로 삼아 이를 엄격한 가이드로 사용합니다.

MeSS의 핵심 비결은 저자들이 '제어-분포 일치(control-distribution match)'라고 부르는 개념입니다. 당신이 로봇에게 그림 그리는 법을 가르치고 있다고 상상해 보십시오. 만약 로봇을 실제 도시의 사진들로 훈련시킨다면, 로봇은 실제 카메라가 세상을 어떻게 보는지에 기반하여 그림을 그리는 법을 배울 것입니다. 하지만 만약 당신이 컴퓨터로 생성된 3D 모델을 바탕으로 그림을 그리라고 요청한다면, '깊이(depth)'나 '그림자'가 다르게 보이기 때문에 로봇은 혼란을 느낄 것입니다. MeSS는 '컨트롤넷(ControlNet, 로봇의 지침서)'을 도시 메쉬의 컴퓨터 생성 깊이 및 형태에 직접 맞춰 훈련함으로써 이 문제를 해결합니다. 이는 로봇이 3D 청사진의 특정 언어를 읽는 전문가가 되었음을 의미합니다. 그림을 그리기 시작할 때, 로봇은 추측하지 않습니다. 왜냐하면 그것이 사용하고 있는 데이터와 정확히 일치하는 방식으로 훈련되었기 때문에 벽과 창문이 정확히 어디에 있어야 하는지 알고 있기 때문입니다.

도시를 따라 긴 거리를 이동할 때 일관성을 유지하기 위해(이 '드리프트' 문제를 피하기 위해), MeSS는 영리한 2단계 프로세스를 사용합니다. 먼저, 마치 거리의 중요한 스냅샷을 매 20미터마다 찍는 숙련된 화가처럼 행동합니다. 스타일이 변하지 않도록 이전의 그림을 참조 자료로 사용하여 스냅샷을 하나씩 그려 나갑니다. 그런 다음, '외관 유도 인페인팅(Appearance Guided Inpainting)'이라는 기술을 사용하여 스냅샷 사이의 간극을 채웁니다. 당신이 거리 모퉁이의 흐릿한 사진을 가지고 있다고 상상해 보십시오. 이 도구는 사진의 흐릿한 부분 주변에 있는 선명하고 깨끗한 부분들을 살펴보고, 그 부분을 이용해 흐릿한 곳을 수정하여 질감(예: 벽돌 벽의 패턴)이 완벽하게 일치하도록 만듭니다.

마지막으로, 팀은 '전역 일관성 정렬(Global Consistency Alignment)' 단계를 추가합니다. 때때는 훌륭한 계획이 있더라도, 한 거리의 부분이 다음 부분보다 약간 더 밝거나 어둡게 보일 수 있는데, 이는 마치 조각조각 편집된 사진과 같습니다. 이 단계는 영화 스튜디오의 색 보정 전문가(colorist)처럼 작동하여, 그 차이들을 매끄럽게 다듬어 전체 여정이 하나의 연속적이고 매끄러운 영상처럼 느껴지도록 만듭니다.

결과는 인상적입니다. 200미터 길이의 거대한 도시 경로를 이용한 테스트에서, MeSS는 기존의 가장 뛰어난 방법들과 비교했을 때 시각적 불일치를 31% 줄였으며 생성된 이미지의 전반적인 품질을 크게 향상시켰습니다. 무엇보다도 흥ink로운 점은, 연구진이 AI를 재학습시키지 않고도 실제 뮌헨의 도시 모델(LoD3 메쉬)에 MeSS를 테스트했다는 것입니다. 시스템은 실제 건물의 문과 창문에 완벽하게 정렬된 사실적인 파사드(facade)를 성공적으로 그려냈으며, 이는 이 '메쉬 가이드 방식'이 컴퓨터 시뮬레이션뿐만 아니라 실제 도시에서도 작동함을 입증했습니다.

요약하자면, MeSS는 AI 화가에게 적절한 청사진을 주고 그것을 읽는 법을 가르친다면, 아름다울 뿐만 아니라 기하학적으로 완벽하고 일관된 가상 도시를 구축할 수 있음을 보여줍니다. 이는 더 나은 가상 투어와 더 안전한 자율주행 자동차 훈련을 위한 문을 열어줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →