← 최신 논문
🤖 AI

Extend3D: Town-Scale 3D Generation

이 논문은 단일 이미지에서 도시에 준하는 규모의 3D 장면을 생성하기 위해, 객체 중심 생성 모델을 기반으로 잠재 공간을 확장하고 패치 기반 생성, 단안 깊이 추정 기반 초기화, '언-노이징 (under-noising)' 기법, 그리고 3D 인지 최적화를 결합한 학습이 불필요한 파이프라인인 Extend3D 를 제안합니다.

원저자: Seungwoo Yoon, Jinmo Kim, Jaesik Park

게시일 2026-04-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Seungwoo Yoon, Jinmo Kim, Jaesik Park

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

Extend3D: 한 장의 사진으로 거대한 3D 도시를 만드는 마법

이 논문은 Extend3D라는 새로운 기술을 소개합니다. 쉽게 말해, 단 한 장의 2D 사진만으로도 거대한 3D 도시나 풍경을 만들어내는 방법입니다. 기존에는 3D 모델을 만들려면 전문가가 수백 시간을 투자해 하나하나 조립해야 했지만, 이 기술은 그 과정을 자동화하고 훨씬 더 넓고 디테일한 장면을 만들어냅니다.

이 복잡한 기술을 일상적인 비유로 설명해 드릴게요.


1. 문제점: "작은 상자에 거대한 도시를 넣으려다"

기존의 3D 생성 AI 들은 마치 작은 선물 상자에 거대한 도시를 넣으려는 상황과 비슷했습니다.

  • 한정된 공간: AI 가 기억할 수 있는 공간 (잠재 공간, Latent Space) 이 고정되어 있어서, 도시가 커지면 모든 건물이 흐릿하게 뭉개지거나 저화질로 변해버렸습니다.
  • 물건 중심의 사고: 기존 AI 는 '의자', '자동차' 같은 개별 물건을 만드는 데는 능숙했지만, 여러 물건이 모여 복잡한 도시 풍경을 만드는 데는 서툴렀습니다.

2. 해결책 1: "퍼즐 조각을 겹쳐서 맞추기" (Overlapping Patch-wise Flow)

Extend3D 는 이 문제를 해결하기 위해 거대한 캔버스를 여러 개의 작은 조각 (패치) 으로 나누고, 그 조각들을 서로 겹치게 만드는 전략을 썼습니다.

  • 비유: 거대한 벽화를 그릴 때, 한 사람이 한 번에 다 그리면 실수가 많고 균일하지 않습니다. 대신 여러 명의 화가에게 작은 사각형 영역을 나누어 주고, 이웃한 영역이 서로 10cm 씩 겹치게 (Overlap) 맡깁니다.
  • 효과: 겹치는 부분에서 화가들이 서로의 그림을 보고 "여기 나무가 이어져야 해"라고 자연스럽게 조율합니다. 덕분에 전체적인 그림이 끊어지지 않고 매끄럽게 연결됩니다. Extend3D 도 이렇게 여러 조각을 동시에 만들어내며 서로의 정보를 공유하게 합니다.

3. 해결책 2: "초기 뼈대를 먼저 세우기" (Initialization with Prior)

그런데 조각을 나누는 것만으로는 부족했습니다. AI 가 처음부터 아무것도 없는 상태에서 그림을 그리면, 건물이 공중에 떠 있거나 바닥이 사라지는 등 엉망이 될 수 있습니다.

  • 비유: 건물을 지을 때 땅이 어디인지, 기둥이 어디에 서야 하는지 모르면 무너집니다. Extend3D 는 단순한 깊이 감지 카메라 (Depth Estimator) 를 이용해 사진 속의 '뼈대' (점 구름, Point Cloud) 를 먼저 뽑아냅니다.
  • 효과: AI 는 이제 "아, 여기는 땅이 있고, 여기는 건물이 있어야 하는구나"라는 뼈대를 보고 작업을 시작합니다. 이렇게 하면 바닥이 사라지거나 물체가 공중에 떠 있는 기이한 현상을 막을 수 있습니다.

4. 해결책 3: "보이지 않는 부분을 상상해서 채우기" (Under-noising & SDEdit)

깊이 카메라는 가려진 부분 (예: 건물 뒤에 숨은 나무) 을 볼 수 없습니다. 이 빈 공간을 어떻게 채울까요?

  • 비유: 반쪽짜리 퍼즐을 보고 나머지를 상상해 채우는 과정입니다. 하지만 단순히 빈곳을 채우는 게 아니라, AI 가 "이 부분은 원래 있었을 텐데 가려진 거야"라고 생각하게 만드는 특별한 기술을 썼습니다.
  • Under-noising (덜 노이즈): 보통 AI 는 이미지에 노이즈를 섞었다가 다시 제거하며 그림을 그립니다. Extend3D 는 이미지 (뼈대) 에 노이즈를 아주 조금만 섞어서, AI 가 "이건 원래 다 있었을 텐데 일부러 지워진 거야"라고 착각하게 만듭니다.
  • 결과: AI 는 가려진 부분을 자연스럽게 상상해서 채워 넣습니다. 마치 흐릿한 사진을 선명하게 복원하듯, 보이지 않는 도시의 뒷면까지 완성해 줍니다.

5. 해결책 4: " constantly 수정하며 다듬기" (3D-aware Optimization)

그림을 그리는 도중에도 AI 가 원래 의도 (사진) 에서 벗어나면 안 됩니다.

  • 비유: 건축가가 건물을 지을 때, 매 단계마다 설계도 (원래 사진) 와 비교하며 "이 벽이 너무 기울었네, 고쳐야겠다"라고 수정하는 과정입니다.
  • 효과: Extend3D 는 AI 가 그림을 그리는 매 순간마다 원래 사진과 깊이 정보를 다시 한번 확인하며, 건물의 형태가 왜곡되지 않도록 지속적으로 수정합니다.

요약: 왜 이것이 중요한가요?

Extend3D 는 한 장의 사진 (예: 바티칸 시가나 한 도시의 전경) 을 넣으면, AI 가 그 사진을 3D 로 확장하여 우리가 그 도시를 돌아다니거나 구경할 수 있게 해줍니다.

  • 기존 기술: 작은 공간만 만들거나, 조각난 퍼즐처럼 이어지지 않는 결과.
  • Extend3D: 퍼즐 조각을 겹쳐서 매끄럽게 만들고, 뼈대를 먼저 세운 뒤, 가려진 부분을 상상해서 채우고, 계속 다듬어 완성도 높은 거대한 3D 도시를 만들어냅니다.

이 기술은 게임 개발, 영화 제작, 가상 현실 (VR) 등에서 실제와 구별하기 힘든 거대한 3D 장면을 쉽고 빠르게 만들어낼 수 있는 가능성을 열어주었습니다. 마치 한 장의 사진에서 무한한 3D 세계를 열어젖히는 마법 같은 기술이라고 할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →