← 최신 논문
💻 computer science

ABot-3DWorld 0: A Universal World Model to Explore Any 3D Space

이 논문은 텍스트, 이미지, 비디오를 공간 생성 프리미티브(Spatial Generative Primitive)로 통합하여 이를 고충실도의 탐색 가능한 3D 환경으로 변환하고, 3D 일관성을 가진 파노라마 비디오를 생성한 뒤 이를 실사 수준의 3D 가우시안 스플래팅(Gaussian Splatting) 장면으로 재구성하는 범용 멀티모달 3D 월드 모델인 ABot-3DWorld를 소개한다.

원저자: Mingchao Sun, Luyang Tang, Yu Liu, Xu Yan, Zhan Li, Yunwei Zhang, Fei Yu, Zengye Ge, Yumin Liu, Jiacheng Zhang, Yongchang Zhang, Jiawei Zhang, Zhicheng Liu, Zhongxu Sun, Tianjian Ouyang, Wenzheng Chen
게시일 2026-07-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mingchao Sun, Luyang Tang, Yu Liu, Xu Yan, Zhan Li, Yunwei Zhang, Fei Yu, Zengye Ge, Yumin Liu, Jiacheng Zhang, Yongchang Zhang, Jiawei Zhang, Zhicheng Liu, Zhongxu Sun, Tianjian Ouyang, Wenzheng Chen, Shixing Yang, Nianfei Fan, Guodong Sun, Huan Li, Zheng Zhou, Yongze Li, Yingliang Peng, Mengmeng Du, Yuan Liu, Haozhe Shi, Chunnuo Gong, Chengzhen Yu, Chunxue Jia, Yang Liu, Shiying Zeng, Junnan Lai, Hang Zhang, Ning Guo, Baoquan Chen, Mu Xu, Hongyu Pan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 한 문장의 문장, 짧은 셀카, 혹은 휴대폰으로 찍은 흔들리는 영상을 넣으면, 당신이 걸어 다닐 수 있는 완전히 탐험 가능한 3D 세계로 바꿔주는 마법 같은 카메라를 가지고 있다고 상상해 보세요. 그것이 바로 알리바바(Alibaba)의 AMAP CV Lab 팀이 ABot-3DWorld 0를 통해 구축한 기술입니다. 이것을 현실을 위한 "만능 번역기"라고 생각하세요. 당신이 텍스트, 사진 한 장, 혹은 여러 개의 영상 등 무엇을 던져주든, 시스템은 그것을 고해상도의 탐색 가능한 3D 유니버스로 뱉어냅니다.

이 디지털 마법이 어떻게 작동하는지, 가장 멋진 부분들을 나누어 설명해 드리겠습니다.

핵심 비결: "공간 생성 프리미티브(Spatial Generative Primitive, SGP)"

대부분의 3D 제작자들은 레고 블록을 쌓는 것처럼 세계를 조각조각 만들어 나가려 합니다. 하지만 이 시스템은 **공간 생성 프리미티브(SGP)**라는 더 똑똑한 지름길을 사용합니다. SGP를 다음과 같은 두 가지 요소를 포함하는 "마법의 스냅샷"이라고 상상해 보세요:

  1. 360도 파노라마 (당신을 중심으로 모든 방향을 감싸는 사진).
  2. 그 사진 속 모든 것의 형태와 거리를 매핑하는 포인트 클라우드(점구름).

이 작은 패키지는 세상의 "DNA"입니다. 당신이 "아늑한 오두막" 같은 텍스트 프롬프트를 입력하든, 실제 거리의 영상을 입력하든, 시스템은 먼저 이를 SGP로 변환합니다. 풍부한 영상을 제공하면, 시스템은 추측하지 않고 정밀하게 실제 기하학적 구조를 측정하여 SGP를 구축합니다. 만약 단 한 문장만 제공한다면, 시스템은 빈 공간을 창의적으로 채워 넣어 처음부터 SGP를 만들어냅니다.

여정: 걷기 계획하기

시스템이 SGP를 갖추고 나면, 이제 그것을 어떻게 탐험할지 결정해야 합니다. 단순히 카메라를 원형으로 돌리는 대신, "에이전트"(스마트한 디지털 플래너)가 포인트 클라우드를 살펴보고 이렇게 묻습니다: "어디로 걸어갈 수 있을까? 무엇이 흥미로워 보이지?"
에이전트는 다음 세 가지를 동시에 수행하는 경로를 계획합니다:

  • 모든 곳 커버하기: 구석진 곳이나 숨겨진 문을 놓치지 않도록 합니다.
  • 멋진 것 찾기: 흥미로운 대상(예: 멋진 간판이나 나무)을 포착하고 그곳으로 줌인합니다.
  • 안정성 유지하기: 최종 영상이 떨려 보이지 않도록 경로를 매끄럽게 유지합니다.

마법 쇼: 영상 만들기

이제 본격적인 작업이 시작됩니다. 시스템은 계획된 경로를 바탕으로, 마치 카메라가 그 경로를 따라 실제로 날아가는 것처럼 360도 파노라마 영상을 생성합니다.

  • 문제점: 일반적인 영상 생성기는 프레임 단위로는 훌륭해 보일지 몰라도, 머리를 움직이면 형태가 무너지는(옆에서 보면 이상하게 보이는 평면 그림 같은) 3D 세계를 만드는 경우가 많습니다.
  • 해결책: 저자들은 **3D 강화 학습(3DRL)**이라는 특별한 기법을 사용하여 영상 생성기를 훈련시켰습니다. 이를 "현실 점검" 코치라고 생각하세요. 코치는 영상을 지켜보며 이렇게 말합니다. "이봐, 카메라를 이렇게 움직이면 저 건물은 젤리처럼 일그러지면 안 돼." 이러한 피드백을 통해 학습함으로써, 시스템은 카메라가 움직여도 기하학적 일관성을 유지하는 영상을 만드는 법을 배웁니다.

마지막 다듬기: 영상을 세계로 바꾸기

영상은 훌륭하지만, 여전히 단순한 영상일 뿐입니다. 이를 당신이 날아다닐 수 있는 진짜 3D 세계로 만들기 위해, 시스템은 ABot-3DGS라는 재구성 엔진을 사용합니다.

  • 수리팀: 때때로 생성된 영상에 흐릿한 부분이나 이상한 아티팩트(왜곡)가 생길 수 있습니다. 시스템은 FLUX라는 도구로 구동되는 "수리팀"을 사용하여 해당 부분을 확대하고, 디테일을 수정하며, 질감을 선명하게 만듭니다. 이 과정은 두 단계로 진행되어 세계를 더욱 선명하고 실제처럼 만듭니다.
  • 결과물: 최종 결과물은 3D 가우시안 스플래팅(3DGS) 세계입니다. 이는 3D 공간의 픽셀처럼 작동하는 수백만 개의 작고 화려하게 빛나는 점들의 구름이라고 이해하면 됩니다. 당신은 이 점들 사이를 날아다닐 수 있으며, 매우 사실적인 모습을 보여줍니다.

이 시스템이 하지 않는 것 (그리고 그것이 중요한 이유)

논문은 이 시스템이 피하고자 하는 바를 명확히 밝히고 있습니다. 이 시스템은 단순히 평면 이미지를 이어 붙이거나, 원래의 기하학적 구조를 무시하고 "환각(hallucination)에 의존하는" 방식을 거부합니다.

  • 만약 실제 방의 영상을 제공한다면, 시스템은 방 뒷면이 어떻게 생겼을지 단순히 추측하는 것이 아니라, 엄격한 기하학 파이프라인을 사용하여 3D 세계가 실제 관측값과 일치하도록 보장합니다.
  • 또한, 사람이나 삼각대가 찍힌 흔들리는 실제 360도 카메라에 의존하지 않습니다. 대신, 깨끗한 3D 세계를 처음부터 렌더링하여 학습 데이터를 구축함으로써, AI가 실제 세상의 어지러움 없이 "완벽한" 예시로부터 배울 수 있도록 합니다.

증명: 얼마나 뛰어난가?

저자들은 단순히 멋지다고 말하는 데 그치지 않고, 이를 측정했습니다.

  • 경쟁 모델보다 우수함: Marble이나 HY-World 2.0과 같은 다른 최고 수준의 시스템들과 비교했을 때, ABot-3DWorld 0는 영상이나 여러 장의 사진 같은 풍부한 입력을 받았을 때 더 강력한 "장면 충실도(scene fidelity, 실제와 얼마나 닮았는지)"를 보여주었습니다.
  • 수치적 결과: 3DRL "현실 점검"을 추가한 후, 시스템의 3D 일관성이 크게 향상되었습니다. 예를 들어, 이미지의 원본과의 근접도를 측정하는 지표인 PSNR34.11에서 35.30으로 뛰었습니다. 구조적 유사성을 나타내는 SSIM0.942에서 0.951로 상승했습니다.
  • 속도: 4개의 고성능 그래픽 카드(4×4090)를 갖춘 강력한 컴퓨터에서, 영상에서 최종 3D 세계에 이르기까지의 전 과정은 약 10분이 소요됩니다.

큰 그림

이것은 단순한 장난감이 아닙니다. 이것은 새로운 종류의 지도로 가는 가교입니다. AMAP(주요 지도 서비스) 팀이 개발했기 때문에, 이 시스템이 만드는 모든 세계는 지구상의 실제 위치에 고정될 수 있습니다. 당신은 식당 사진을 보고 즉시 그 내부를 "걸어 다닐" 수 있고, 랜드마크를 보고 과거에 어떤 모습이었는지 보여주는 "시간 여행 포털"을 볼 수도 있습니다.

저자들은 텍스트부터 영상까지 모든 것을 처리할 수 있는 통합된 "프리미티브"를 사용하는 이 방식이, 3D 콘텐츠 제작을 셀카를 찍는 것만큼 쉽게 만들면서도, 실제로 탐험할 수 있을 만큼 정확한 세계를 만드는 열쇠가 될 것이라고 제안합니다. 이는 단 몇 마디의 말이나 단 한 번의 클릭만으로, 실재하거나 상상된 모든 3D 공간을 탐험할 수 있는 미래를 향한 한 걸음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →