← 최신 논문
💻 computer science

MultiCube: Compositional 3D Generation With Part-Level Semantic and Spatial Control

MultiCube는 전역 텍스트 프롬프트와 함께 특정 부위별 의미 및 공간 레이아웃을 수용하여 독립적으로 제어 가능한 구성 요소를 가진 고품질 3D 객체를 생성함으로써 정밀한 구성적 3D 생성을 가능하게 하는 새로운 2단계 확산 기반 방법론입니다.

원저자: Ava Pun, Kangle Deng, Yiheng Zhu, Jun-Yan Zhu, Maneesh Agrawala, Tinghui Zhou

게시일 2026-08-24
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ava Pun, Kangle Deng, Yiheng Zhu, Jun-Yan Zhu, Maneesh Agrawala, Tinghui Zhou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

영화, 비디오 게임, 가상 세계를 위한 디지털 3D 객체를 제작하는 것은 전통적으로 노동 집약적인 기술이었습니다. 예술가들은 바퀴, 날개, 또는 팔다리가 정확히 있어야 할 위치에 배치되도록 보장하며, 복잡한 모델을 수동으로 조각하고, 색칠하고, 조립하는 데 수 시간을 소비합니다. 최근 몇 년 동안 인공지능은 이 과정을 자동화하여, 단순한 텍스트 설명으로부터 3D 형태를 생성할 수 있게 해주었습니다. 그러나 이러한 초기 AI 시스템은 종종 전문적인 용도로 사용하기에 필요한 내부 구조가 결여된, 단일 조각의 고체 객체를 생성하곤 합니다. 만약 개발자가 움직이는 팔을 가진 캐릭터나 탈착 가능한 바퀴를 가진 차량이 필요하다면, 표준적인 AI 생성 모델은 하나의 연속된 덩어리에 불과하기 때문에 무용지물이 되는 경우가 많습니다. 연구자들의 과제는 컴퓨터가 단순히 형태를 만드는 법뿐만 아니라, 형태란 개별적으로 제어될 수 있는 구별되고 의미 있는 부분들로 구성되어 있다는 점을 이해하도록 가르치는 것이었습니다.

한 연구팀은 생성된 3D 객체 내의 모든 부품에 대한 정체성과 위치를 제작자가 정밀하게 제어할 수 있도록 설계된 '멀티큐브(MultiCube)'라는 새로운 시스템을 선보였습니다. 사용자들은 이제 단순히 컴퓨터에 "로봇을 만들어줘"라고 요청하는 대신, 머리, 두 개의 팔, 네 개의 바퀴와 같이 원하는 특정 부품들을 명시하고 각 부품이 공간의 어느 위치에 놓여야 하는지를 시스템에 정확히 알려줄 수 있습니다. 그러면 시스템은 각 구성 요소가 사용자의 지침에 따라 완벽하게 정렬된 별개의 편집 가능한 조각이 되는 완전한 3D 객체를 생성합니다. 이 방식은 텍스트 기반 생성의 창의적 자유와 전문적인 3D 모델링의 엄격한 구조적 요구 사항 사이의 간극을 메워줍니다.

멀티큐브의 핵심 혁신은 명령을 해석하는 방식에 있습니다. 이전의 방법들은 텍스트 프롬프트와 대략적인 위치 개념을 받아들일 수는 있었지만, 부품들을 서로 분리된 상태로 유지하거나 올바른 위치에 두는 데 어려움을 겪는 경우가 많았습니다. 멀티큐브는 세 가지 특정 입력을 받음으로써 작동합니다: 전체 객체에 대한 설명, 필요한 특정 부품 목록, 그리고 각 부품의 크기와 위치를 정의하는 보이지 않는 상자들입니다. 예를 들어, 사용자가 "튼튼한 금속 손전등"이라고 묘로사하고 구성 요소를 손잡이, 스위치, 렌즈로 나열한다고 가정해 봅시다. 그런 다음 사용자는 가상 공간에 손잡이를 위한 상자 하나, 스위치를 위한 상자 하나, 렌즈를 위한 상자 하나를 그립니다. 시스템은 이 상자들을 엄격한 가이드로 사용하여, 생성된 손잡이가 첫 번째 상자 안에 들어가고, 스위치가 두 번째 상자 안에, 렌즈가 세 번째 상자 안에 들어가면서도 여전히 응집력 있는 손전등처럼 보이도록 보장합니다.

이를 달성하기 위해 연구진은 2단계 프로세스를 구축했습니다. 먼저, 컴퓨터는 요청된 모든 부품을 올바른 위치에 포함하는 단일한 고체 형태를 생성합니다. 이를 위해 컴퓨터는 각 부품에 대한 텍스트 설명을 해당 부품에 할당된 특정 상자와 연관시키는 법을 학습합니다. 시스템 내의 특수 구성 요소인 '파트 레이아웃 어댑터(Part Layout Adapter)'는 각 부품의 정보를 분리하여 유지함으로써, 컴퓨터가 어떤 부품이 어느 상자에 속하는지 혼동하지 않도록 번역가 역할을 수행합니다. 이 고체 형태가 생성되면, 시스템은 두 번째 단계로 넘어가서, 생성된 고체 객체를 사용자가 요청한 개별 부품들로 정교하게 분리합니다. 이는 최종 결과물이 단순한 하나의 메쉬(mesh)가 아니라, 서로 완벽하게 맞물리는 별개의 3D 모델 모음이 되도록 보장합니다.

이 방법의 결과는 기존 도구들에 비해 상당한 개선을 보여줍니다. 테스트에서 멀티큐브는 노출된 실린더가 있는 6연발 리볼버 권총, 여러 개의 머리를 가진 장엄한 독수리 괴물, 또는 특정 사지를 가진 기계 로봇과 같은 복잡한 객체를 사용자의 공간 지침을 엄격히 준수하며 생성할 수 있었습니다. 다른 시스템들과 비교했을 때, 멀티큐브는 의도한 레이아웃에 훨씬 더 정확한 형태를 만들어냈으며, 부품이 겹치거나 완전히 누락되는 등의 오류가 훨씬 적었습니다. 또한 이 시스템은 유연성을 갖추고 있어 변경 사항을 처리할 수 있습니다. 만약 사용자가 생물의 다리를 날개로 바꾸거나 꼬리를 길게 늘리기로 결정한다면, 시스템은 나머지 구조를 온전히 유지하면서 새로운 부품으로 객체를 재생성할 수 있습니다.

정적인 객체를 넘어, 이 기술은 더 역동적인 응용 분야로의 가능성을 열어줍니다. 멀티큐브는 객체를 별도의 라벨이 붙은 조각들로 생성하기 때문에, 이 부품들은 즉시 애니메이션에 사용될 수 있습니다. 멀티큐브로 생성된 캐릭터는 예술가들이 관절이 어떻게 굽히고 회전하는지 수동으로 정의해야 하는 번거로운 리깅(rigging) 과정 없이도 팔과 다리를 독립적으로 움직일 수 있습니다. 연구진은 또한 이 시스템이 완전히 자동화될 수 있음을 입증했습니다. 대규모 언어 모델(LLM)과 연결하면, 사용자는 단순히 "아늑한 침실"과 같은 설명을 입력하기만 하면 됩니다. 그러면 시스템은 침대, 협탁, 스탠드와 같은 필요한 부품들을 자동으로 파악하고 수동으로 상자를 그릴 필요 없이 논리적인 배치를 구성합니다.

이 시스템은 강력하지만, 연구진은 완벽하지 않다는 점을 인정합니다. 만약 부품을 정의하는 상자가 바퀴를 머리 안에 배치하는 것과 같이 물리적으로 말이 되지 않는 방식으로 그려진다면, 결과물은 이상하게 보일 수 있습니다. 또한, 시스템이 가끔씩 약간 겹치는 부품을 생성하기도 하지만 이는 드문 일입니다. 이러한 사소한 한계에도 불구하고, 이 연구는 3D 제작을 더욱 접근 가능하고 제어 가능하게 만드는 중요한 진전입니다. 사용자가 객체의 모습뿐만 아니라 어떻게 만들어지는지, 그리고 그 조각들이 어디에 위치해야 하는지까지 결정할 수 있는 능력을 부여함으로써, 멀티큐브는 인공지능을 전문 예술가들이 요구하는 수준의 통제력에 한 걸음 더 다가가게 하며, 단순한 텍스트와 거친 스케치를 복잡하고 사용 가능한 3D 자산으로 변화시키고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →