← 최신 논문
🤖 AI

CubePart: An Open-Vocabulary Part-Controllable 3D Generator

CubePart 는 전역 텍스트 프롬프트와 사용자가 정의한 부분 스키마를 받아 명시적으로 구조화된 의미론적 구성 요소로 조립된 일관성 있고 애니메이션 준비가 된 에셋을 생성함으로써 전개어휘 및 부분 제어 가능한 3D 메시 생성을 가능하게 하는 생성형 프레임워크입니다.

원저자: Yiheng Zhu, Kangle Deng, Jean-Philippe Fauconnier, Inaki Navarro, Daiqing Li, Ava Pun, Yinan Zhang, Peiye Zhuang, Xiaoxia Sun, Maneesh Agrawala, Kiran Bhat, Tinghui Zhou

게시일 2026-05-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yiheng Zhu, Kangle Deng, Jean-Philippe Fauconnier, Inaki Navarro, Daiqing Li, Ava Pun, Yinan Zhang, Peiye Zhuang, Xiaoxia Sun, Maneesh Agrawala, Kiran Bhat, Tinghui Zhou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

비디오 게임 개발자라고 상상해 보세요. 게임용 3D 자동차를 만들고 싶습니다. 옛날에는 전체 자동차를 디지털 점토로 조각하는 아티스트를 고용해야 했고, 그 다음에 수동으로 바퀴, 문, 엔진, 차체 등 조각으로 잘라내야 했습니다. 각 조각에 라벨을 붙여 게임 코드가 "아, 이 특정 조각이 바퀴구나, 그래서 회전시킬 수 있구나"라고 인식하도록 해야 했습니다.

이런 수동적인 자르고 라벨링하는 과정은 느리고 비싸며 확장하기 어렵습니다.

최근 AI 가 텍스트 설명을 바탕으로 3D 객체를 만드는 데 매우 능숙해지기 시작했습니다. 하지만 함정이 하나 있었습니다. AI 가 "모놀리스 (monolith)"—단단한 디지털 점토 덩어리 하나—를 뱉어냈기 때문입니다. 그것은 자동차처럼 보였지만 하나의 단단한 덩어리에 불과했습니다. AI 가 부품의 시작과 끝을 구분하지 못했기 때문에 바퀴를 돌리거나 문을 열 수 없었습니다. 다른 AI 방법들은 부품을 추측하려 했지만, 레시피 없이 수프의 재료를 추측하는 요리사와 같았습니다. 부품의 개수는 맞을지 몰라도, 필요한 특정 레시피와 일치하지는 않았습니다.

CubePart 등장: "레고 조립공" AI

이 논문은 사용자의 정확한 지시를 따르는 마스터 레고 조립공처럼 작동하는 새로운 시스템인 CubePart를 소개합니다.

핵심 아이디어: "레시피"와 "청사진"

"나에게 자동차를 만들어줘"라고 말하는 대신, AI 에게 두 가지를 제공합니다:

  1. 설명: "멋진 미래지향적 견인 트럭을 만들어줘."
  2. 청사진 (스키마): 필요한 부품의 구체적인 목록: "캐빈, 차체, 바퀴 네 개, 지붕 비컨, 견인 장치가 필요합니다."

CubePart 는 단순히 추측하지 않습니다. 목록에 맞춰 객체를 구체적으로 조립합니다. 최종 결과가 거대한 덩어리가 아니라, 게임 엔진이 가져와서 애니메이션화할 준비가 된 완벽하게 결합된 개별 부품들의 집합이 되도록 보장합니다.

작동 원리: 두 단계 주방

저자들은 이 시스템을 두 단계 요리 과정을 통해 구축했습니다:

1 단계: 전체 케이크 굽기
먼저, AI 는 설명을 바탕으로 완벽한 전체 케이크 (전체 객체) 를 굽는 법을 배웁니다. 이는 46 만 개가 넘는 객체로 구성된 거대한 데이터셋에서 학습한 방대한 3D 모양과 텍스트 설명 라이브러리를 활용합니다. 이 단계는 객체가 올바르게 보이고 전체적인 모양이 적절하도록 보장합니다.

2 단계: 케이크 썰기
전체 케이크가 구워지면, AI 는 두 번째 단계로 넘어갑니다. 그 전체 케이크를 "청사진"에 따라 정확하게 썰어냅니다.

  • 비밀 소스: 이 논문은 "크로스-파트 어텐션 (Cross-Part Attention)"이라는 특별한 메커니즘을 소개합니다. 이는 조각들 간의 통신 네트워크라고 생각하면 됩니다. AI 가 "왼쪽 바퀴"를 자를 때, "오른쪽 바퀴"와 대화하여 크기가 같고 겹치지 않도록 합니다. 부품이 분리되어 있더라도 실제 자동차처럼 조화로운 전체를 이루도록 결합되도록 보장합니다.

데이터 엔진: "스마트 사서"

AI 에게 이를 가르치기 위해 연구자들은 방대한 예제 라이브러리를 구축해야 했습니다. 단순히 인간에게 수백만 개의 부품을 라벨링하도록 요청한 것은 아닙니다 (그건 영원히 걸릴 테니까요). 대신, 고급 AI 비전 모델을 사용하여 자동화된 "스마트 사서" 시스템을 구축했습니다.

이 사서는 3D 모델을 보고 모든 각도에서 사진을 찍은 뒤, "Set-of-Mark"라는 기법 (사진의 다른 부품에 번호가 붙은 스티커를 붙이는 것과 같은) 을 사용합니다. 그런 다음 초지능 AI(비전 - 언어 모델) 에게 스티커를 보고 "좋아, 스티커 #1 과 #2 는 둘 다 바퀴니까, 이들을 그룹화해서 '전면 바퀴'라고 부르자"라고 말하게 합니다. 이를 통해 이전의 어떤 부품 기반 데이터셋보다 11 배나 큰 데이터셋을 자동으로 생성할 수 있었습니다.

이것이 중요한 이유 (논문에 따르면)

이 논문은 이 기술이 비디오 게임과 같은 상호작용형 3D 콘텐츠에 게임 체인저라고 주장합니다. 그 이유는 다음과 같습니다:

  • 즉시 사용 가능: 출력물이 단순히 예쁜 그림이 아니라, 게임 엔진에 바로 삽입할 수 있는 별도의 메시 (mesh) 집합입니다.
  • 제어 가능: "후드를 애니메이션으로 열 수 있도록 별도의 조각으로 만들어줘"라고 AI 에게 말하면 정확히 그렇게 합니다.
  • 복잡성 처리: 이 논문은 "해파리 테마의 레이싱카"나 "포탑이 달린 전차"와 같은 복잡한 객체의 예시를 보여주며, AI 가 바퀴, 차체, 포탑, 대포를 각각 구분 가능하고 사용 가능한 조각으로 성공적으로 분리했음을 보여줍니다.

한계점 ("오ops" 순간들)

저자들은 시스템이 여전히 stumbling 하는 부분을 솔직하게 인정합니다:

  • 강체 vs 유연체: 현재는 자동차와 로봇과 같은 단단한 객체 (강체) 에는 훌륭합니다. 하지만 구부러지고 늘어나야 하는 캐릭터 (인간의 팔 등) 의 "피부"나 근육을 처리하는 방법은 아직 모릅니다.
  • 불완전한 경계: 때로는 AI 가 문과 차체처럼 분리되어야 할 두 부품을 약간 겹치거나 교차시키기도 합니다. 마치 두 사람이 같은 의자에 앉으려 할 때처럼요.
  • 좌우 혼동: AI 는 때때로 "왼쪽"과 "오른쪽"을 혼동하여, 특히 객체가 대칭적일 때 왼쪽 바퀴를 오른쪽 바퀴로 바꾸기도 합니다.

요약하자면, CubePart 는 "나에게 3D 객체를 만들어줘"라는 모호한 아이디어를 정밀하고 미리 조립된 부품 키트로 변환하여, 예술가들이 자신의 창작물을 수동으로 잘라내는 지루한 작업에서 벗어나게 해주는 도구입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →