← 최신 논문
💻 computer science

InHabit: Leveraging Image Foundation Models for Scalable 3D Human Placement

이 논문은 2D 기반 모델의 상식적 지식을 3D 공간으로 확장하여, 렌더링-생성-상승 원리를 통해 물리적으로 타당한 인간 - 환경 상호작용이 포함된 대규모 3D 데이터셋 'InHabit'을 자동 생성하고 이를 통해 3D 인간 재구성 및 접촉 추정 성능을 획기적으로 향상시킨 방법을 제안합니다.

원저자: Nikita Kister, Pradyumna YM, István Sárándi, Jiayi Wang, Anna Khoreva, Gerard Pons-Moll

게시일 2026-04-22
📖 3 분 읽기☕ 가벼운 읽기

원저자: Nikita Kister, Pradyumna YM, István Sárándi, Jiayi Wang, Anna Khoreva, Gerard Pons-Moll

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🏠 'InHabit': 3D 공간에 사람을 자연스럽게 배치하는 마법 같은 기술

이 논문은 **"인공지능이 3D 공간에 사람을 어떻게 자연스럽게 배치할 수 있을까?"**라는 질문에 대한 해답을 제시합니다. 기존에는 이 작업을 하려면 비싼 모션 캡처 장비나 전문가의 손길이 필요했지만, 이 연구는 인터넷의 방대한 이미지 지식을 활용하여 이를 자동으로 해결합니다.

이 기술을 쉽게 이해할 수 있도록 세 가지 단계비유로 설명해 드리겠습니다.


🎨 1. 핵심 아이디어: "2D 그림을 3D 현실로 부활시키기"

기존 방식은 3D 공간에 사람을 넣을 때 "벽에 닿지 않게", "의자에 앉게" 하는 기하학적 규칙만 따랐습니다. 마치 레고 블록을 무작위로 쌓는 것과 비슷했죠. 그래서 사람이 의자에 앉아 있지만 TV 를 보지 않거나, 부엌에 서 있는데 요리도 안 하는 어색한 상황이 자주 발생했습니다.

InHabit은 다릅니다. 인터넷에서 수백만 장의 사진을 보고 배운 **AI(기초 모델)**의 지식을 활용합니다.

  • 비유: 마치 유능한 영화 감독이 새로운 세트장 (3D 공간) 을 보고 "이곳은 부엌이니까 사람이 요리를 하고 있겠지?"라고 상상한 뒤, 배우를 자연스럽게 배치하는 것과 같습니다.

🔄 2. 작동 원리: "그리고, 만들고, 들어 올리기" (Render-Generate-Lift)

이 기술은 3 단계로 이루어진 마법 같은 과정을 거칩니다.

1 단계: 상황 파악하기 (Render & Reason)

  • 무엇을 하나요? 3D 공간 (예: 빈 집) 을 카메라로 찍은 사진처럼 렌더링합니다.
  • AI 의 역할: **시각 - 언어 모델 (VLM)**이 이 사진을 보고 "이곳은 거실이고 소파가 있으니, 사람이 소파에 앉아 TV 를 보고 있겠구나"라고 추론합니다.
  • 비유: 현장 감독이 "이곳은 도서관이니까 조용히 책을 읽는 사람이 필요해!"라고 지시하는 것입니다.

2 단계: 사람 그리기 (Generate)

  • 무엇을 하나요? 이미지 편집 AI가 그 지시를 받아 사진 속에 사람을 자연스럽게 합성합니다.
  • AI 의 역할: 단순히 사람을 붙이는 게 아니라, 소파에 앉은 자세, TV 를 바라보는 시선, 손의 위치까지 상황에 맞게 그립니다.
  • 비유: 화가가 감독의 지시를 받아 캔버스에 완벽한 그림을 그리는 순간입니다.

3 단계: 3D 로 부활시키기 (Lift)

  • 무엇을 하나요? 2D 그림에 있는 사람을 다시 3D 공간으로 불러올립니다.
  • AI 의 역할: 그림 속 사람이 3D 공간의 바닥, 벽, 의자와 물리적으로 충돌하지 않게, 그리고 자연스러운 자세를 유지하도록 수학적 최적화를 거칩니다.
  • 비유: 조각가가 2D 그림을 보고 3D 입체 조각을 만들어내되, 바닥에 단단히 고정되고 넘어지지 않게 다듬는 작업입니다.

🛡️ 3. 품질 관리: "현실성 검사관"

AI 가 그림을 그릴 때 가끔 실수를 하기도 합니다 (예: 거울에 비친 사람을 실제 사람으로 착각하거나, 너무 작은 아이를 성인 크기로 맞추려다 기형이 되는 경우).

이때 3 가지 필터가 작동합니다.

  1. 보이는지 확인: 사람이 너무 잘려 있거나 거울 속 환영인지 확인합니다.
  2. 깊이 확인: 사람이 벽이나 가구를 뚫고 지나가진 않았는지 깊이 정보를 체크합니다.
  3. 크기 확인: 사람 몸의 부피가 비정상적으로 작거나 왜곡되지 않았는지 확인합니다.

이 과정을 거쳐 물리적으로 불가능한 이상한 사람들은 모두 걸러져 나갑니다.


🌟 4. 왜 이것이 중요한가요? (성과)

이 기술로 만들어진 **'InHabitants'**라는 데이터셋은 다음과 같은 놀라운 성과를 냈습니다.

  • 규모: 약 800 개의 다양한 건물 (집, 사무실 등) 에서 78,000 개 이상의 사람 - 공간 상호작용 데이터를 자동으로 생성했습니다.
  • 현실성: 사람들이 실험자들에게 보여줬을 때, 기존 최고 기술보다 78% 의 확률로 더 자연스럽고 현실적인 선택을 받았습니다.
  • 활용: 이 데이터로 로봇이나 가상 현실 (VR) AI 를 훈련시키면, 로봇이 "의자에 앉는 법"이나 "부엌에서 요리하는 법"을 훨씬 더 잘 이해하게 됩니다.

💡 요약

InHabit은 "비싼 모션 캡처 장비 없이도, 인터넷의 이미지 지식을 활용하여 3D 공간에 자연스러운 사람을 자동으로 채워 넣는 기술"입니다.

마치 가상 세계의 인구 조사관이 되어, 빈 집마다 상황에 맞는 사람들과 그들의 행동 (요리, 독서, 대화 등) 을 자동으로 채워 넣는 것입니다. 이는 로봇이 우리 세상을 더 잘 이해하고, 더 자연스럽게 도와줄 수 있는 미래를 위한 중요한 첫걸음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →