← 최신 논문
💻 computer science

HomeDiffusion: Zero-Shot Object Customization with Multi-View Representation Learning for Indoor Scenes

HomeDiffusion는 다중 뷰 표현 학습과 디퓨전 모델 내의 교차 주의 메커니즘을 활용하여 실내 장면 내에서 시각적으로 조화롭고 고충실도의 가구 배치를 생성함으로써 기존 방식들의 세부 정보 손실과 포즈 불일치 문제를 극복하는 새로운 제로샷 객체 커스텀화 프레임워크입니다.

원저자: Guoqiu Li, Jin Song, Yiyun Fei

게시일 2026-06-30
📖 3 분 읽기☕ 가벼운 읽기

원저자: Guoqiu Li, Jin Song, Yiyun Fei

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 거실에 있는 가장 좋아하는 안락의자를 상상해 보세요. 이 의자가 햇살이 내리쬐는 테라스나 아늑한 사무실 같은 완전히 다른 공간에 놓인다면 어떤 모습일지 궁금할 것입니다. 의자의 천 무늬, 형태, 그리고 작은 스크래치 하나까지도 원래의 의자와 똑같기를 바라면서도, 바닥의 각도와 빛의 방향을 존속하며 자연스럽게 놓여 있기를 원할 것입니다.

이것이 바로 HomeDiffusion이 해결하고자 하는 문제입니다. HomeDiffusion은 물체를 새로운 장면 속에 넣었을 때 가짜처럼 보이거나, 붙여넣은 듯 어색하거나, 왜곡되어 보이지 않도록 하는 새로운 AI 도구입니다.

작동 원리는 다음과 같습니다. 이해하기 쉽게 몇 가지 개념으로 나누어 설명하겠습니다.

문제점: "붙여넣은 듯한" 느낌 (The "Pasted" Look)

기존의 AI 도구들은 서툰 화가와 같았습니다. 만약 당신이 의자를 새로운 방에 넣어달라고 요청하면, 색상은 맞출 수 있을지 몰라도 의자가 마치 평면적인 스티커처럼 보일 수 있습니다.

  • 원근법 문제: 만약 당신의 의자가 비대칭(예: 왼쪽에 카우치가 달린 소파)이라면, 기존 도구들은 의자를 오른쪽을 향하게 배치하려고 할 때 이미지를 단순히 늘리거나 뒤트는 방식을 사용했습니다. 이들은 의자가 단순한 이미지가 아니라 '3D 형태'를 가지고 있으며, 따라서 단순히 늘어나는 것이 아니라 회전해야 한다는 점을 이해하지 못했습니다.
  • 디테일 문제: 또한 미세한 디테일을 놓치는 경우가 많았습니다. 천의 패턴이 흐릿해지거나, 팔걸이의 특유한 곡선이 사라지기도 했습니다.

해결책: HomeDiffusion

연구진은 3D 기하학을 이해하는 숙련된 목수와 같은 시스템을 구축했습니다. 이들은 모든 가능한 각도(위, 옆, 앞, 뒤)에서 촬영된 방대한 가구 사진 라이브러리를 사용하여 이를 학습시켰습니다.

이 시스템은 두 가지 주요 "훈련 캠프"로 작동합니다.

1. "정신적 회전" 캠프 (MORL)

AI가 물체를 배치하기 전에, 먼저 그 물체를 깊이 있게 이해해야 합니다.

  • 비유: 복잡한 조각상을 전화로 친구에게 설명하려고 한다고 상상해 보세요. 사진 한 장만 보여준다면 친구는 뒷모습을 추측할 수 없을 것입니다. 하지만 앞, 옆, 위에서 찍은 사진들을 보여준다면, 친구는 머릿속에 완벽한 3D 모델을 그려낼 수 있습니다.
  • HomeDiffusion이 하는 일: 이 시스템은 동일한 가구를 다양한 각도에서 찍은 여러 장의 사진을 사용하여, AI가 본 적 없는 각도에서도 물체가 어떻게 보이는지 "예측"하도록 가르칩니다. 이를 통해 AI가 소파를 새로운 방에 배치할 때, 단순히 앞모습뿐만 아니라 소파의 뒷모습이 어떻게 보여야 하는지도 정확히 알게 됩니다.

2. "매끄러운 통합" 캠프 (BOCL)

AI가 물체를 이해했다면, 이제 그 물체를 새로운 장면 속에 스티커처럼 떠 있지 않게 배치해야 합니다.

  • 비유: 이것은 고도의 기술이 적용된 사진 콜라주와 같습니다. 하지만 단순히 잘라서 붙이는 것이 아니라, 조명과 그림자를 이해하는 "마법의 풀"을 사용하는 것과 같습니다.
  • "HD 시각 인코더 (HD Visual Encoder)": 러그의 짜임이나 쿠션의 스티치 같은 세밀한 디테일을 선명하게 유지하기 위해, AI는 전체 이미지만 보는 것이 아니라 아주 작은 패치 단위로 확대하여 고해상도 디테일을 포착합니다.
  • "합성 이미지 (Composite Image)" 기법: AI는 참조 물체를 새로운 방에 붙여넣은 임시 "가짜" 이미지를 만듭니다. 그런 다음 이 가짜 이미지를 가이드로 사용합니다.
  • "픽셀 정렬 교차 주의 (Pixel-Aligned Cross-Attention)": 이것이 바로 핵심 비결입니다. AI가 그림을 그리면서 계속해서 참조 사진을 확인한다고 상찰해 보세요. 단순히 참조 사진을 훑어보는 것이 아니라, 레이저 유도 시스템처럼 참조 사진의 모든 픽셀을 새로운 그림과 일치시킵니다. 이를 통해 새로운 방에 놓인 의자의 특정 패턴이 원래 의자의 패턴과 각도가 달라지더라도 완벽하게 일치하도록 보장합니다.

결과

연구진은 이 기술을 가구(침대, 소파, 램프)와 의류(가상 착용)에 대해 테스트했습니다.

  • 경쟁 모델보다 우수함: "Paint-by-Example" 또는 "AnyDoor"와 같은 다른 도구들과 비교했을 때, HomeDiffusion은 물체의 정체성을 훨씬 더 잘 유지했습니다. 단순히 색상만 맞춘 것이 아니라 질감과 형태를 정확하게 유지했습니다.
  • "학습" 불필요: 특정 의자에 대해 AI를 가르치기 위해 몇 시간씩 시간을 들여야 하는 다른 방식들과 달리, HomeDiffusion은 "제로샷(zero-shot)" 방식입니다. 사진만 제공하면 즉시 작동합니다.
  • 다양성: 주로 실내 가구에 대해 학습되었음에도 불구하고, 야외 장면이나 사람에게 옷을 입히는 작업(가상 착용)에서도 효과적으로 작동할 수 있음을 보여주었습니다.

요약

HomeDiffusion은 당신이 가장 좋아하는 의자의 사진을 찍어, 그 의자의 3D 형태를 모든 각도에서 이해하고, 완벽한 조명, 그림자, 질감을 적용하여 마치 원래 그 자리에 있었던 것처럼 새로운 방에 배치해 주는 가상 인테리어 디자이너와 같습니다. 이 기술은 AI에게 물체를 3D 공간에서 실제로 "보는" 법을 가르침으로써 "평면 스티커" 문제를 해결합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →