← 최신 논문
💻 computer science

Scene and Human in One World: Reconstruction in a Feedforward Pass

이 논문은 장면 스케일링을 위한 파라메트릭 휴먼 프라이어와 휴먼 얼라인먼트를 위한 장면 기하학을 상호 활용하는 동시에, 폐쇄 및 클러터를 처리하기 위해 프롬프트 가능한 마스킹 메커니즘을 활용함으로써 단안 비디오로부터 미터 단위 스케일의 3D 장면과 휴먼 메시를 공동으로 재구성하는 통합 피드포워드 프레임워크인 SHOW를 소개한다.

원저자: Boao Shi, Qiao Feng, Yiming Huang, Lingjie Liu

게시일 2026-06-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Boao Shi, Qiao Feng, Yiming Huang, Lingjie Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

큰 문제: "떠 있는 머리(Floating Head)" 문제

당신이 공원을 걷고 있는 사람의 영상을 보고 있다고 상상해 보세요. 만약 단 하나의 카메라만을 사용하여 그 사람과 공원을 각각 별도의 3D 모델로 만들려고 한다면, 고전적인 문제인 **스케일 모호성(Scale Ambiguity)**에 부딪히게 됩니다.

두 번째 카메라나 자(ruler)가 없다면, 컴퓨터는 이 사람이 미니어처 공원을 걷고 있는 거인인지, 아니면 거대한 공원을 걷고 있는 작은 사람인지 알 수 없습니다.

  • 기존 방식들은 사람을 먼저 만들고, 그다음 공원을 만든 뒤, 나중에 이 둘을 합치려고 시도하며 이 문제를 해결하려 했습니다.
  • 결과: 종종 사람은 공중에 떠 있거나, 땅속으로 가라앉거나, 주변의 나무나 벤치와 비교했을 때 크기가 맞지 않는 것처럼 보이게 됩니다. 이들은 서로 딱 들어맞지 않는 두 개의 별개 퍼즐 조각과 같습니다.

해결책: SHOW (Scene and Human in One World)

저자들은 SHOW라고 불리는 새로운 방법을 소개합니다. SHOW는 사람과 공원을 따로 만드는 대신, 단 한 번의 단계로 동시에 구축합니다.

이것은 케이크 반죽과 프로스팅을 각각 따로 만들어 나중에 붙이려고 애쓰는 것이 아니라, 하나의 그릇에 반죽과 프로스팅을 함께 섞어 굽는 것과 같습니다. 함께 만들어졌기 때문에, 이들은 완벽하게 어우러질 수밖에 없습니다.

작동 원리: 세 가지 마법 같은 기술

1. "형광펜" (마스크 프롬프팅 - Mask Prompting)

사람이 많거나 배경이 복잡한 영상에서는 컴퓨터가 어떤 사람에게 집중해야 할지 알기 어렵습니다.

  • 비유: 북적이는 군중 속에서 친구의 초상화를 그리려고 한다고 상상해 보세요. 방 전체를 쳐다보는 대신, 당신은 오직 친구에게만 형광펜으로 표시를 합니다.
  • 기술: SHOW는 "마스크"(디지털 윤곽선)를 사용하여 컴퓨터에게 다음과 같이 지시합니다: "배경과 다른 사람들은 무시하고, 오직 이 특정 사람에게만 집중해." 이를 통해 컴퓨터는 이 사람이 정확히 어디에 있는지, 그리고 장면(scene)과 비교했을 때 크기가 어느 정도인지를 이해할 수 있습니다.

2. "양방향 도로" (상호 학습 - Mutual Learning)

이것이 핵심적인 혁신입니다. 이전의 방법들에서는 "장면"과 "사람"이 서로 대화하지 못했습니다.

  • 비유: 댄스 파트너를 상상해 보세요. 만약 한 파트너(사람)가 다른 파트너(장면)가 어디에 있는지 모른다면, 서로 발을 밟거나 멀어지게 될 것입니다.
  • 기술:
    • 사람이 장면에 도움을 줌: 컴퓨터는 인간의 신체가 어떻게 생겼는지 알고 있습니다(표준적인 크기가 있습니다). 이를 이용해 장면에게 이렇게 말합니다: "만약 이 사람이 여기에 서 있다면, 지면은 이 정도 거리만큼 떨어져 있어야 해."
    • 장면이 사람에게 도움을 줌: 컴퓨터는 바닥과 벽을 살핍니다. 그리고 사람에게 말합니다: "너는 여기서 떠 있을 수 없어. 바닥이 바로 저기에 있으니, 너는 그 위에 서 있어야 해."
    • 결과: 이들은 끊임없이 서로를 교정하며, 사람이 올바른 크기로 올바른 위치에 서 있도록 보장합니다.

3. "공유된 설계도" (통합된 미터법 공간 - Unified Metric Space)

대부분의 3D 모델은 "정규화된" 공간(미터와 같은 실제 단위 없이 단순히 0과 1 사이의 숫자로 표현되는 공간)에서 구축됩니다.

  • 비유: 설계도에 "문 높이는 1 유닛이다"라고만 적혀 있고, 그 유닛이 1인치인지 1마일인지 적혀 있지 않은 상태로 집을 짓는 것과 같습니다.
  • 기술: SHOW는 사람과 장면이 동일한 설계도를 공유하도록 강제합니다. 이는 추상적인 숫자를 실제 세계의 측정값으로 변 converting하는 "스케일 인자(scale factor)"를 계산합니다. 이를 통해 만약 장면 속 벤치의 높이가 0.5미터라면, 사람의 다리 길이도 미터 단위로 측정되어 완벽하게 들어맞게 됩니다.

왜 더 나은가?

이 논문은 모든 것을 한 번에 수행함으로써(피드포워드 패스, feedforward pass), SHOW가 세 가지 주요 골칫거리를 해결했음을 보여줍니다.

  1. 떠 있음 없음 (No Floating): 사람들이 공중에 떠 있지 않고 지면에 제대로 서 있습니다.
  2. 가라앉음 없음 (No Sinking): 사람들이 바닥 아래로 빠지지 않습니다.
  3. 잘못된 크기 없음 (No Wrong Sizes): 아이가 실수로 성인 크기로 모델링되는 일이 발생하지 않습니다.

"어블레이션(Ablation)" (마법을 제거하면 어떻게 될까?)

저자들은 특정 기능들을 꺼서 어떤 부분이 망가지는지 테스트했습니다:

  • "형광펜"(마스크)이 없다면: 컴퓨터가 혼란을 느껴 군중 속에서 올바른 사람을 선택하지 못했습니다.
  • "양방향 도로"(결합 훈련)가 없다면: 사람과 장면이 서로 소통하지 못해 정렬이 어긋나고(떠 있거나 가라앉는 현상), 위치가 맞지 않게 되었습니다.
  • "공유된 설계도"(스케일)가 없다면: 크기가 모두 잘못되었습니다.

요약

SHOW는 평면적인 영상을 3D 세계로 바꾸는 새로운 방법입니다. 사후에 사람이 장면에 어떻게 들어맞을지 추측하는 대신, 사람의 형태를 통해 장면의 크기를 정의하고, 장면의 기하학적 구조를 통해 사람의 발을 고정함으로써 사람과 장면을 함께 구축합니다. 그 결과, 인간과 환경이 자연스럽게 어우러지며 떠 있거나 가라앉는 현상이 없는 3D 세계를 만들어냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →