← 최신 논문
💻 computer science

Composing People Together: Iterative Pose-Image Generation for Multi-Person Interaction Scenes

본 논문은 현재 텍스트-이미지 생성 모델이 의미적으로 다양하고 구성적으로 정확한 다중 인물 상호작용 장면을 생성하는 데서 겪는 한계를 극복하기 위해, 인물 중심의 구조적 사전 지식과 반복적 장면 구성 방식을 활용하는 이중 포즈-이미지 생성 프레임워크를 제시합니다.

원저자: Wenxuan Peng, Bharath Hariharan, Hadar Averbuch-Elor

게시일 2026-05-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Wenxuan Peng, Bharath Hariharan, Hadar Averbuch-Elor

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 재능이 있지만 약간 혼란스러운 화가가 무용, 럭비 경기, 또는 사제가 다른 사람의 손을 씻는 것과 같이 많은 사람들이 상호작용하는 복잡한 장면을 그리도록 가르치고 있다고 상상해 보세요.

현재의 AI 예술 생성기 (SDXL 나 FLUX 등) 는 바로 그런 화가와 같습니다. 그들은 단일 인물이나 단순한 풍경을 그리는 데는 뛰어납니다. 하지만 여러 사람이 함께 특정 행동을 하도록 요청하면 종종 길을 잃습니다. 한 사람을 잊어버리거나, 누가 누구의 손을 잡고 있는지 혼동하거나, 모든 사람이 똑같은 지루한 자세로 서 있게 만들기도 합니다. 이는 합창단에 복잡한 화음을 부르게 했을 때, 모두 같은 음을 부르거나 자신의 부분을 잊어버리는 것과 같습니다.

이 논문인 "Composing People Together(사람들을 함께 구성하기)" 는 AI 가 이러한 그룹 상호작용을 올바르게 수행할 수 있도록 안내하는 새로운 방식을 제시합니다. 간단한 비유를 사용하여 그들이 어떻게 했는지 살펴보겠습니다.

1. "뼈대와 피부" 트릭 (이중 포즈 - 이미지 생성)

일반적으로 AI 가 사람을 그리려고 할 때, 모양과 옷을 동시에 추측합니다. 이는 조각상을 만들면서 동시에 페인트칠을 하려는 것과 같습니다. 모양이 잘못되면 페인트칠도 잘못 보이게 됩니다.

저자들의 해결책은 AI 에게 두 가지를 동시에 그리게 하는 것입니다.

  • 뼈대 (포즈): 팔, 다리, 머리의 정확한 위치를 보여주는 간단한 막대 그림입니다.
  • 피부 (이미지): 최종적인 다채롭고 사실적인 사진입니다.

비유: 집을 짓는다고 생각해보세요. 먼저 튼튼한 나무 골조 (뼈대) 를 짓습니다. 골조가 완벽해지면 마른벽돌을 걸치고 벽을 페인트칠합니다 (피부). AI 에게 "먼저 뼈대를 그리게" 강요함으로써, 옷이나 얼굴을 걱정하기 전에 사람들이 올바른 위치에 서 있도록 보장합니다. 이렇게 하면 구조가 견고해져 최종 그림이 무너지지 않습니다.

2. "이름표" 시스템 (교차 모드 정렬)

뼈대가 있더라도 AI 는 누가 무엇을 하고 있는지 혼동할 수 있습니다. "빨간 셔츠를 입은 남자가 여자를 들어 올린다"고 말하면, AI 는 실수로 여자에게 빨간 셔츠를 입히거나 남자가 잘못된 사람을 들어 올리게 할 수 있습니다.

저자들은 회전 위치 인코딩 (Rotary Positional Encoding, RoPE) 이라는 기술을 사용하여 특별한 "이름표" 시스템을 만들었습니다.

  • 비유: 장면 속 모든 사람이 고유한 색상의 손목밴드 ("역할 ID") 를 착용했다고 상상해보세요. 빨간 셔츠를 입은 남자를 설명하는 텍스트, 빨간 셔츠를 입은 남자의 막대 그림 팔, 그리고 남자의 빨간 셔츠 픽셀은 모두 같은 색상의 손목밴드를 부여받습니다.
  • 이는 AI 에게 "아, 이 텍스트, 이 팔, 이 셔츠는 모두 같은 사람에 속하는구나"라고 인식하게 합니다. 이는 AI 가 역할을 혼동하는 것을 방지하여, 사제가 올바른 손을 씻고 럭비 선수가 올바른 상대를 태클하도록 보장합니다.

3. "하나씩" 조립 라인 (반복적 생성)

한 번에 전체 그룹을 생성하려고 시도하는 것은 1,000 조각 퍼즐을 한꺼번에 풀려고 하는 것과 같습니다. 너무 어렵고 AI 는 종종 조각을 놓칩니다.

대신 이 방법은 한 명씩 장면을 구축합니다.

  • 비유: 기차를 만드는 것을 상상해보세요. 모든 객차를 한 번에 연결하려고 하지 않습니다. 기관차 (1 번 사람) 로 시작합니다. 기관차가 자리 잡으면, 그 뒤에 첫 번째 객차 (2 번 사람) 를 연결합니다. 그다음 두 번째 객차 (3 번 사람) 를 두 번째 객차에 연결합니다.
  • AI 는 이미 그려진 사람들의 "뼈대"를 보고 그 다음 사람을 추가합니다. 이는 거대하고 무서운 문제를 작고 쉬운 단계들의 연속으로 분해합니다. 장면이 커짐에 따라 새로운 사람이 이미 있는 사람들과 완벽하게 어울리도록 보장합니다.

4. 새로운 "시험" (DrawWaldoWorlds)

이 방법의 효과를 입증하기 위해 저자들은 기존 테스트를 사용할 수 없었습니다. 기존 테스트들은 사람들이 올바르게 상호작용하는지 제대로 확인하지 못했기 때문입니다. 대신 그들은 DrawWaldoWorlds 라는 새로운 테스트를 구축했습니다.

  • 비유: AI 를 위한 "월도 찾기" 게임과 같습니다. 그들은 AI 에게 매우 구체적인 설명 (예: "파란 모자를 쓴 남자가 빨간 코트를 입은 여성 위에 우산을 들고 있다") 을 주고 그리도록 요청합니다. 그런 다음 확인합니다: AI 가 모자 색을 올바르게 그렸는가? 우산이 실제로 여성 위에 있는가? 여성을 완전히 잊어버렸는가?
  • 그들은 이 방법을 FLUX 나 SDXL 과 같은 최상위 경쟁사들과 비교 테스트했고, 그들의 방법이 세부 사항을 올바르게 처리하고 다양하며 반복적이지 않은 장면을 생성하는 데 훨씬 더 뛰어나다는 것을 발견했습니다.

요약

간단히 말해, 이 논문은 다음과 같이 말합니다: "AI 에게 복잡한 그룹 상호작용을 그리게 하려면 단순히 '그림을 그려라'고 요청하지 마십시오. 대신 먼저 뼈대를 짓게 하고, 누가 누구인지 알 수 있도록 모든 사람에게 고유한 ID 를 태그로 붙이며, 기차를 짓듯이 한 명씩 사람을 추가하게 하십시오."

그 결과, 사람들이 혼란스러운 더미처럼 서로 옆에 서 있는 것이 아니라, 실제로 올바르게 상호작용하는 이미지들이 만들어집니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →