← 최신 논문
💻 computer science

Ar2Can: An Architect and an Artist Leveraging a Canvas for Multi-Human Generation

본 논문은 기존 모델이 해결하지 못했던 다중 인물 생성 시 얼굴 정체성 손실 및 병합 문제를 해결하기 위해, 공간적 배치 계획을 담당하는 '아키텍트'와 정체성을 유지하며 이미지를 생성하는 '아티스트'로 구성된 2 단계 프레임워크 'Ar2Can'을 제안합니다.

원저자: Shubhankar Borse, Phuc Pham, Farzad Farhadzadeh, Seokeon Choi, Phong Ha Nguyen, Anh Tuan Tran, Sungrack Yun, Munawar Hayat, Fatih Porikli

게시일 2026-04-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Shubhankar Borse, Phuc Pham, Farzad Farhadzadeh, Seokeon Choi, Phong Ha Nguyen, Anh Tuan Tran, Sungrack Yun, Munawar Hayat, Fatih Porikli

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

Ar2Can: 사진 속 여러 사람을 자연스럽게 그리는 '건축가'와 '화가'의 협업

이 논문은 **"여러 사람이 함께 있는 사진을 AI 가 그릴 때, 얼굴이 뭉개지거나 사라지는 문제를 해결한 새로운 방법"**을 소개합니다. 기존 AI 는 "친구 5 명과 커피 마시는 장면"을 그려달라고 하면, 얼굴이 하나로 합쳐지거나 같은 얼굴이 두 번 나오거나 사람 수가 맞지 않는 실수를 자주 했습니다.

이 문제를 해결하기 위해 연구팀은 **두 명의 전문가 (건축가와 화가)**가 팀을 이루어 작업하는 새로운 방식을 고안했습니다. 이를 Ar2Can이라고 부릅니다.


1. 기존 AI 의 문제: "한 번에 다 하려고 하다가 망친다"

기존 AI 는 "어디에 누가 서 있을지 (공간)"와 "얼굴이 어떻게 생겼을지 (정체성)"를 동시에 생각하며 그림을 그립니다.

  • 비유: 마치 한 사람이 동시에 '집의 설계도'를 그리면서 '벽지 무늬'까지 동시에 칠하는 상황과 같습니다.
  • 결과: 설계가 엉망이 되거나, 벽지가 서로 겹쳐서 지저분해집니다. AI 도 마찬가지로 "누가 어디에 서야 하지?"를 고민하다가 얼굴들을 서로 섞어버리거나, 같은 얼굴을 여러 곳에 붙여버립니다.

2. Ar2Can 의 해결책: "설계 (건축가) 와 시공 (화가) 을 분리하다"

Ar2Can 은 이 두 작업을 완벽하게 분리하여 순서대로 진행합니다.

1 단계: 건축가 (The Architect) - "설계도 그리기"

  • 역할: "친구 5 명이 어디에 서서 무엇을 하고 있을지" **설계도 (배치도)**만 그립니다.
  • 작업: "누가 왼쪽에, 누가 오른쪽에, 누구는 뒤쪽에 서 있을까?"를 계산하여 각 사람의 **위치 (사각형 박스)**와 자세를 정확히 정합니다.
  • 특징: 얼굴의 생김새는 아직 생각하지 않습니다. 오직 **"누가 어디에 있는지"**만 결정합니다.
    • 유형 A: 언어를 잘 이해하는 AI (Qwen) 를 써서 "친구 5 명"이라는 말에서 숫자를 정확히 파악합니다.
    • 유형 B: 그림을 잘 그리는 AI (Flux) 를 써서 공간감을 자연스럽게 배치합니다.

2 단계: 화가 (The Artist) - "실제 그림 그리기"

  • 역할: 건축가가 준 설계도를 보고 실제 사진 같은 그림을 그립니다.
  • 작업: "아, 건축가가 이 박스 안에 '민수'의 얼굴을 넣으라고 했구나"라고 생각하며, 민수의 얼굴 사진을 가져와서 그 위치에 자연스럽게 그립니다.
  • 핵심 기술 ( Hungarian Matching):
    • 화가가 그린 얼굴이 건축가가 정한 위치와 정확히 일치하는지, 그리고 얼굴이 민수인지 확인합니다.
    • 비유: 마치 선생님이 학생 명단을 보고, 교실의 각 책상에 앉은 학생이 그 명단과 일치하는지 확인하는 과정과 같습니다. 만약 책상 (위치) 과 학생 (얼굴) 이 안 맞으면 다시 그립니다.
    • 이 과정을 통해 얼굴이 뭉개지거나 (Merge), 같은 얼굴이 두 번 나오거나 (Duplication) 하는 실수를 막습니다.

3. 왜 이 방법이 특별한가요?

  1. 실제 사진 없이도 학습 가능:

    • 보통 이런 기술을 가르치려면 수천 장의 "여러 사람이 함께 있는 고화질 사진"이 필요합니다. 하지만 이 방법은 **인공지능이 만든 가상의 사진 (Synthetic Data)**을 주로 사용합니다.
    • 비유: 실제 전쟁터에 나가지 않고도, 가상 현실 (VR) 시뮬레이션으로 수많은 훈련을 통해 실전 능력을 키운 것과 같습니다.
  2. 학습 방법의 혁신 (보상 시스템):

    • AI 가 그림을 그릴 때마다 "얼굴이 잘 나왔나?", "사람 수가 맞나?", "자연스러운가?"를 점수 매겨줍니다.
    • 점수가 낮으면 다시 그리는 강화 학습 (Reinforcement Learning) 방식을 써서, AI 스스로가 실수를 고쳐가며 발전시킵니다.
  3. 중첩된 얼굴 처리 (Token Sharing):

    • 사람들이 서로 겹쳐서 서 있을 때 (예: 뒤에 선 사람이 앞사람에게 가려질 때), AI 가 이를 자연스럽게 처리하도록 도와줍니다.
    • 비유: 두 장의 투명 플라스틱을 겹칠 때, 어떤 것이 앞이고 어떤 것이 뒤인지 AI 가 스스로 판단하게 만드는 마법 같은 규칙을 적용했습니다.

4. 결론: "건축가와 화가의 완벽한 듀엣"

이 연구는 **"공간을 설계하는 건축가"**와 **"정체를 유지하며 그리는 화가"**를 분리함으로써, AI 가 여러 사람이 함께 있는 사진을 그릴 때 겪던 고통 (얼굴 뭉개짐, 사람 수 오류) 을 해결했습니다.

  • 기존 방식: 한 사람이 모든 것을 하려다 실패.
  • Ar2Can: 건축가가 "누가 어디에"를 정하고, 화가가 "얼굴을 어떻게" 그리는지 분업.

이 덕분에 AI 는 이제 친구 5 명이 커피숍에서 웃고 있는 자연스러운 사진을 그릴 때, 얼굴 하나하나가 명확하고 사람 수도 정확하며, 서로 겹치는 부분까지 자연스럽게 표현할 수 있게 되었습니다. 이는 AI 가 복잡한 상황을 이해하고 창의적으로 표현하는 능력의 큰 도약입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →