이 논문은 **"여러 사람이 함께 있는 사진을 AI 가 그릴 때, 얼굴이 뭉개지거나 사라지는 문제를 해결한 새로운 방법"**을 소개합니다. 기존 AI 는 "친구 5 명과 커피 마시는 장면"을 그려달라고 하면, 얼굴이 하나로 합쳐지거나 같은 얼굴이 두 번 나오거나 사람 수가 맞지 않는 실수를 자주 했습니다.
이 문제를 해결하기 위해 연구팀은 **두 명의 전문가 (건축가와 화가)**가 팀을 이루어 작업하는 새로운 방식을 고안했습니다. 이를 Ar2Can이라고 부릅니다.
1. 기존 AI 의 문제: "한 번에 다 하려고 하다가 망친다"
기존 AI 는 "어디에 누가 서 있을지 (공간)"와 "얼굴이 어떻게 생겼을지 (정체성)"를 동시에 생각하며 그림을 그립니다.
비유: 마치 한 사람이 동시에 '집의 설계도'를 그리면서 '벽지 무늬'까지 동시에 칠하는 상황과 같습니다.
결과: 설계가 엉망이 되거나, 벽지가 서로 겹쳐서 지저분해집니다. AI 도 마찬가지로 "누가 어디에 서야 하지?"를 고민하다가 얼굴들을 서로 섞어버리거나, 같은 얼굴을 여러 곳에 붙여버립니다.
2. Ar2Can 의 해결책: "설계 (건축가) 와 시공 (화가) 을 분리하다"
Ar2Can 은 이 두 작업을 완벽하게 분리하여 순서대로 진행합니다.
1 단계: 건축가 (The Architect) - "설계도 그리기"
역할: "친구 5 명이 어디에 서서 무엇을 하고 있을지" **설계도 (배치도)**만 그립니다.
작업: "누가 왼쪽에, 누가 오른쪽에, 누구는 뒤쪽에 서 있을까?"를 계산하여 각 사람의 **위치 (사각형 박스)**와 자세를 정확히 정합니다.
특징: 얼굴의 생김새는 아직 생각하지 않습니다. 오직 **"누가 어디에 있는지"**만 결정합니다.
유형 A: 언어를 잘 이해하는 AI (Qwen) 를 써서 "친구 5 명"이라는 말에서 숫자를 정확히 파악합니다.
유형 B: 그림을 잘 그리는 AI (Flux) 를 써서 공간감을 자연스럽게 배치합니다.
2 단계: 화가 (The Artist) - "실제 그림 그리기"
역할: 건축가가 준 설계도를 보고 실제 사진 같은 그림을 그립니다.
작업: "아, 건축가가 이 박스 안에 '민수'의 얼굴을 넣으라고 했구나"라고 생각하며, 민수의 얼굴 사진을 가져와서 그 위치에 자연스럽게 그립니다.
핵심 기술 ( Hungarian Matching):
화가가 그린 얼굴이 건축가가 정한 위치와 정확히 일치하는지, 그리고 얼굴이 민수인지 확인합니다.
비유: 마치 선생님이 학생 명단을 보고, 교실의 각 책상에 앉은 학생이 그 명단과 일치하는지 확인하는 과정과 같습니다. 만약 책상 (위치) 과 학생 (얼굴) 이 안 맞으면 다시 그립니다.
이 과정을 통해 얼굴이 뭉개지거나 (Merge), 같은 얼굴이 두 번 나오거나 (Duplication) 하는 실수를 막습니다.
3. 왜 이 방법이 특별한가요?
실제 사진 없이도 학습 가능:
보통 이런 기술을 가르치려면 수천 장의 "여러 사람이 함께 있는 고화질 사진"이 필요합니다. 하지만 이 방법은 **인공지능이 만든 가상의 사진 (Synthetic Data)**을 주로 사용합니다.
비유: 실제 전쟁터에 나가지 않고도, 가상 현실 (VR) 시뮬레이션으로 수많은 훈련을 통해 실전 능력을 키운 것과 같습니다.
학습 방법의 혁신 (보상 시스템):
AI 가 그림을 그릴 때마다 "얼굴이 잘 나왔나?", "사람 수가 맞나?", "자연스러운가?"를 점수 매겨줍니다.
점수가 낮으면 다시 그리는 강화 학습 (Reinforcement Learning) 방식을 써서, AI 스스로가 실수를 고쳐가며 발전시킵니다.
중첩된 얼굴 처리 (Token Sharing):
사람들이 서로 겹쳐서 서 있을 때 (예: 뒤에 선 사람이 앞사람에게 가려질 때), AI 가 이를 자연스럽게 처리하도록 도와줍니다.
비유: 두 장의 투명 플라스틱을 겹칠 때, 어떤 것이 앞이고 어떤 것이 뒤인지 AI 가 스스로 판단하게 만드는 마법 같은 규칙을 적용했습니다.
4. 결론: "건축가와 화가의 완벽한 듀엣"
이 연구는 **"공간을 설계하는 건축가"**와 **"정체를 유지하며 그리는 화가"**를 분리함으로써, AI 가 여러 사람이 함께 있는 사진을 그릴 때 겪던 고통 (얼굴 뭉개짐, 사람 수 오류) 을 해결했습니다.
이 덕분에 AI 는 이제 친구 5 명이 커피숍에서 웃고 있는 자연스러운 사진을 그릴 때, 얼굴 하나하나가 명확하고 사람 수도 정확하며, 서로 겹치는 부분까지 자연스럽게 표현할 수 있게 되었습니다. 이는 AI 가 복잡한 상황을 이해하고 창의적으로 표현하는 능력의 큰 도약입니다.
Ar2Can: 다중 인물 생성을 위한 건축가 (Architect) 와 화가 (Artist) 의 협업 캔버스
이 논문은 텍스트 기반 이미지 생성 모델이 여러 인물이 포함된 장면을 생성할 때 겪는 근본적인 한계 (얼굴의 병합, 동일성 손실, 인수 불일치 등) 를 해결하기 위해 제안된 Ar2Can이라는 새로운 2 단계 프레임워크를 소개합니다.
1. 문제 정의 (Problem)
최근 텍스트-이미지 확산 모델 (Diffusion Models) 은 단일 인물의 고품질 생성에서는 뛰어난 성과를 보였으나, **"여러 명의 서로 다른 인물이 포함된 장면"**을 생성하는 데에는 실패합니다.
주요 실패 사례: 여러 인물의 얼굴이 서로 합쳐지거나 (merging), 동일한 얼굴이 반복되어 나타나는 (duplication), 또는 지시된 인물의 수와 실제 생성된 인물의 수가 일치하지 않는 문제가 발생합니다.
근본 원인: 기존 모델들은 "사람이 어디에 위치해야 하는지 (공간적 배치)"와 "사람이 어떻게 생겼어야 하는지 (정체성 렌더링)"를 단일 단계의 생성 과정에서 동시에 추론하려다 보니, 공간 구조와 외관이 혼재되어 체계적인 오류가 발생합니다.
2. 방법론 (Methodology)
Ar2Can 은 **공간적 계획 (Spatial Planning)**과 **정체성 렌더링 (Identity Rendering)**을 분리하는 2 단계 아키텍처를 채택합니다.
2.1. 아키텍처 개요
건축가 (The Architect): 텍스트 프롬프트를 분석하여 각 인물이 위치해야 할 구조화된 공간 레이아웃 (바운딩 박스 및 포즈) 을 예측합니다.
화가 (The Artist): 건축가가 생성한 공간 계획과 참조 이미지 (Reference Images) 를 기반으로 실제 사진처럼 사실적인 (Photorealistic) 이미지를 합성합니다.
2.2. 건축가 (Architect) 의 두 가지 변형
사용자의 요구사항 (정확도 vs 속도) 에 따라 두 가지 변형을 제공합니다.
Architect-A (Qwen 기반): Qwen-2.5(0.5B) LLM 을 사용하여 순차적 (autoregressive) 으로 바운딩 박스 좌표를 회귀합니다. 언어 이해력이 뛰어나 인물 수 (Count) 정확도가 매우 높습니다.
Architect-B (Flux-Schnell 기반): 강화 학습 (RL) 으로 미세 조정된 T2I(텍스트-이미지) 모델입니다. 2D 생성의 특성을 활용하여 복잡한 공간 관계와 자연스러운 포즈를 더 잘 파악합니다.
2.3. 화가 (Artist) 및 강화 학습 (GRPO)
모델: Flux-Kontext 모델을 기반으로 합니다.
학습 방식: 지도 학습 (Supervised Fine-tuning) 대신 **그룹 상대 정책 최적화 (Group Relative Policy Optimization, GRPO)**를 사용합니다. 이는 비미분 가능한 목표 (인물 수, 정체성 일치 등) 를 직접 최적화할 수 있게 합니다.
핵심 보상 함수 (Compositional Rewards):
공간 기반 얼굴 매칭 보상 (Spatially-grounded Face Matching):
건축가가 예측한 위치와 실제 생성된 얼굴 위치 간의 **헝가리안 알고리즘 (Hungarian Algorithm)**을 사용하여 최적의 매칭을 수행합니다.
매칭된 얼굴과 참조 이미지 간의 ArcFace 정체성 유사도를 계산합니다.
이 방식은 얼굴이 정확한 위치에 있어야 하며, 동시에 참조된 정체성을 유지해야 함을 보장하여 "복사 - 붙여넣기" 같은 인위적인 아티팩트를 방지합니다.
인물 수 정확도 (Count Accuracy): 생성된 인물의 수가 프롬프트와 일치하는지 확인합니다.
포즈 정렬 (Pose Alignment): 얼굴이 카메라를 향하는지 (Frontal Pose) 등을 평가하여 자연스러운 구도를 유도합니다.
이미지 품질 (HPSv3): 프롬프트 일치도 및 미적 품질을 평가합니다.
2.4. 토큰 공유 및 드롭핑 전략 (Token Sharing & Dropping)
고해상도 캔버스 전체를 처리하는 대신 필요한 영역의 토큰만 추출하여 연산량을 2 배 줄입니다.
얼굴이 겹치는 (Occlusion) 경우, 겹치는 영역에 **동일한 위치 인코딩 (RoPE)**을 부여하여 모델이 깊이 순서 (Depth ordering) 와 가림 처리를 자연스럽게 학습하도록 유도합니다.
2.5. 커리큘럼 학습 (Curriculum Learning)
학습 초기에는 2~3 인 장면으로 시작하여 점차 7 인까지 점진적으로 복잡도를 높이는 방식으로 학습하여 모델의 안정성을 확보합니다.
3. 주요 기여 (Key Contributions)
2 단계 프레임워크 제안: 공간 계획과 정체성 렌더링을 분리하여 다중 인물 생성의 근본적인 실패 (얼굴 병합 등) 를 해결했습니다.
두 가지 Architect 변형: 언어 기반의 높은 정확도 (Arch-A) 와 2D 기반의 유연한 공간 배치 (Arch-B) 를 모두 지원합니다.
강화 학습 기반 학습: 헝가리안 매칭을 활용한 공간 기반 얼굴 매칭 보상 등을 포함한 복합 보상 구조를 통해, 대규모 실데이터 없이도 고품질 다중 인물 생성이 가능하도록 했습니다.
효율성 개선: 토큰 공유 및 드롭핑 전략을 통해 추론 시간을 2 배 단축하면서도 오버랩 처리 능력을 향상시켰습니다.
성능 입증: 합성 데이터만 사용하여 훈련되었음에도 불구하고, 기존 최첨단 방법론들을 압도하는 성능을 보였습니다.
4. 실험 결과 (Results)
MultiHuman-Testbench 벤치마크에서 Ar2Can 은 다음과 같은 성과를 거두었습니다.
정확도: Architect-A 를 사용할 경우 인물 수 정확도 (Count Accuracy) 가 **90.2%**로 모든 베이스라인을 상회했습니다.
정체성 보존: Architect-B 를 사용할 경우 Multi-ID 점수가 68.2로, 이전 최고 오픈소스 방법 (MH-OmniGen, 54.5) 보다 13.7 포인트 높은 개선을 보였습니다.
통합 점수: 모든 목표를 균형 있게 달성하는 통합 점수 (Unified Metric) 에서도 72.4점을 기록하여 GPT-Image-1, Nanobanana 등 상용 모델 및 오픈소스 모델들을 모두 압도했습니다.
데이터 효율성: 실제 다중 인물 데이터 없이 **합성 데이터 (Synthetic Data)**와 정제된 참조 얼굴만 사용하여 훈련되었음에도 불구하고 최상위 성능을 달성했습니다.
5. 의의 및 결론 (Significance)
Ar2Can 은 다중 인물 생성 분야에서 "공간적 배치"와 "정체성 유지"라는 상충되는 목표를 동시에 달성할 수 있는 새로운 패러다임을 제시했습니다.
모듈형 설계: Architect 와 Artist 를 분리함으로써 속도나 정확도 등 배포 환경에 따라 유연하게 구성할 수 있습니다.
데이터 효율성: 대규모 다중 인물 데이터셋의 부재라는 문제를 합성 데이터와 강화 학습을 통해 우회하여 해결했습니다.
실용성: 복잡한 장면에서도 자연스러운 오버랩 처리와 사실적인 조명, 포즈를 생성하여 실제 응용 (영화, 게임, 광고 등) 에 높은 잠재력을 가집니다.
결론적으로, Ar2Can 은 현재 확산 모델이 가진 다중 인물 생성의 한계를 극복하고, 프롬프트에 명시된 여러 인물의 정체성과 위치를 정확하게 반영하는 고품질 이미지를 생성할 수 있는 강력한 솔루션입니다.