← 최신 논문
💻 computer science

Beyond Facial Consistency: Personalized Person Image Generation with Holistic Identity Preservation

이 논문은 개인화된 인물 이미지 생성에서 얼굴의 충실도와 전반적인 외형 일관성 사이의 절충 문제를 해결하기 위해 동적 균형 스케일링(Dynamic Balancing Scaling, DBS) 전략으로 강화된 이중 분기 프레임워크를 소개하며, 이와 함께 총체적인 정체성 평가를 위한 Pexels-100 벤치마크를 공개한다.

원저자: Yuxuan Xiao, Shanshan Zhang, Jian Yang, Shengcai Liao

게시일 2026-07-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yuxuan Xiao, Shanshan Zhang, Jian Yang, Shengcai Liao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 영화 스튜디오의 감독이라고 상상해 보세요. 하지만 배우를 고용하는 대신, 당신에게는 당신이 묘사하는 어떤 캐릭터든 불러낼 수 있는 마법의 카메라가 있습니다. 당신은 당신의 절친한 친구와 똑같이 생긴—그 특유의 미소, 눈매, 개성 있는 코까지도—우주복을 입고 화성에 있거나, 혹은 중세 시대의 숲에서 용을 타고 있는 영웅을 원합니다. 이것이 바로 '개인화된 이미지 생성(personalized image generation)'의 꿈입니다. 오랫동안 AI 아티스트들은 두 가지 좌절스러운 선택지 중 하나를 골라야 했습니다. 캐릭터의 얼굴은 친구와 똑같이 만들되 옷차로 무엇을 입었는지나 체형은 잊어버리거나, 혹은 완벽한 의상과 포즈를 입히되 결국 낯선 사람의 얼굴을 얻게 되는 것이었습니다. 그것은 마치 케이크를 굽는데 프로스팅(크림)을 완벽하게 만들거나 스펀지 시트를 완벽하게 만들 수는 있지만, 동시에 둘 다 완벽하게 할 수는 없는 것과 같았습니다. 이 논문은 인공지능의 바로 그 구체적인 영역을 파고들어, AI에게 새로운 상황에 놓아달라고 요청했을 때 한 사람의 '전체적인 모습(whole self)'—즉, 얼굴뿐만 아니라 의상과 분위기 전체—를 어떻게 일관되게 유지할 것인가라는 까다로운 문제를 다룹니다.

샤오 위쉬안(Yuxuan Xiao)과 동료들이 이끄는 연구진은 어느 한 쪽의 편을 드는 것을 그만두기로 했습니다. 그들은 먼저 '나이브 듀얼 브랜치(Naive Dual-Branch)' 시스템을 구축했는데, 이는 본질적으로 AI를 위한 2차선 고속도로와 같습니다. 한 차선은 큰 그림(옷, 체형, 헤어스타일)에 집중하고, 다른 차선은 얼굴의 아주 세밀한 부분까지 확대하여 봅니다. 그들은 이 2차선 방식이 좋은 시작이었지만, 다소 혼란스러웠다는 것을 발견했습니다. '얼굴 차선'은 너무 빠르게 달려서 자동차 전체를 장악해 버리는 반면, '외형 차선'은 백미러 속에서 길을 잃고 있었습니다. 그 결과는 어땠을까요? 얼굴은 훌륭했지만, 옷은 때때로 이상한 것으로 변형되거나 체형이 찌그러지기도 했습니다.

이 교통 체증을 해결하기 위해, 팀은 **동적 균형 스케일링(Dynamic Balancing Scaling, DBS)**이라는 영리한 교통 제어 시스템을 발명했습니다. 이것은 마치 오케스트라의 스마트한 지휘자와 같습니다. 지휘자는 두 가지 주요 기술을 사용합니다. 첫째, 그들은 **적응형 시간 게이팅(Adaptive Temporal Gating)**을 사용하는데, 이는 곡의 흐름에 따라 얼굴과 몸이라는 연주자들의 볼륨을 조절하는 디머 스위치와 같습니다. 프로세스 초기에는 지휘자가 정체성을 설정하기 위해 얼굴이 안정적이고 신뢰할 수 있는 선율을 연주하도록 허용할 수 있지만, 곡이 진행됨에 따라 몸과 옷이 묻히지 않도록 부드럽게 볼륨을 높여줍니다. 둘째, 그들은 **영역 인식 최적화(Region-Aware Optimization)**를 도입했습니다. AI가 그림을 그리고 있다고 가정할 때, 보통은 캔버스 전체에 동일한 붓 압력을 가합니다. 이 새로운 기술은 AI에게 "이봐, 얼굴을 그릴 때는 매우 주의 깊고 정밀하게 그려야 하지만, 옷과 배경에도 똑같은 주의를 기울이는 것을 잊지 마"라고 말해줍니다. 이를 통해 AI가 눈에만 집착하느라 셔츠를 무시하는 일이 없도록 보장합니다.

팀은 이들이 직접 만든 Pexels-100이라는 맞춤형 벤치마크를 통해 새로운 방법을 테스트했습니다. 이 벤치마크는 다양한 장면 속에서도 사람의 정체성을 얼마나 잘 유지하는지 확인하기 위해 100개의 서로 다른 전신 이미지를 포함하고 있습니다. 결과는 유망했습니다. 그들의 방식은 다른 오픈 소스 도구들보다 훨씬 더 나은 균형을 잡으며, 얼굴을 알아볼 수 있게 유지하면서도 옷과 몸이 제대로 보이도록 만들었습니다. 실제로 그들의 접근 방식은 성능이 매우 뛰어나서 일부 값비싼 폐쇄형 상용 시스템과도 견줄 만했습니다. 하지만 저자들은 이것이 아직 모든 문제를 해결하는 마법 지팡이는 아니라는 점을 주의 깊게 언급합니다. 만약 AI에게 복잡한 체조 공중제비를 돌거나 정교한 손 동작을 하는 사람을 그리라고 요청한다면, 기초가 되는 AI 모델이 여전히 까다로운 물리적 구조를 다루는 데 어려움을 겪고 있기 때문에 이미지가 여전히 약간 흔들리거나 왜곡될 수 있습니다. 하지만 대부분의 일상적인 시나리오에서, 이 새로운 '지휘자'는 AI가 마침내 조화롭게 노래하며, 단지 얼굴뿐만 아니라 그 사람 전체가 자기 자신처럼 보이도록 돕습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →