← 최신 논문
💻 computer science

DiffSwap++: 3D Latent-Controlled Diffusion for Identity-Preserving Face Swapping

DiffSwap++는 3D 얼굴 구조를 활용하여 정체성을 포즈 및 표정과 분리함으로써 얼굴 교체 시 정체성 보존과 기하학적 일관성을 향상시키는 새로운 3D 잠재 제어 확산 프레임워크이며, 여러 벤치마크에서 기존 방식들을 능가합니다.

원저자: Weston Bondurant, Arkaprava Sinha, Hieu Le, Srijan Das, Stephanie Schuckers

게시일 2026-08-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Weston Bondurant, Arkaprava Sinha, Hieu Le, Srijan Das, Stephanie Schuckers

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

디지털 이미지 처리 분야에서 한 사람의 얼굴을 다른 사람의 몸에 합성하는 능력은 예술과 복잡한 수학을 결합하며 오랫동안 매혹적인 주제였습니다. 수년 동안 이러한 이미지를 만드는 데 사용된 도구들은 생성적 적대 신경망(GAN)이라 불리는 일종의 인공지능에 의존해 왔습니다. 이 시스템은 두 명의 경쟁하는 예술가처럼 작동합니다. 한 명은 가짜 이미지를 만들려고 노력하고, 다른 한 명은 그 위조품을 찾아내려고 노력합니다. 시간이 흐르면서 이 경쟁은 창작자가 믿기 힘들 정도로 숙련되도록 강제합니다. 하지만 이 과정은 매우 불안정하여, 종종 인간의 눈이 쉽게 알아챌 수 있는 흐릿한 특징이나 이상한 왜곡이 있는, 어딘가 어색해 보이는 이미지를 만들어내곤 합니다. 최근에는 확산(diffusion)이라는 다른 방식이 등장했습니다. 경쟁 게임 대신, 확산 모델은 조각가가 돌덩이를 천천히 다듬으며 노이즈를 점진적으로 제거하여 선명한 그림을 드러내는 과정처럼 작동합니다. 이 새로운 모델들은 더 선명한 이미지를 만들어내지만, 여전히 특정한 문제로 어려움을 겪습니다. 바로 사람이 새로운 포즈나 표정을 취할 때 그 사람의 진정한 정체성을 온전히 유지하는 것입니다. 얼굴의 3차원 구조에 대한 깊은 이해 없이는, 컴퓨터가 사람의 고유한 특징을 머리의 각도나 미소의 형태와 혼동하기 때문에, 결과물이 매우 사실적이더라도 엉뚱한 사람처럼 보이게 됩니다.

노스캐롤라이나 대학교 샬럿 캠퍼스의 연구팀은 이 특정한 난제를 해결하기 위해 DiffSwap++라고 불리는 새로운 방법을 개발했습니다. 그들의 연구는 최종 이미지가 평면적인 2차원임에도 불구하고, 컴퓨터가 얼굴의 보이지 않는 3차원 골격을 이해하도록 가르치는 데 중점을 둡니다. 연구진은 얼굴을 완벽하게 합성하려면 시스템이 정면에서 얼굴이 어떻게 보이는지뿐만 아니라, 특징들이 공간 속에 어떻게 배치되어 있는지도 알아야 한다는 점을 깨달았습니다. 이를 달성하기 위해, 그들은 얼굴의 깊이와 부피를 포착하는 특수한 종류의 디지털 지도를 사용하여 모델을 훈련시켰습니다. 훈련 단계에서 컴퓨터는 평면 사진을 이 3차원 공간으로 투영하는 법을 배우며, 표준 이미지로 다시 변환하기 전에 기저에 깔린 구조를 분석합니다. 이 과정은 모델이 사람의 정체성(고유한 골격 구조와 피부 질감)을 포즈나 표정(그 구조의 일시적인 위치)으로부터 분리할 수 있게 해줍니다.

혁신은 이 3차원 지식이 사용되는 방식에 있습니다. 연구진은 컴퓨터가 얼굴을 합성할 때마다 완전한 3D 모델을 구축하도록 요구하지 않습니다. 대신, 시스템이 학습하는 동안에만 3D 정보를 사용합니다. 일단 훈련이 완료되면, 모델은 오직 표준 2D 이미지만을 사용하여 합성을 수행할 수 있으므로 과정이 빠르고 실용적입니다. 시스템은 한 사람의 소스 이미지와 다른 포즈를 취하고 있는 다른 사람의 타겟 이미지를 가져옵니다. 그런 다음 3차원 훈련으로부터 배운 교훈을 사용하여 타겟의 얼굴을 재구성하되, 타겟의 머리 각도와 얼굴 표정을 엄격하게 유지하면서 소스 인물의 특징으로 교체합니다. 이를 통해 최종 이미지는 단순히 다른 얼굴 위에 스티커를 붙여 놓은 것이 아니라, 소스 인물이 그 장면에 자연스럽게 존재하는 것처럼 보이게 합니다.

그들의 방법이 실제로 효과가 있는지 테스트하기 위해, 연구진은 실제 사람들의 고품질 초상화가 담긴 공공 데이터셋에서 추출한 수천 장의 이미지를 사용하여 광범위한 실험을 수행했습니다. 그들은 자신들의 새로운 시스템을 기존의 가장 뛰어난 방법들, 즉 오래된 GAN 기반 도구와 최신 확산 모델을 모두 포함하여 비교했습니다. 결과는 Diff-Swap++의 명확한 우위를 보여주었습니다. 연구진이 합성된 얼굴이 원래 인물의 정체성을 얼마나 잘 유지하는지 측정했을 때, 그들의 방법은 이전의 어떤 접근 방식보다 일관되게 높은 점수를 기록했습니다. 합성된 얼굴이 생체 인식 시스템을 속일 수 있는지 확인하기 위한 테스트에서, DiffSwap++는 경쟁 모델들보다 소스의 정체성을 보존하는 데 훨씬 더 성공적이었습니다. 동시에, 타겟의 포즈나 표정을 자연스럽게 유지하는 데 있어서도 희생이 없었습니다. 다른 방법들은 종종 얼굴이 약간 왜곡되거나 정체성을 완전히 전달하지 못하는 경우가 많았지만, Diff-Swap++는 매우 사실적이면서도 원래 인물에게 충실한 이미지를 만들어냈습니다.

연구팀은 또한 인간 자원봉사자들을 대상으로 연구를 진행하여, 육안으로 보기에 이미지가 얼마나 설득력 있는지 조사했습니다. 참가자들은 합성된 얼굴 세트를 보고 정체성, 표정, 포즈가 얼마나 잘 보존되었는지 평가하도록 요청받았습니다. 결과는 컴퓨터의 측정치가 시사하는 바를 확인해주었습니다. 사람들은 DiffSwap++가 만든 이미지가 가장 현실적이고 설득력 있다고 판단했습니다. 얼굴은 자연스러웠으며, 디지털 조작을 드러내는 데 흔히 쓰이는 이상한 아티팩트나 부자연스러운 혼합이 없었습니다. 반면, 다른 방법들은 때때로 움푹 들어간 눈이나 입 주변의 불규칙한 질감과 같이 위조의 흔적을 남기기도 했습니다. 3차원 구조적 인식을 학습 과정에 통합함으로써, 연구진은 시각적으로 매우 뛰어나면서도 정체성 보존 측면에서 과학적으로 견고한 얼굴 합성을 구현할 수 있음을 입증했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →