← 최신 논문
💻 computer science

Agent-Driven Multi-View Facial Prior Learning for Identity-Preserving Pose-Guided Generation

본 논문은 기존 방식들이 어려움을 겪는 큰 포즈 변화 상황에서도 얼굴의 정체성과 세밀한 디테일을 효과적으로 보존하기 위해, Identity Prior Extractor와 Multimodal Identity Converter를 특징으로 하는 에이전트 주도형 프레임워크인 ADF-Pose를 제안한다.

원저자: Zhaoyang Liu, Luosi Yan, Mubai Li, Xu Zheng, Haotian Yang

게시일 2026-08-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhaoyang Liu, Luosi Yan, Mubai Li, Xu Zheng, Haotian Yang

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

친구의 사진을 찍으려는데, 친구에게 고개를 돌려달라고 요청하는 대신 컴퓨터에게 그 사람이 다른 방향을 보고 있다면 어떤 모습일지 상상해 보라고 요청하는 상황을 상상해 보십시오. 목표는 그 사람의 고유한 얼굴, 턱의 모양, 피부의 질감을 그대로 유지하면서 새로운 포즈를 취한 모습과 똑같이 보이는 새로운 사진을 만드는 것입니다. 이것이 바로 포즈 유도 이미지 생성(pose-guided image generation)의 과제입니다. 수년 동안 컴퓨터는 사람의 몸을 움직여서 새로운 자세에 맞춰 팔과 다리를 이동시키는 일에는 꽤 능숙해졌습니다. 하지만 컴퓨터가 머리를 돌리려고 하면 결과물이 어색하게 느껴지는 경우가 많습니다. 얼굴이 특유의 형태를 잃거나, 눈 사이의 간격이 벌어지거나, 피부가 매끄러운 플라스틱 가면처럼 보일 수도 있습니다. 컴퓨터는 보통 사람 전체를 하나의 커다란 그림으로 보기 때문에, 특히 얼굴이 카메라로부터 돌아갔을 때 그 사람을 정말로 독특하게 만드는 작고 결정적인 세부 사항들을 놓치기 때문에 어려움을 겪습니다.

한 연구팀은 이 문제를 해결하기 위해, 얼굴을 전례 없는 수준의 정성으로 다루는 새로운 접근 방식을 개발했습니다. 이들의 시스템은 새로운 각도에서 얼굴이 어떻게 보일지에 대한 단일하고 흐릿한 추측에 의존하는 대신, 여러 관점에서 인물의 얼굴에 대한 상세한 정신적 모델을 구축합니다. 그들은 이 방법을 ADF-Pose라고 부릅니다. 이 방식은 먼저 원본 사진에서 얼굴을 분리한 다음, 스마트하고 자동화된 조수를 사용하여 얼굴의 보이지 않는 측면을 상상하도록 합니다. 만약 사진 속 인물이 약간 왼쪽을 보고 있다면, 시스템은 단순히 오른쪽이 어떻게 보일지 추측하는 데 그치지 않고, 코, 입, 턱선이 여전히 동일 인물에게 속하는지 확인하며 논리적이고 검증된 버전의 측면을 구축합니다. 이 과정은 정면, 좌측, 우측의 검증된 청사진인 '안면 사전 지식(facial priors)' 세트를 생성합니다.

이 청사진들이 준비되면, 시스템은 이를 인물의 얼굴 특징에 대한 서술형 설명과 결합합니다. 그런 다음 이 결합된 정보를 아무것도 없는 상태에서부터 사실적인 이미지를 만들어내는 데 탁월한 인공지능인 강력한 이미지 생성기에 입력합니다. 생성기는 초기의 거친 스케치부터 최종적인 피부 질감의 미세 조정 단계에 이르기까지 모든 단계에서 이 상세한 청사진과 설명을 사용합니다. 이를 통해 인물의 정체성이 고정되어, 몸이 움직임에 따라 얼굴이 변하거나 형태가 틀어지는 것을 방지합니다. 연구진은 패션 및 거리 사진 이미지의 대규모 컬렉션을 사용하여 이 방법을 테스트하며 기존의 최신 기술들과 비교했습니다. 그 결과, 그들의 시스템은 얼굴이 카메라 쪽으로 급격히 돌아갔을 때조차 원래의 인물과 닮게 유지하는 데 있어 훨씬 더 뛰어난 성능을 보였습니다.

결과는 인물의 정체성을 보존하는 데 있어 명확한 개선을 보여주었습니다. 패션 이미지 데이터셋을 이용한 테스트에서, 이 새로운 방법은 안면 유사도 점수 0.312를 기록하며 기존 최고 점수인 0.275에서 눈에 띄는 도약을 이루었습니다. 또한, 선두적인 대안 기술들에 비해 얼굴 질감의 흐릿함을 약 7.4% 줄이며 더 선명한 세부 묘사를 만들어냈습니다. 이미지를 나란히 놓고 비교해 보면 그 차이는 극명합니다. 기존의 방식들은 그럴듯하지만 일반적인 얼굴을 만들어내며 이목구비가 부드러워지거나 비율이 약간 어긋나곤 했습니다. 그러나 새로운 시스템은 인물이 측면을 보고 있을 때조차 턱의 구체적인 윤곽, 눈의 정확한 간격, 입 주변의 미세한 선들을 그대로 유지했습니다. 시스템은 의복과 자세를 자연스럽게 유지하면서도 이러한 세부 사항들을 놓치지 않고 관리했습니다.

연구진은 어떤 부분이 가장 큰 역할을 하는지 이해하기 위해 시스템을 세분화하여 분석했습니다. 그들은 시스템이 얼굴의 누락된 뷰를 구축하고 검증하는 단계가 가장 결정적이라는 것을 발견했습니다. 이 단계가 없다면 얼굴은 고유한 형태를 잃게 됩니다. 두 번째로 중요한 부분은 시스템이 시각적 청사진과 서술형 설명을 결합하여, 컴퓨터가 얼굴이 어떻게 생겼는지뿐만 아니라 그 특징들이 서로 어떻게 관계를 맺고 있는지 이해하도록 하는 방식이었습니다. 마지막으로, 이 정보를 이미지 생성 과정의 모든 단계에 주입하는 방식은 이미지가 선명해짐에 따라 정체성 세부 사항이 소실되지 않도록 보장했습니다. 이 시스템이 완벽하지는 않으며, 원래의 얼굴이 심하게 가려져 있거나 너무 작아서 명확히 볼 수 없는 경우에는 여전히 어려움을 겪을 수 있지만, 이는 중요한 진전입니다. 이는 단순히 픽셀을 옮기는 수준을 넘어 인간 얼굴의 복잡하고 고유한 기하학적 구조를 이해하고 보존함으로써, 컴퓨터가 자신이 표현하고자 하는 인물과 정말로 닮은 새로운 포즈를 생성할 수 있게 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →