← 최신 논문
🤖 AI

FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation

FaithfulFaces 는 포즈 공유 정체성 정렬기와 포즈 변화와 가림이 큰 상황에서도 견고한 얼굴 정체성 일관성을 유지하기 위해 선별된 다양한 데이터셋을 도입함으로써 복잡한 동적 장면에서의 텍스트-비디오 생성 시 정체성 왜곡 문제를 해결하는 새로운 프레임워크입니다.

원저자: Yuanzhi Wang, Xuhua Ren, Jiaxiang Cheng, Bing Ma, Kai Yu, Sen Liang, Wenyue Li, Tianxiang Zheng, Qinglin Lu, Zhen Cui

게시일 2026-05-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yuanzhi Wang, Xuhua Ren, Jiaxiang Cheng, Bing Ma, Kai Yu, Sen Liang, Wenyue Li, Tianxiang Zheng, Qinglin Lu, Zhen Cui

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

특정 인물 (그를 '밥'이라고 부르겠습니다) 이 권투를 하는 짧은 영화를 만들고 싶다고 상상해 보세요. 밥의 사진 한 장만 있고, AI 가 그가 주먹을 날리고, 피하고, 주변을 움직이는 영상을 생성하게 하려고 합니다.

현재 AI 도구의 문제는 마치 기억상실증 환자와 같다는 점입니다. 밥이 머리를 왼쪽으로 돌리면, AI 는 그 각도에서 밥이 어떻게 생겼는지 잊어버립니다. 갑자기 그를 다른 사람으로 바꾸거나, 얼굴이 기괴한 덩어리로 녹아내릴 수 있습니다. 그가 손을 얼굴 앞에 대면 AI 는 당황하여 그의 얼굴 특징을 왜곡합니다.

**"FaithfulFaces"**라는 논문은 이를 해결하기 위해 설계된 새로운 시스템을 소개합니다. 이것이 어떻게 작동하는지 간단히 설명해 드리겠습니다:

1. 핵심 문제: "단일 뷰"의 함정

대부분의 기존 AI 모델은 참조 사진만 보고 "알겠습니다, 밥의 정면 얼굴을 보았습니다"라고 말합니다. 그들은 밥의 얼굴이 회전하고, 기울어지고, 비틀릴 수 있는 3 차원 객체라는 것을 이해하지 못합니다. 영상이 측면 프로필을 요구하면 AI 는 추측을 시도하고, 대개 잘못 추측하여 얼굴이 왜곡됩니다.

2. 해결책: "자세 충실" 번역기

저자들은 FaithfulFaces라는 새로운 프레임워크를 구축했습니다. 이 프레임워크를 사진과 영상 생성기 사이에 있는 초지능 번역기라고 생각하세요.

  • 옛 방식: 번역기는 단순히 "여기 밥의 얼굴이 있습니다"라고 말합니다.
  • FaithfulFaces 방식: 번역기는 "여기 밥의 얼굴이 있고, 그리고 3 차원 공간에서 그의 머리가 어떻게 기울어지고, 회전하며, 돌았는지 정확히 여기 있습니다"라고 말합니다.

3. 작동 원리: "자세 사전"

FaithfulFaces 의 핵심 비법은 Pose-Shared Identity Aligner라는 구성 요소입니다.

거대한 도서관 (사전) 이 카드들로 가득 차 있다고 상상해 보세요.

  • 옛 도서관: "밥의 얼굴"에 대한 카드는 있었지만 "왼쪽으로 돌린 밥의 얼굴"이나 "위로 올려다보는 밥의 얼굴"에 대한 카드는 없었습니다.
  • FaithfulFaces 도서관: 특별한 자세 사전이 있습니다. 밥이 왼쪽, 오른쪽, 위, 아래를 바라보든 "밥의 얼굴"은 같은 사람이라는 것을 학습합니다.

시스템이 사진을 보면 픽셀을 단순히 복사하지 않습니다. 대신:

  1. 자세 측정: 머리의 정확한 각도를 계산합니다 (기울기를 측정하기 위해 3 차원 각도기를 사용하는 것처럼).
  2. 사전 참조: 그 특정 각도에서 "밥"이 어떻게 보여야 하는지 찾아봅니다.
  3. 정체성 정렬: 각도가 변하더라도 얼굴의 "영혼" (정체성) 이 일관되게 유지되도록 보장합니다.

4. "훈련 체육관"

이 시스템을 가르치기 위해 연구자들은 무작위 영상만 사용할 수 없었습니다. 사람들이 머리를 격렬하게 움직이는 영상이 필요했습니다.

  • 그들은 수천 개의 영상을 찾아낸 특수 데이터셋 파이프라인 (공장 라인) 을 구축했습니다.
  • 사람들이 가만히 서 있는 지루한 영상을 걸러냈습니다.
  • 사람들이 권투를 하거나, 춤을 추거나, 머리를 크게 돌리는 영상만 남겼습니다.
  • AI 가 학습할 수 있도록 이러한 "야생 운동" 영상을 공급했습니다: "알겠습니다, 머리가 90 도 회전하면 코는 여기로 이동하지만, 눈은 여전히 밥처럼 보입니다."

5. 결과: 충실한 배우

테스트에서 그들은 AI 에게 주먹을 날리고 손으로 얼굴을 가리는 등 빠른 머리 움직임이 많은 권투 장면의 영상을 생성하도록 요청했습니다.

  • 경쟁자들 (Kling 또는 ConsisID 등): 권투 선수가 머리를 돌리면 얼굴이 변형되거나 다른 사람처럼 보이거나 모양을 잃었습니다.
  • FaithfulFaces: 권투 선수가 주먹을 날리거나, 피하거나, 위로 올려다볼 때도 같은 사람으로 보이며 선명한 특징을 유지했습니다.

요약 비유

현재 AI 로 영상을 만드는 것이 단일 사진에서 사람을 그리고 측면에서 어떻게 생겼는지 추측하는 것 (종종 만화처럼 비틀린 결과물을 낳음) 이라면, FaithfulFaces는 사람의 얼굴이 어떻게 만들어졌는지 정확히 아는 3 차원 조각가를 가진 것과 같습니다. 사람이 어떻게 움직이든 조각가는 점토가 올바른 모양과 정체성을 유지하도록 보장합니다.

이 논문은 이 방법이 복잡하고 역동적인 행동을 할 때도 사람의 얼굴이 사실적이고 일관되게 보이도록 하는 데 가장 뛰어나다고 주장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →