← 최신 논문
🤖 AI

DiffAttack: Evasion Attacks Against Face Recognition via Latent Diffusion Models

이 논문은 잠재 확산 모델(latent diffusion models)을 활용하여 기존 방식보다 훨씬 높은 공격 성공률과 전이성을 가지면서도, 딥 페이스 인식 시스템을 성공적으로 회피하는 고품질의 비가시적 얼굴 이미지를 생성하는 새로운 적대적 프레임워크인 DiffAttack을 소개한다.

원저자: Omid Ahmadieh, Nima Karimian

게시일 2026-08-03
📖 1 분 읽기☕ 가벼운 읽기

원저자: Omid Ahmadieh, Nima Karimian

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

기술 요약: DiffAttack

문제 정의

딥 페이스 인식(FR) 시스템은 인증 및 감시 분야에서 효과적이지만, 결정 경계(decision boundaries)가 매우 좁아 적대적 공격에 취약할 수 있습니다. 안면 생체 인식을 대상으로 하는 기존의 적대적 방법들은 다음과 같은 상당한 한계에 직면해 있습니다:

  • 노이즈 기반 공격: 종종 눈에 띄지 않지만, 실제 환경의 변화(예: 조명 변화)에 대한 강건성이 부족하며 서로 다른 모델 간의 전이성(transferability)이 낮습니다.
  • 패치 기반 공격: 눈에 띄는 시각적 아티팩트(artifacts)를 유발하여 은밀성을 저해하며, 자연스러운 이미지 공유에는 부적합합니다.
  • 시맨틱/메이크업 기반 공격: 지각적 품질은 개선되지만, 고정된 참조 이미지, 수동적인 시맨틱 단서, 또는 인구통계학적 편향을 초래하고 일반화를 제한하는 대규모 메이크업 데이터셋에 의존하는 경우가 많습니다.
  • GAN 기반 접근 방식: 새로운 타겟 정체성에 대해 재학습이 필요하며, GAN의 생성 매니폴드(generative manifold)에 의해 제약을 받습니다.
  • 기존 확산 모델(Diffusion) 기반 방법: DiffAM 또는 Adv-Diffusion과 같은 접근 방식은 반복적인 최적화, 타겟 특화 재학습, 또는 경직된 휴리스틱 마스크에 의존하여 경계 아티팩트와 효율성 저하를 초래합니다.

핵심 과제는 **사진처럼 사실적(photorealistic)**이고, 타겟과 **정체성이 일치(identity-aligned)**하며, 인간 관찰자에게는 인지되지 않는(imperceptible) 적대적 얼굴을 생성하는 동시에, 다양한 미학습 블랙박스 FR 시스템에 대해 높은 **전이성(transferability)**을 유지하는 것입니다.

방법론: DiffAttack

저자들은 고정된 잠재 확산 모델(특히 Stable Diffusion v2.1)을 사용하여 **잠재 공간 최적화(latent-space optimization)**를 통해 적대적 생성을 수행하는 새로운 프레임워크인 DiffAttack을 제안합니다.

핵심 구조 및 프로세스

  1. 잠재 인코딩(Latent Encoding): 깨끗한 소스 이미지(xsrcx_{src})는 고정된 VAE 인코더를 사용하여 잠재 표현(zsrcz_{src})으로 인코딩됩니다.
  2. 노이즈 주입(Noise Injection): 특정 타임스텝 tt에서 고정된 양의 가우시안 노이즈를 추가하여 U-Net 백본을 위한 노이즈가 섞인 잠재 입력을 생성합니다.
  3. LoRA 증강 U-Net(LoRA-Augmented U-Net): 거대한 U-Net 파라미터를 미세 조정하는 대신, 프레임워크는 교차 주의(cross-attention) 레이어(Q, K, V 투영)에 저차원 적응(LoRA) 어댑터를 주입합니다. 이 경량화되고 학습 가능한 행렬들은 확산 과정을 타겟 정체성 임베딩 방향으로 유도하도록 최적화됩니다.
  4. 최적화 루프(Optimization Loop):
    • U-Net은 노이즈를 예측하여 깨끗한 잠재값(x0x_0)을 재구성합니다.
    • 잠재값은 디코딩되어 픽셀 공간에서 적대적 얼굴을 생성합니다.
    • 다중 소스 피드백(Multi-Source Feedback): 생성된 얼굴은 정체성 거리를 계산하기 위해 앙상블 형태의 고정된 FR 모델들(IR152, IRSE50, MobileFace)을 통과합니다.
    • 그래디언트 역전파(Gradient Backpropagation): FR 모델들로부터의 그래디언트는 오로지 LoRA 가중치에만 역전파되어, 소스가 타겟으로 오인될 때까지 적대적 특징을 반복적으로 정교화합니다.

손실 함수(Loss Function)

최적화 과정은 통합된 다목적 손실(LtotalL_{total})을 최소화합니다:

  • 앙상블 정체성 손실(LidL_{id}): 코사인 유사도 힌지(cosine similarity hinge)를 사용하여 생성된 임베딩을 타겟 임베딩 쪽으로 밀어냅니다.
  • 방향성 가이드(LdirL_{dir}): 잠재값의 변화가 표면적인 지름길이 아닌 시맨틱 정체성 궤적(소스 \to 타겟)을 따르도록 보장합니다.
  • 소스 억제(LsrcL_{src}): 원래의 소스 정체성으로 다시 돌아가는 것을 방지하기 위해 옵티마이저에 페널티를 부여합니다.

글로벌 조화(Global Harmonization)

경직된 세그멘테이션 마스크나 국소적 블렌딩을 사용하는 방법과 달리, DiffAttack은 전체 이미지 잠재 표현을 최적화합니다. 이를 통해 확산 모델의 생성적 사전 지식(generative priors)이 정체성 변화를 원래의 배경, 조명 및 주변 속성과 자연스럽게 조화시켜 경계 헤일로(halo) 현상을 제거하고 사진적 사실성을 보장합니다.

주요 기여

  1. 새로운 잠재 공간 회피 프레임워크: LoRA 증강 교차 주의 레이어를 사용하여 잠재 공간에서 최적화를 수행하는 통합 파이프라인을 제공합니다. 이는 픽셀 공간 노이즈의 눈에 띄는 아티팩트를 피하고 전체 미세 조정에 비해 계산 오버헤드를 줄입니다.
  2. 블랙박스 전이성: 다양한 대리(surrogate) FR 백본(IR152, IRSE50, MobileFace)으로부터의 화이트박스 피드백을 활용하는 다중 소스 최적화 전략을 사용합니다. 이 방법은 내부 파라미터에 접근하지 않고도 미학습 타겟(예: FaceNet)에 일반화되는 적대적 시맨틱을 주입합니다.
  3. 글로벌 잠재 조화: 국소적 마스크 대신 전체 잠재 공간에 걸쳐 적대적 신호를 최적화함으로써, 정체성 변화가 주변 맥락과 매끄럽게 통합되도록 하여 경계 아티팩트를 방지합니다.
  4. 최첨단 성능: FFHQ 및 CelebA-HQ 데이터셋에 대한 광범적인 평가를 통해 기존의 노이즈 기반, 메이크업 기반, 시맨틱 기반 방법보다 우수한 성능을 입증했습니다.

실험 결과

프레임워크는 엄격한 블랙박스 설정 하에 FFHQCelebA-HQ 데이터셋에서 평가되었습니다.

  • 공격 성공률(ASR): DiffAttack은 여러 FR 모델에 대해 새로운 SOTA 평균 ASR인 **84.86%**를 달 achieved했습니다.
    • 기존 노이즈 기반 방법보다 15.28% 이상, 시맨틱 기반 접근 방식보다 약 5.21% 높은 성능을 보였습니다.
    • MobileFace(95.03%) 및 IRSE50(94.24%)에 대해 높은 성공률이 관찰되었습니다.
    • 블랙박스 타겟으로 FaceNet을 공격할 때, 대리 앙상블은 IR152, IRSE50, MobileFace로 구성되었습니다. 반대로 MobileFace를 공격할 때, 대리 앙상블은 FaceNet, IRSE50, IR152로 구성되었습니다.
  • 지각적 품질:
    • SSIM: 0.961을 달성하여 소스와 높은 구조적 유사성을 보였습니다.
    • PSNR: 24.54 dB로, 미세하게 삽입된 섭동(perturbations)을 보여줍니다.
    • FID: 27.58로, 생성된 이미지가 자연스러운 이미지 매니폴드 내에 있음을 나타냅와.
  • 시각적 비교: "고스팅(ghosting)" 현상을 일으키는 노이즈 기반 방법이나 인위적으로 보이는 메이크업 기반 방법과 달리, DiffAttack은 소스의 원래 질감, 표정, 조명을 보존합니다. 그림 1에서 정체성 정렬을 보여주기 위해 Face++ 점수가 사용되었으나, 공식적인 평가는 IR152, IRSE50, MobileFace, FaceNet 모델에 기반한 측정 지표를 따릅니다.

의의 및 주장

본 논문은 LoRA를 이용한 잠재 공간 최적화가 인간 관찰자에게는 시각적으로 구별 불가능하면서도 블랙박스 시스템에 대해 매우 효과적인 적대적 예제를 생성할 수 있음을 입증함으로써, 생체 인식 보안 평가의 중요한 진전을 이루었다고 주장합니다.

저자들은 본 연구가 방어적 보안 분석 및 개인정보 보호를 목적으로 함을 강조합니다. 이러한 취약점을 밝힘으로써, 생성형 AI 위협에 대응할 수 있는 더욱 강력한 생체 인식 검증 시스템 개발에 정보를 제공하고자 합니다. 본 연구는 공개 연구 데이터셋만을 사용하며, 개인 사칭을 위한 특정 사전 학습된 가중치를 공개하지 않는 등 윤리 지침을 엄격히 준수합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →