← 최신 논문
💻 computer science

ARMOR++: Agentic Orchestration of a Multi-Domain Primitive Set for Transferable Attacks on Deepfake Detectors

이 논문은 Qwen2.5-VL과 Qwen3를 활용하여 다양한 적대적 프리미티브(adversarial primitives)를 조율함으로써, 엄격한 블랙박스 제약 조건 하에서 기존의 최첨단 방법들보다 딥페이크 탐지기에 대해 현저히 높은 전이성과 공격 성공률을 달성하는 강력한 멀티 에이전트 프레임워크인 ARMOR++를 소개한다.

원저자: Christos Korgialas, Gabriel Lee Jun Rong, Dion Jia Xu Ho, Pai Chet Ng, Xiaoxiao Miao, Konstantinos N. Plataniotis

게시일 2026-07-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Christos Korgialas, Gabriel Lee Jun Rong, Dion Jia Xu Ho, Pai Chet Ng, Xiaoxiao Miao, Konstantinos N. Plataniotis

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷을 누구나 그림을 그릴 수 있는 거대하고 북적이는 미술관이라고 상상해 보세요. 오랫동안, 여러분이 어떤 그림이 진짜인지 아니면 위작인지 알고 싶다면 그저 눈으로 직접 확인하면 되었습니다. 하지만 최근, 인공지능이라는 새로운 종류의 마법 붓이 나타났습니다. 이 붓은 전문가들조차 구별하기 힘들 정도로 완벽하게 얼굴을 그려낼 수 있습니다. 이는 고도의 심리전이 벌어지는 '잡기 놀이(cat and mouse)'를 만들어냈습니다. 한쪽에는 이 마법 붓이 남긴 아주 작고 보이지 않는 결함을 찾아내도록 훈련된 '탐정들'(AI 모델)이 있습니다. 다른 한쪽에는 이 탐정들을 속이려는 '해커들'이 있는데, 이들은 인간의 눈에는 실제 얼굴처럼 보이게 하면서도 탐정에게는 가짜처럼 보이도록 얼굴에 아주 미세한 노이즈를 추가하는 방식을 사용합니다. 이것은 단순히 예술에 관한 문제가 아닙니다. 이것은 신뢰에 관한 문제입니다. 만약 우리가 무엇이 진짜인지 구별할 수 없다면, 우리는 우리의 뉴스, 보안 카메라, 심지어 우리 자신의 눈조차 믿을 수 없게 됩니다. 큰 질문은 이것입니다: 우리의 디지털 탐정들이 정말로 신뢰할 수 있는 것일까요, 아니면 교묘한 속임수에 너무나 쉽게 속아 넘어가는 것일까요?

여기, 이 탐정들을 테스트하기 위해 설계된 새롭고 매우 똑똑한 '해커' 팀인 **ARMOR++**가 등장합니다. 딥페이크 탐지기를 클럽의 보안 요원이라고 생각해 보세요. 어떤 보안 요원은 얼굴의 형태만을 보고(예: 합성곱 신경망, CNN), 다른 보안 요원은 전체적인 그림과 그 조각들이 어떻게 어우러지는지를 봅니다(예: 비전 트랜스포머, ViT). 문제는 한 종류의 보안 요원을 속이는 기술이 다른 종류의 보안 요원에게는 통하지 않을 수도 있다는 점입니다. 이전의 공격 시도들은 벽에 단 한 종류의 돌을 던지는 것과 같았습니다. 때로는 효과가 있었지만, 종종 벽은 너무 단단하거나 다른 재질로 되어 있었습니다.

ARMOR++는 다릅니다. 이 팀은 단순히 돌 하나를 던지는 것이 아니라, 서로 대화하는 전문가 팀을 투입합니다. 이 팀은 두 명의 매우 똑똑한 '요원'(거대 언어 모델 기반의 컴퓨터 프로그램)에 의해 이끌립니다. 첫 번째 요원인 **분석가(Analyst)**는 가짜 얼굴을 살펴보고 흐릿한 가장자리나 이상한 질감 같은 기이한 지점을 찾아낸 뒤, "이곳을 공격해!"라고 말합니다. 두 번째 요원인 **지휘자(Conductor)**는 코치 역할을 합니다. 그는 단순히 하나의 공격 방식만을 선택하는 것이 아니라, 각기 다른 초능력을 가진 다섯 명의 '공격자' 부대를 관리합니다.

  1. 블렌더(The Blender): 모든 곳에 매끄럽고 밀도 높은 노이즈 층을 추가합니다.
  2. 핀처(The Pincher): 보안 요원을 혼란스럽게 하기 위해 몇 개의 특정 픽셀만을 미세하게 조정합니다.
  3. 시프터(The Shifter): 고무판을 늘리는 것처럼 얼굴을 부드럽게 왜곡합니다.
  4. 주파수 마법사(The Frequency Wizard): 인간은 볼 수 없지만 컴퓨터는 볼 수 있는 방식으로 이미지의 '색상'을 바꿉니다(마치 라디오 다이얼을 돌리는 것처럼).
  5. 블록 셔플러(The Block Shuffler): 이미지를 퍼즐 조각처럼 자른 뒤 위치를 바꿉니다.

ARMOR++가 특별한 이유는 대상이 되는 보안 요원에게 도움을 요청하지 않고도 '추측하고 확인하는(guess and check)' 게임을 수행한다는 점입니다. 이 팀은 자신이 내부 구조를 훤히 알고 있는 '연습용 보안 요원들'(대리 모델)을 대상으로 연습합니다. 이들은 다섯 가지 공격자의 다양한 조합을 시험해 보고, 똑똑한 요원들의 지시에 귀를 기울이며, 실시간으로 전략을 수정합니다. 만약 공격이 효과가 없다면, 팀은 포기하지 않습니다. 그들은 규칙을 바꾸고, 다른 종류의 공격 조합을 시도하며, 대상 보안 요원을 완벽하게 속일 수 있는 최적의 조합을 찾을 때까지 계속 나아갑니다.

연구 결과, 이 팀 기반의 접근 방식은 매우 효과적인 것으로 나타났습니다. 방대한 양의 가짜 얼굴 컬렉션(AADD-2025 벤치마크)을 대상으로 테스트했을 때, ARMOR++는 한 번도 본 적 없는 가장 진보된 '맹목적인(blind)' 보안 요들을 저화질 이미지에서 44.3%, 고화질 이미지에서 **32.1%**의 확률로 속여냈습니다. 이를 비교해 보자면, 이전의 최고 팀(ARMOR)은 이들을 약 39.6%와 28.3%의 확률로 속였으며, 일반적인 '단일 공격' 방식은 겨우 20%를 넘기는 수준이었습니다.

연구진은 또한 보안 요원들이 공격에 저항하도록 기본적인 훈련(예: 적대적 훈련)을 받았을 때도 이 속임수들이 여전히 통하는지 확인했습니다. 그럼에도 불구하고 ARMOR++는 약 19.8%의 확률로 보안 요들을 속이는 데 성공한 반면, 다른 방법들은 거의 0%에 가까운 수치를 보였습니다. 이는 우리의 현재 최고의 보안 시스템들조차 이러한 스마트한 다각적 공격에 대해 상당한 '사각지대'를 가지고 있음을 시사합니다. 저자들은 결론적으로, 우리의 탐지기들이 가짜를 찾아내는 능력이 향상되고는 있지만, 생각하고 적응하며 동시에 여러 가지 종류의 속임수를 사용하는 공격자를 상대하기에는 아직 완전히 신뢰하기에 부족하다는 점을 강조합니다. 이것은 하나의 경종입니다: 가짜 제작자와 실제 탐지기 사이의 경주에서, 탐지기들이 아직 해야 할 일이 훨씬 더 많다는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →