← 최신 논문
💻 computer science

Shared Vulnerabilities in Robustness-Optimized Defenses: One Breach Exposes the Family

이 논문은 적대적 훈련 및 정화 기법을 포함한 강건성 최적화 방어 기법들이 하나의 대표적인 방어를 무너뜨리는 것이 전체 계열을 위협할 수 있는 내재적 취약성을 공유한다는 점을 밝히며, 이러한 위험은 특수한 공격 설계 없이도 높은 전이 성공률을 입증하는 새로운 PGDTransfer 공격과 적대적 민감도 맵(Adversarial Sensitivity Maps)에 의해 정량화된다.

원저자: Hanrui Wang, Ruihao Zheng, Shuo Wang, Isao Echizen, Xingbo Dong, Zhe Jin

게시일 2026-07-22
📖 5 분 읽기🧠 심층 분석

원저자: Hanrui Wang, Ruihao Zheng, Shuo Wang, Isao Echizen, Xingbo Dong, Zhe Jin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 스마트폰, 자동차, 심지어 의료 기기까지도 초지능형 AI 두뇌에 의해 구동되는 세상을 상상해 보세요. 이 두뇌들은 얼굴을 인식하거나 X-레이를 판독하는 데 매우 뛰어나지만, 한 가지 비밀스러운 약점을 가지고 있습니다. 바로 사진 속의 아주 미세하고 거의 보이지 않는 얼룩이 그들을 완전히 다른 것으로 착각하게 만들 수 있다는 점입니다. 이는 마치 자율주행 자동차가 정지 표지판에 찍힌 아주 작은 점 하나 때문에 그것을 속도 제한 표지판으로 오해하게 만드는 것과 같습니다. 이를 막기 위해 과학자들은 이 AI 두뇌들을 위한 '보디가드'를 구축했습니다. 어떤 보디가드들은 AI에게 수천 장의 까다로운 사진을 보여주며 강인하게 훈련시키고(적대적 훈련, Adversarial Training), 또 다른 보디가드들은 AI가 사진을 보기 전에 깨끗하게 정화하는 필터 역할을 합니다(적대적 정화, Adversarial Purification). 모두는 이 보디가드들이 AI를 무적의 상태로 만들어 주기를 희망합니다. 하지만 만약 이 보디가드들이 겉모습은 달라도 사실 같은 비밀 유니폼을 입고 있다면 어떨까요? 만약 이들 중 하나를 뚫는 것이 우연히 다른 모든 보디가드를 무너뜨릴 수 있는 열쇠를 악당들에게 쥐여주는 결과가 된다면 어떻게 될까요?

이것이 바로 한루이 왕(Hanrui Wang)과 그의 팀이 새로운 논문에서 발견한 무서운 사실입니다. 그들은 서로 다른 AI 방어 체계들이 '강건함(robust)'을 갖추도록 최적화될 때, 의도치 않게 동일한 숨겨진 약점을 공유하게 된다는 것을 발견했습니다. 이는 마치 모든 훈련을 같은 도장에서 받은 슈퍼히어로 가족과 같습니다. 만약 악당이 한 명의 기술을 파훼하는 법을 알아낸다면, 그들은 다른 멤버들의 개별적인 움직임을 배울 필요도 없이 가족 전체를 물리칠 수 있게 됩니다. 연구진은 단순히 추측한 것이 아니라, 'PGDTransfer'라고 불리는 단순하고 영리한 테스트와 '적대적 민감도 맵(Adversarial Sensitivity Maps)'이라는 특별한 지도를 구축하여 이를 증명했습니다. 그들은 한 종류의 '정화' 방어 체계를 무너뜨리면, 그 공격이 다른 거의 모든 정화 방어 체계에도 통하며, 일부 경우에는 성공률이 80%가 넘는다는 것을 발견했습니다. 이는 AI를 더 강하게 만드는 것만으로는 충분하지 않으며, 서로 다른 방어 체계들이 동일한 비밀스러운 틈새를 공유하지 않도록 만들어야 함을 시사합니다.

가족의 비밀: 하나의 침투, 모두의 노출

AI 방어 체계를 첨단 기술 잠금장치 브랜드라고 생각해 보세요. 어떤 잠금장치는 지문 스캐너를 사용하고, 어떤 것은 망막 스캔을, 또 어떤 것은 음성 코드를 사용합니다. 당신은 지문 잠금장치를 뚫었다고 해서 망막 스캔 잠금장치까지 열 수는 없을 것이라 생각할 것입니다. 하지만 이 논문은 반전을 보여줍니다. 만약 이 모든 잠금장치가 동일한 '보안 철학'(매우 강건해지려는 노력)에 의해 설계되었다면, 그 내부 기어에는 모두 동일한 작고 보이지 않는 결함이 있을 수 있습니다.

연구진은 이를 '공유된 취약점(Shared Vulnerability)'이라고 부릅니다. 그들은 AI 시스템이 공격에 대해 매우 강건하도록 훈련될 때, 모두가 이미지의 동일한 부분을 무시하고 동일한 '안전한' 부분에만 집중하는 경향이 있다는 것을 발견했습니다. 즉, 해커가 특정 강건한 AI를 속이기 위해 트릭 사진을 만든다면, 그 똑같은 트릭 사진이 겉모습이 완전히 다르더라도 다른 강건한 AI들에게도 효과를 발휘한다는 뜻입니다. 이는 마치 마스터 도둑이 동네의 모든 자물쇠를 열 수 있는 마스터 키를 찾아낸 것과 같습니다. 자물쇠들의 색상과 모양이 다르더라도, 모두 같은 공장에서 만들어졌기 때문입니다.

탐정 작업: 균열을 찾아낸 방법

이를 증证明하기 위해 팀은 매우 신중해야 했습니다. 과거에는 공격이 다른 AI로 '전이(transfer)'되는지(즉, 다른 AI에서도 작동하는지) 테스트할 때 사진에 크고 명백한 변화를 주었습니다. 연구진은 이것이 일종의 부정행위라고 판단했습니다. 사진을 충분히 뭉개버린다면, 그것은 두 AI가 약점을 공유해서가 아니라 단순히 사진 자체가 망가졌기 때문에 어떤 AI든 혼란에 빠질 것이기 때문입니다.

그래서 그들은 테스트를 위한 엄격한 규칙을 만들었습니다:

  1. 미세한 변화만 허용: 공격이 단순히 사진을 망가뜨리는 것이 아님을 보장하기 위해, 아주 작고 거의 보이지 않는 변화(예산 ϵ=4/255\epsilon = 4/255)만을 사용했습니다.
  2. 부정행위 방지: '단일 대리 모델(single-surrogate)' 규칙을 사용했습니다. 해커는 하나의 AI(대리 모델)를 대상으로 훈련할 수 있지만, 대상 AI의 비밀을 보지 못한 상태에서 공격해야 합니다.
  3. 단순한 공격: 매우 복잡하고 화려한 해킹 도구 대신, PGDTransfer라는 매우 단순한 방법을 사용했습니다. 이는 레이저 커터 대신 기본적인 드라이버를 사용하는 것과 같습니다. 만약 단순한 드라이버로 여러 개의 자물쇠를 부술 수 있다면, 그것은 도구가 문제가 아니라 자물쇠 자체에 문제가 있음을 증명하는 것입니다.

그들은 또한 **적대적 민감도 맵(Adversarial Sensitivity Maps, AdvSMs)**을 만들었습니다. 도시의 지도를 보고 어느 거리가 붐비는지 확인하는 것을 상상해 보세요. 이 지도는 이미지의 정확히 어떤 픽셀(작은 점들)에 AI가 주의를 기울이고 있는지를 보여줍니다. 연구진은 '강건한' AI들이 모두 동일한 특정 픽셀에 주의를 기울이고 동일한 다른 픽셀들은 무시한다는 것을 발견했습니다. 이는 마치 가족 중 모든 보디가드가 정문 앞에 서서 뒷창문은 무시하기로 결정한 것과 같습니다. 만약 도둑이 한 보디가드의 뒷창문을 통해 침입하는 법을 알게 된다면, 그는 다른 모든 보디가드에게도 어디로 가야 할지 정확히 알게 됩니다.

결과: 경종을 울리는 신호

그들이 발견한 수치는 상당히 놀랍습니다. 이 단순한 공격을 '정화' 방어 체계(이미지를 깨끗하게 하려는 방식)에 테스트했을 때:

  • 다양한 유형의 정화 도구(필터링, 압축, 확산 기반) 전반에서 공격 성공률은 평균 **80.4%**였습니다.
  • 이러한 방어 체계들이 개별적으로는 강력해 보였음에도 불구하고, 모두 동일한 단순한 트릭에 취약했습니다.
  • 이는 현재 세계에서 가장 강력하고 복잡하다고 여겨지는 확산 기반(Diffusion-based) 방어 체계에서도 발생했습니다.

이 논문은 이것이 단순히 AI 모델의 외형(아키텍처)이 비슷하기 때문이라는 가설을 명시적으로 배제합니다. 연구진은 디자인은 같지만 훈련 방식이 다른 모델들을 테스트했으며, 만약 하나가 '강건하지' 않다면 공격이 전이되지 않는다는 것을 확인했습니다. 전이는 두 모델 모두 '강건함'을 위해 최적화되었을 때만 발생했습니다. 이는 '강건함 최적화' 자체가 공유된 약점을 만들어낸다는 것을 입증합니다.

미래를 위한 의미

이 논문의 핵심 결론은 AI가 운명 지어졌다는 것이 아니라, 우리가 AI를 안전하게 만드는 방식이 변해야 한다는 것입니다. 현재 우리는 각 개별 AI를 최대한 강하게 만드는 데 집중하고 있습니다. 하지만 이 논문은 우리에게 다양성에 집중해야 한다고 제안합니다. 우리는 서로 다른 방어 체계들이 모두 동일한 것을 무시하도록 학습하지 않도록 만들어야 합니다. 만약 우리가 계속해서 동일한 방식으로 '완벽하게 강건하도록' 훈련시킨다면, 우리는 결국 동일한 마스터 키를 공유하는 자물쇠 가족을 만들 뿐입니다.

저자들은 향-후 보안이 '취약성 다양성(vulnerability diversity)'을 목표로 삼아야 한다고 제안합니다. 단순히 "이 AI는 강한가?"라고 묻는 대신, "이 AI의 약점은 다른 것들과 다른가?"라고 물어야 합니다. 만약 한 AI가 속았을 때 그 가족 전체가 노출되지 않도록 만들 수 있다면, 우리는 훨씬 더 안전한 디지털 세상을 구축할 수 있을 것입니다. 현재로서는 이 논문이 경고의 역할을 하고 있습니다. 하나의 침투가 가족 전체를 노출시킬 수 있으므로, 우리는 이러한 방어 체계들을 고립된 섬으로 보는 것이 아니라 연결된 생태계로 바라보기 시작해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →