One Surrogate to Fool Them All: Universal, Transferable, and Targeted Adversarial Attacks with CLIP
이 논문은 단일 공개 CLIP 모델과 텍스트 개념을 활용하여, 대상 학습 데이터에 대한 접근이나 과도한 모델 쿼리 없이도 다양한 딥 뉴럴 네트워크 및 실세계 시스템에 대해 높은 성공률을 달성하는 보편적이고, 전이 가능하며, 표적화된 섭동을 생성하는 새로운 적대적 공격 프레임워크인 UnivIntruder를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인터넷이 컴퓨터들이 경찰, 의사, 상점 주인 역할을 하는 거대하고 북적이는 도시라고 상상해 보세요. 이 컴퓨터들은 사진 속의 고양이를 인식하거나 질병을 진단하는 것과 같은 결정을 내리기 위해 '심층 신경망(DNN)'이라는 특별한 종류의 두뇌를 사용합니다. 오랫동안 과학자들은 컴퓨터의 뇌를 속일 수 있는 기묘한 기술을 발견했습니다: 바로 "적대적 공격(adversarial attacks)"입니다. 이것은 마치 정지 표지판에 아주 작고 거의 보이지 않는 스티커를 붙여서 컴퓨터가 그것을 속도 제한 표지판으로 착각하게 만드는 것과 같습니다. 보통 이런 속임수를 쓰려면, 해커가 컴퓨터의 비밀 코드를 들여다보거나(현실 세계에서는 불가능한 일), 컴퓨터의 비밀을 알아내기 위해 수천 번의 질문을 던져야 합니다(너무 느리고 비용이 많이 드는 일이죠).
하지만 단 한 번의 질문도 던지지 않고 모든 컴퓨터의 뇌를 속일 수 있다면 어떨까요? 이 논문은 바로 이 거대한 질문을 다룹니다. 연구진은 수십억 권의 책을 읽고 수십억 장의 사진을 보며 단어와 이미지가 어떻게 연결되는지 학습한 초스마트 사서와 같은 강력한 도구인 CLIP을 사용했습니다. 그들은 이 "유니버설 사서"를 사용하여, 단순한 단어인 "암탉"이나 "고양이"를 가이드로 삼아 구글 검색부터 첨단 로봇에 이르기까지 거의 모든 컴퓨터 비전 시스템을 속일 수 있는 마스터 키—즉, 단 하나의 작고 디지털적인 왜곡—를 만들 수 있는지 확인하고자 했습니다.
마스터 키: 모두를 속이는 하나의 대리 모델
Binyan Xu와 그 팀이 소개한 새로운 공격 프레임워크인 UnivIntruder를 만나보세요. 이것을 컴퓨터 비전을 위한 "유니버설 마스터 키"라고 생각하면 됩니다. 과거에는 특정 컴퓨터 시스템을 속이고 싶다면, 실제 시스템과 동일한 데이터로 만든 가짜 복제본("대리 모델")을 구축해야 했습니다. 이는 마치 똑같은 금속과 나사를 사용하여 특정 자물쇠의 열쇠 구멍을 완벽하게 재현함으로써 자물쇠를 따려고 시도하는 것과 같았습니다. 만약 원래 자물쇠의 설계도나 정확한 금속을 가지고 있지 않다면, 당신의 가짜 열쇠는 작동하지 않을 것입니다.
UnivIntruder는 게임의 판도를 바꿉니다. 연구진은 타겟의 완벽한 복사본이 필요하지 않다는 것을 깨달았습니다. 대신, 그들은 이미지와 텍스트의 관계를 이해하는 공개적으로 사용 가능한 초스마트 AI인 CLIP을 사용했습니다. 그들은 CLIP을 자신들의 "대리 모델" 또는 연습용 자물쇠로 취급했습니다. 여기서 마법이 일어납니다. 그들은 타겟의 훈련 데이터를 복제하려고 노력하는 대신, 무작위 이미지로 구성된 공개 데이터셋(타겟의 데이터와 전혀 다르게 보일 수 있는)과 단순한 텍텍스트 개념을 사용했습니다.
이 속임수의 작동 방식:
당신이 보안 카메라가 원숭이 사진을 "암탉"이라고 생각하도록 속이고 싶다고 가정해 봅시다.
- 텍스트 가이드: 시스템에 "이것이 암탉처럼 보이게 하고 싶다"라고 말하고, 동시에 "고양이나 말처럼 보이지 않게 하고 싶다"라고 말합니다.
- 방향성 변화: 시스템은 단순히 사진을 보는 것이 아니라, 사진과 텍스트 사이의 차이를 봅니다. 그것은 컴퓨터의 뇌 안에서 하나의 "방향"을 계산합니다. 시스템은 다음과 같이 묻습니다. "만약 내가 이 원숭이 사진을 이 특정 방향으로 밀어낸다면, 그것이 '암톨'이라는 개념에는 더 가까워지고 '고양이'라는 개념에서는 더 멀어질까?"
- 유니버설 스티커: 시스템은 어떤 이미지에 추가되어도 그 방향으로 밀어낼 수 있는 작고 유니버설한 "스티커"(섭동)를 생성합니다.
- 반전: 이 스티커가 연습용 모델뿐만 아니라 어떠한 카메라에서도 작동하도록 하기 위해, 그들은 스티커를 만드는 동안 이미지를 회전시키고, 확대/축소하고, 자릅니다. 이는 스티커가 자동차 세차장을 통과하거나 진흙에 뒤덮여도 여전히 작동할 수 있도록 견고하게 만드는 과정입니다.
결과: 세상을 속이다
연구팀은 이 "마스터 키"를 대규모로 테스트했습니다. 단 하나의 컴퓨터가 아니라, 85개의 서로 다른 모델과 실제 응용 프로그램들을 테스트했습니다.
- 수치: 표준 테스트 세트에서 그들의 공격은 무서울 정도로 효과적이었습니다. 일반적인 이미지 인식 테스트인 CIFAR-10 데이터셋에서 성공률 **99.4%**를 달성했습니다. 1,000개의 카테고리가 있는 방대한 ImageNet 데이터셋에서도 **85.1%**를 기록했습니다.
- 현실 세계: 이 부분이 정말 무서운 부분입니다. 그들은 실험실 테스트에 그치지 않았습니다. 그들은 실제 서비스들을 속이려고 시도했습니다:
- 검색 엔진: 그들은 원숭이의 왜곡된 이미지를 Google, Baidu, Taobao, JD에 업로드했습니다. 검색 엔진들은 원숭이를 보여주는 대신 닭(암탉)을 보여주기 시작했습니다. Baidu에서의 성공률은 **84%**였습니다.
- 슈퍼 AI: 그들은 가장 진보된 AI 챗봇인 GPT-4와 Claude-3.5를 테스트했습니다. 왜곡된 원숭이 이미지를 보여주었을 때, 이 AI들은 자신 있게 그것을 "암탉" 또는 "병아리"라고 설명했습니다. Claude-3.5의 성공률은 **80%**였습니다.
- 이미지 생성기: DALL·E 3와 같이 그림을 그리는 AI도 속았습니다. 왜곡된 입력을 바탕으로 이미지를 생성하라는 요청을 받았을 때, 이 AI들은 원숭이 대신 닭의 이미지를 만들어냈습니다.
다른 방법들이 실패한 이유
이 논문은 무엇이 작동하지 않는지에 대해 매우 명확하게 설명합니다. 이전 방법들은 CLIP을 조력자로 사용하려 했지만, 데이터의 "편향(bias)"을 고려하지 못했기 때문에 실패했습니다.
- 편향 문제: 만약 당신이 약간 푸른 빛이 도는 데이터셋을 사용하여 가짜 자물쇠를 훈련시킨다면, 당신의 열쇠는 푸른 빛이 도는 자물쇠에서만 작동할 수 있습니다. 연구진은 "원시 특징(raw features)" 대신 "방향(directions)"(새로운 특징에서 원래 이미지의 특징을 빼는 것)을 사용함으로써 이러한 편향을 제거할 수 있다는 것을 발견했습니다.
- 대리 모델 문제: 다른 방법들은 CLIP을 사용했지만, 그 공격을 다른 모델로 전이시키는 데 실패했습니다. 저자들은 자신들의 특정한 "방향성" 및 "무작위 변환" 기술 없이는, 심지어 CLIP을 사용하더라도 고급 모델들에서 실패율이 70%를 넘는다는 것을 보여주었습니다. UnivIntruder는 공개된 CLIP 모델과 현실 세계의 다양한 미지의 모델 사이의 간극을 성공적으로 메운 유일한 방법입니다.
이것이 보안에 의미하는 바
이 논문은 우리의 현재 보안 개념이 깨졌을 수도 있다고 시사합니다. 보통 우리는 훈련 데이터를 숨기고 사람들이 질문할 수 있는 횟수를 제한하면 안전할 것이라고 생각합니다. 하지만 UnivIntruder는 공격자가 이러한 방어 체계를 완전히 우회할 수 있음을 증명합니다. 그들은 당신의 데이터를 필요로 하지 않으며, 당신에게 질문을 던질 필요도 없습니다. 그저 공개된 AI(CLIP)와 몇 마디 단어만 있으면 됩니다.
연구진은 이를 막을 수 있는지도 테스트했습니다. 그들은 "적대적 훈련"(컴퓨터가 속임수에 저항하도록 가르치는 것)과 "테스트 타임 방어"(이미지를 처리하기 전에 이미지를 정화하는 것)를 시도했습니다. 이러한 방법들이 약간의 도움은 되었지만, 종종 컴퓨터가 실제 작업(예: 진짜 고양이 인식)을 수행하는 능력을 떨어뜨리거나, GPT-4와 같은 거대 시스템에서 실행하기에는 비용이 너무 많이 들었습니다. 논문은 우리가 AI를 어떻게 보호할지 다시 생각해야 한다고 결론짓습니다. 왜냐하면 단 하나의 공개된 모델이 이제 거의 모든 것을 속이는 데 사용될 수 있기 때문입니다.
요컨대, UnivIntruder는 경종을 울리는 메시지입니다. 적절한 "유니버설 키"가 있다면, 디지털 세상의 시각 시스템은 우리가 생각했던 것보다 훨씬 더 취약하며, AI의 눈에 비친 원숭이와 닭 사이를 가르는 것은 단지 작고 보이지 않는 디지털 글리치(glitch)일 뿐이라는 것을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.