← 최신 논문
🤖 AI

PHANTOM: A Large-Scale Dataset of Multimodal Adversarial Attacks for Vision-Language Models

이 논문은 시각-언어 모델의 강건성과 안전성에 대한 체계적인 평가를 가능하게 하고 연구 장벽을 낮추기 위해 설계된, 10개의 상위 수준 카테고리에 걸친 47,000개 이상의 사전 생성된 멀티모달 적대적 공격을 포함하는 대규모 오픈 소스 데이터셋인 PHANTOM을 소개한다.

원저자: Simone Gallivanone, Hossein Khodadadi, Mauro Dore, Mauro Medda, Nicola Franco

게시일 2026-06-24
📖 4 분 읽기☕ 가벼운 읽기

원저자: Simone Gallivanone, Hossein Khodadadi, Mauro Dore, Mauro Medda, Nicola Franco

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계를 거대하고 교육 수준이 높은 도서관이라고 상상해 보세요. 이 도서관에서 가장 새롭고 강력한 사서들은 **시각-언어 모델(Vision-Language Models, VLMs)**이라 불립니다. 이들은 단순히 책만 잘 아는 것이 아니라, 사진을 보고 텍스트를 읽으며, 이 둘이 서로 어떻게 연관되는지를 이해할 수 있습니다. 이들은 도움이 되고 안전하도록 설계되었으며, 폭탄을 만드는 방법이나 누군가를 괴롭히는 방법에 대한 질문에는 답변을 거부합니다.

하지만 실제 도서관에 영리한 장난꾼이 몰래 지나가려 할 때 마주칠 수 있는 "출입 금지" 표지판처럼, 이러한 AI 사서들에게도 때때로 속임수에 넘어갈 수 있는 안전 규칙이 있습니다. 이 논문은 연구자들이 이러한 속임수가 정확히 어떻게 작동하는지 이해할 수 있도록 돕기 위해 PHANTOM이라는 거대한 새로운 도구를 소개합니다.

다음은 쉬운 비유를 사용한 이 논문의 요약입니다:

1. 문제점: "장난꾼의 도구함"을 만드는 것은 너무 어렵다

새로운 보안 요원(AI)이 자신의 직무를 잘 수행하고 있는지 테스트하고 싶다고 가정해 봅시다. 이를 위해서는 나쁜 사람이 들어오도록 속여야 합니다. 이를 위해 당신은 수천 가지의 서로 다른 "속임수(공격)"를 만들어내야 합니다. 어떤 속임수는 비밀 코드를 속삭이는 것이고, 어떤 것은 변장을 하는 것이며, 또 어떤 것은 메시지를 숨긴 사진을 보여주는 것입니다.

이러한 속임수를 만드는 것은 매우 어렵고, 비용이 많이 들며, 시간이 오래 걸리는 일입니다. 이는 마치 자물쇠에 맞는 열쇠를 찾기 위해 백만 개의 서로 다른 가짜 열쇠를 직접 깎아 만드는 것과 같습니다. 대부분의 연구자들은 이 모든 열쇠를 직접 만들 시간도, 돈도 없습니다.

해결책: 저자들은 47,524개의 열쇠(적대적 샘플)가 담긴 거대하고 미리 만들어진 상자를 구축했습니다. 그들이 열쇠를 만드는 힘든 작업을 대신 해두었으므로, 다른 연구자들은 그저 열쇠 하나를 집어 들어 즉시 보안 요원을 테스트하기만 하면 됩니다.

2. 지도: "나쁜 생각"을 분류하는 새로운 방법

모든 방식으로 AI를 속일 수 있는지 확인하기 위해, 저자들은 거대한 "나쁜 의도"의 지도를 만들었습니다.

  • 기존의 지도: 이전 연구들의 지도는 아마도 1,000개 또는 2,000개의 나쁜 아이디어만을 담고 있었습니다.
  • 새로운 지도 (PHANTOM): 저자들은 이를 7,826개의 구체적인 나쁜 아이디어로 확장했습니다.
  • 카테고리: 이들은 이를 10개의 큰 동네(사이버 보안, 아동 안전, 사기, 혐오 표현 등)와 그 안의 55개 작은 거리로 조직화했습니다.
  • 새로운 동네: 저자들은 이전의 지도들이 놓쳤던 아동과 관련된 중요한 위험성을 깨닫고, **"아동 안전"**이라는 완전히 새로운 동네를 추가했습니다.

3. 공격 전략: 속임수는 어떻게 작동하는가

논문은 단순히 나쁜 질문을 작성한 것이 아니라, 어떤 방식이 가장 잘 통하는지 보기 위해 다섯 가지 다른 "스타일"의 속임수를 사용했습니다:

  • 속삭임 (BAP): 사진을 미세하게 조정하고(보이지 않는 노이즈를 추가하는 것처럼), 혼란스러운 문장을 써서 AI가 나쁜 요청을 좋은 것으로 착각하게 만듭니다.
  • 대화 (IDEATOR): 나쁜 것을 한꺼번에 요구하지 않습니다. AI와 대화를 나누며 서서히 길을 유도하여, AI가 실수로 해로운 행동에 동의하게 만듭니다.
  • 숨겨진 메시지 (MML): 나쁜 요청을 가져와서 암호화한 뒤, 사진 안에 글을 씁니다. 그리고 AI에게 "이 퍼즐을 풀어줄 수 있니?"라고 말합니다. 도움을 주려는 AI는 이 나쁜 요청을 해독하고 나서 답변을 내놓게 됩니다.
  • 순서도 (FC ATTACK): 논리 퍼즐처럼 보이는 단계별 다이어그램을 그립니다. AI는 단계를 따라가다가, 자신이 나쁜 목표에서 시작했다는 사실을 인지하지 못한 채 해로운 행동을 하게 됩니다.
  • 주의 분산 (CSDJ): AI에게 12장의 사진 콜라주를 보여줍니다. 대부분은 무작위 사진이지만, 그중 3장은 나쁜 요청의 작은 부분들을 숨기고 있습니다. AI는 퍼즐에 정신이 팔려 위험 요소를 놓치게 됩니다.

4. 시승식: 누가 속았는가?

저자들은 47,000개 이상의 속임수를 가지고 가장 인기 있는 AI 모델들(누구나 다운로드할 수 있는 오픈 소스 모델과 GPT-5, Claude 같은 값비싼 폐쇄형 모델 모두)을 대상으로 테스트를 진행했습니다.

발견된 사실:

  • 완벽한 모델은 없다: 최신 기술이자 가장 똑똑한 AI 모델들도 속았습니다. 어떤 모델도 면역력을 갖추지 못했습니다.
  • "사진"의 문제: 사진 안에 나쁜 단어를 숨기는 속임수(숨겨진 메시지 및 순서도 공격)가 가장 성공적이었습니다. AI는 나쁜 텍스트를 읽는 것보다 이미지 안에 숨겨진 나쁜 텍스트를 읽는 데 훨씬 더 취약한 것으로 보입니다.
  • "전이" 효과: 한 AI 모델에서 통하는 속임수는 다른 모델에서도 통하는 경우가 많았습니다. 이는 마치 가짜 열쇠 하나가 한 문자에 맞으면, 같은 건물에 있는 다른 문들도 줄줄이 맞을 수 있는 것과 같습니다.
  • "단호한 거절" vs "부드러운 수락": Claude와 같은 일부 모델은 그냥 답변을 거부(단호한 거절)했는데, 이는 공격자에게 실패로 간주됩니다. 반면 GPT와 같은 모델은 경고를 포함하면서도 답변을 시도하거나, 때로는 실수로 나쁜 답변을 내놓기도 합니다. 논문은 도움이 되려고 노력하는 모델일수록 더 쉽게 속을 수 있다고 언급합니다.

5. 이것이 왜 중요한가

저자들은 AI를 파괴하는 법을 가르치려는 것이 아닙니다. 대신, 그들은 "자물쇠를 만드는 사람들"에게 "열쇠"를 건네주고 있습니다.

이 거대한 데이터셋을 공개함으로써 그들은 이렇게 말하고 있습니다: "우리가 알고 있는 가능한 모든 속임수가 담긴 거대한 상자입니다. 이것으로 당신의 AI를 테스트하고, 보안의 구멍을 찾아내며, 더 나은 방어 체계를 구축하십시오."

그들은 이 데이터셋이 연구자들이 바퀴를 다시 발명해야 하는 수고를 덜어주고, 특히 그림과 글을 동시에 볼 때 더 안전하고 속이기 어려운 AI 시스템을 구축하는 데 도움이 되기를 바랍니다.

안전에 관한 참고 사항: 이 논문에는 충격적인 내용(범죄 지침이나 해로운 아이디어 등)이 포함되어 있다는 경고가 있습니다. 그러나 이러한 내용은 오직 AI의 안전 시스템을 테스트하기 위한 목적으로만 포함되었습니다. 이는 화재를 일으키기 위해서가 아니라 스프링클러 시스템을 테스트하기 위해 연기를 사용하는 소방 훈련과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →