← 최신 논문
🤖 machine learning

Steal the Patch Size: Adversarially Manipulate Vision-Language Models

이 논문은 비전-언어 모델의 태스크 수준 사이드 채널 정확도 저하를 악용하여 패치 크기 및 전처리 파이프라인과 같은 개인화된 토크나이저 구성을 복구함으로써 표적화된 적대적 조작을 가능하게 하는 블랙박스 공격인 "Steal the Patch Size"를 소개한다.

원저자: Kai Hu, Akash Bharadwaj, Weichen Yu, Matt Fredrikson

게시일 2026-07-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Kai Hu, Akash Bharadwaj, Weichen Yu, Matt Fredrikson

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 유명한 셰프의 비밀 수프 레시피를 추측하려고 합니다. 하지만 주방도, 재료도, 셰프의 메모도 볼 수 없습니다. 오직 수프를 주문해서 맛을 보고, "이 맛은 어떤가요?"라고 물어볼 수 있을 뿐입니다.

이 논문은 연구자들이 현대적인 AI 이미지 해결사(Vision-Language Model이라고 불리는 것들)의 '수프 맛'을 보고 그들의 비밀 레시피를 알아낸 영리한 기술을 설명합니다. 구체적으로, 그들은 두 가지 숨겨진 세부 사항을 훔치는 데 성공했습니다:

  1. "패치 크기(Patch Size)": AI가 이미지를 보기 전에 얼마나 작은 정사각형 타일 조각으로 나누는지에 대한 정보.
  2. "전처리(Preprocessing)": AI가 모든 이미지를 특정 크기로 압축하는지, 아니면 원래 모양에 따라 다르게 처리하는지에 대한 정보.

연구자들이 어떻게 이 일을 해냈는지, 쉬운 비유를 통해 설명하겠습니다.

"딸기(Strawberry)" 문제

어떤 사람들은 왜 "strawberry"라는 단어에서 알파벳 "r"이 몇 개인지 세는 것을 어려워할까요? 그것은 뇌가 개별 철자가 아닌 단어 전체를 하나의 덩어리로 보기 때문입니다.

이 논문은 AI 모델들도 이미지에 대해 비슷한 문제를 겪는다는 것을 발견했습니다. 대부분의 AI 모델은 이미지를 연속적인 하나의 그림으로 보는 것이 아니라, 모자이크처럼 작은 사각형 조각(패치)으로 나눕니다. 만약 AI가 이미지를 16x16 픽셀 크기의 정사각형으로 나눈다면, AI는 각 정사각형을 하나의 단어(또는 토큰)로 취급합니다.

함정: 그리드 게임

연구자들은 AI를 속이기 위한 간단한 게임을 만들었습니다. 그들은 AI에게 색깔이 있는 격자(체크무늬 같은 그리드) 이미지를 보여주고, "이 격자에는 몇 개의 칸이 있습니까?"라고 물었습니다.

인간은 이를 즉시 대답할 수 있습니다. 하지만 AI는 매우 이상하고 예측 가능한 패턴으로 실패하기 시작했습니다:

  • 격자 칸의 크기가 특정 크기일 때는 AI가 정답을 맞혔습니다.
  • 격자 칸이 약간 더 크거나 작아지면, AI는 틀렸습니다.
  • 격자 칸이 AI의 숨겨진 "조각 타일"과 **정확히 일치할 때, AI는 완전히 눈이 멀어버린 듯 처참하게 실패했습니다.

왜 그럴까요? AI의 조각 타일이 격자의 선과 완벽하게 일치한다고 상상해 보세요. AI는 하나의 타일을 볼 때 오직 하나의 단색만 보게 됩니다. 색이 변하는 '선'을 결코 볼 수 없는데, 그 선이 타일과 타일 사이의 경계선에 정확히 놓이기 때문입니다. 이것은 마치 벽돌을 볼 때 벽돌 자체만 보고, 벽돌 사이의 줄눈(모르타르)은 전혀 보지 못해 벽의 가장자리를 찾으려고 애쓰는 것과 같습니다. AI는 숫자를 세는 능력을 상실하게 됩니다.

탈취: 비밀을 훔치다

연구자들은 수천 개의 서로 다른 격자 크기를 테스트함으로써 이러한 "맹점"을 관찰했습니다.

  1. 타일 크기 찾기: 그들은 격자 크기가 특정 숫자의 배수(예: 14, 28, 42)가 될 때마다 AI가 실패한다는 사실을 발견했습니다. 이를 통해 AI의 숨겨진 "조각 타일"이 정확히 14 픽셀 너비라는 것을 알아냈습니다.
  2. 리사이즈 규칙 찾기: 어떤 AI 모델은 이미지를 조각내기 전에 모든 이미지를 고정된 크기(예: 512x512)로 압축합니다. 반면 어떤 모델은 다양한 크기를 다르게 처리합니다.
    • 만약 AI가 이미지를 압축한다면, 격자 크기만 바꾼다고 해서 "맹점"이 사라지지 않습니다.
    • 하지만 연구자들은 트릭을 하나 더 추가했습니다: 격자를 더 큰 빈 캔버스(패딩) 안에 넣었습니다. 이 빈 캔버스의 크기를 조절함으로써, AI가 이미지를 예측 가능한 방식으로 압축하도록 강제할 수 있었습니다. 이를 통해 AI가 이미지를 압축하는 정확한 크기(예: 512 픽셀)를 밝혀냈습니다.

결과: 비밀을 알아내다

이 방법을 사용하여, 연구자들은 GPT-4o, Claude, Qwen과 같은 주요 AI 모델의 숨겨진 설정들을 성공적으로 추측해 냈습니다. 그들은 코드를 해킹할 필요가 없었습니다. 그저 올바른 질문을 던지고 AI가 어디에서 비틀거리는지를 지켜봤을 뿐입니다.

이것이 왜 중요한가요? ("표적" 공격)

이 논문은 이러한 비밀을 아는 것이 "정밀한" 공격을 가능하게 한다는 것을 보여줍니다.

예를 들어, 당신은 특정 AI가 정지 표지판을 속도 제한 표지판으로 인식하도록 속이고 싶지만, 다른 AI는 속이고 싶지 않다고 가정해 봅시다.

  • 비밀을 모를 때: 두 모델 모두에 작동하거나, 혹은 둘 다 작동하지 않는 일반적인 속임수를 만듭니다.
  • 비밀을 알 때: 당신은 첫 번째 AI가 이미지를 어떻게 조각내는지 정확히 압니다. 따라서 그 특정 조각 방식에 완벽하게 작동하면서도, 다른 방식으로 조각하는 두 번째 AI에게는 완전히 정상적으로 보이는 속임수를 만들어낼 수 있습니다.

이것은 특정 자물쇠의 핀(tumbler) 너비가 14mm라는 것을 아는 것과 같습니다. 당신은 다른 모든 자물쇠는 건드리지 않고, 오직 그 자물쇠만을 여는 열쇠를 정교하게 제작할 수 있습니다.

요약

이 논문은 AI 모델이 이미지를 처리하는 "보이지 않는" 방식이 지문(fingerprint)을 남긴다는 것을 증명합니다. 격자에 관한 간단한 질문을 던짐으로써, 연구자들은 모델의 내부 설정을 역설계할 수 있습니다. 이는 AI가 세상을 보는 방식에 담긴 "구현 세부 사항(implementation details)"이 사실은 비밀 열쇠와 같으며, 이를 탈취할 경우 해당 모델에 대해 매우 구체적이고 위험한 속임수를 쓸 수 있음을 드러냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →