← 최신 논문
💬 NLP

Resolution Thresholds in VLM Detection of Harmful ASCII Art Across Construction Modes and Languages

이 논문은 이미지 해상도가 다양한 구성 방식과 언어에 걸쳐 대규모 시각-언어 모델(Large Vision-Language Models)의 유해한 ASCII 아트 탐지 능력에 어떠한 영향을 미치는지 조사하며, 특정 해상도 임계값을 넘어서면 탐지율이 급격히 저하되고 단어 기반 디자인이 중재에 가장 강한 저항력을 보인다는 점을 밝혀낸다.

원저자: Yikai Hua, Peter West

게시일 2026-06-30
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yikai Hua, Peter West

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 아주 똑똑한 보안 요원(시각-언어 모델, 즉 VLM)이 있다고 상상해 보세요. 이 요원의 임무는 사진을 보고 나쁜 것이 발견되면 "멈춰!"라고 외치는 것입니다. 보통 이 요원은 나쁜 단어나 폭력적인 이미지를 찾아내는 데 매우 뛰어납니다.

하지만 영리한 해커들이 ASCII 아트를 이용해 이 요원을 속이는 방법을 찾아냈습니다.

기술의 핵심: "착한 단어의 모자이크"

"HATE(증오)"라는 나쁜 단어가 크고 굵은 글씨로 쓰여 있다고 생각해 보세요. 보안 요원은 이를 즉시 발견하고 차단할 것입니다.

이제 해커가 이 "HATE"라는 단어를 모자이크로 만든다고 상상해 보세요. 검은 잉크 대신, 수천 개의 무해한 작은 단어들인 "LOVE(사랑)", "PEACE(평화)", "SMILE(미소)"를 사용하여 글자의 형태를 만드는 것입니다.

  • 요원이 자세히 들여다본다면: 요원은 수만 개의 작은 "LOVE"와 "PEACE"라는 단어들을 보게 됩니다. 요원은 "오, 정말 좋은 그림이구나!"라고 생각하며 이를 통과시킵니다.
  • 요원이 뒤로 물러난다면: 작은 단어들이 하나로 뭉쳐지면서, 요원은 갑자기 거대하고 무서운 "HATE"의 형상을 보게 됩니다.

이 논문은 보안 요원이 숨겨진 위험을 보기 위해 정확히 얼마나 뒤로 물러나야 하는지(이미지를 얼마나 축소해야 하는지), 그리고 어떤 요원이 이 작업에 더 뛰어난지를 조사합니다.

실험: "줌 아웃(Zoom-Out)" 테스트

연구진은 8가지 유형의 "모자이크"(단순한 블록부터 복잡한 긍정적 단어까지)와 8가지 종류의 보안 요원(AI 모델)을 활용하여 대규모 테스트를 수행했습니다. 이 테스트는 영어와 중국어 두 가지 언어로 진행되었습니다.

연구진은 "나쁜" 그림들을 가져와서, 거대한 크기의 선명한 광고판(고해 resolution)부터 아주 작고 흐릿한 우표 크기(저 resolution)에 이르기까지 10가지 다른 크기로 보안 요원들에게 보여주었습니다.

연구 결과

1. "흐림(Blur)"이 핵심입니다
가장 큰 발견은 고해상도 이미지가 오히려 보안에 최악이라는 점입니다.

  • 이미지가 크고 선명할 때, 요원은 작은 착한 단어들("LOVE", "PEACE")에 정신이 팔려 커다란 나쁜 형상을 놓치게 됩니다.
  • 이미지를 축소하면(흐릿해지면), 그 작은 착한 단어들이 하나로 합쳐집니다. 요원은 더 이상 개별 단어를 읽을 수 없게 되며, 뇌의 초점을 전체적인 형태를 보는 데 전환합니다. 갑자기 "HATE"의 형상이 뚜로 드러나고, 요원은 이를 잡아냅니다.

2. 어떤 모자이크는 더 알아채기 어렵습니다
모든 속임수가 똑같은 것은 아닙니다.

  • 잡기 쉬운 경우: 나쁜 단어가 단순한 블록이나 이모지로 만들어졌다면, 요원들은 이미지가 클 때도 쉽게 잡아냅니다.
  • 잡기 어려운 경우: 만약 나쁜 단어가 긍정적인 영어 단어들(예: "LOVE", "PEACE")로 만들어졌다면, 이를 잡는 것은 믿기 힘들 정도로 어렵습니다. 이미지가 매우 클 때조차, 요원들은 착한 단어들에 너무 정신이 팔려 나쁜 형상을 거의 발견하지 못합니다. 이것이 바로 "궁극의 탈옥(jailbreak)"입니다.

3. 모든 요원이 똑같지는 않습니다
연구진은 8가지 서로 다른 AI 모델을 테스트했습니다.

  • 눈썰미 좋은 요원들: Gemini나 Kimi 같은 모델들은 뒤로 물러나 전체적인 그림을 보는 데 매우 능숙합니다. 이들은 이미지가 상당히 클 때도 나쁜 형상을 잡아냅니다.
  • 정신이 산만한 요원들: Mistral이나 Llama 같은 모델들은 쉽게 속아 넘어갑니다. 이들은 작은 착한 단어들을 읽는 데 갇혀 버려, 이미지를 아무리 축소해도 나쁜 형상을 거의 잡아내지 못합니다.
  • 특이한 모델: Grok은 독특했습니다. 이 모델은 이미지 크기에 크게 신경 쓰지 않는 듯했습니다. 이미지 크기가 변하더라도 일관되게 평범한 수준을 유지하며, 나아지지도 나빠지지도 않았습니다.

4. 언어의 반전
연구진은 중국에서 만들어진 요원들이 중국어 단어로 된 나쁜 형상을 더 잘 찾아낼지, 그리고 서구권에서 만들어진 요원들이 영어 단어에 더 강할지 궁금해했습니다.

  • 저해상도(흐릿할 때): 중국에서 만들어진 요원들이 중국어 단어로 된 나쁜 형상을 포착하는 데 실제로 더 뛰어났습니다. 이들은 세부 사항이 흐릿해질 때 "큰 그림"을 더 잘 이해하는 것처럼 보였습니다.
  • 고해상도(선명할 때): 상황이 역전되었습니다! 중국에서 만들어진 요원들은 개별 중국어 글자(착한 단어)를 읽는 데 정신이 팔려 나쁜 형상을 보지 못했습니다. 반면, 개별 중국어 글자를 읽는 데 집중하지 않는 서구권 요원들은 안정적인 상태를 유지하며 나쁜 형상을 계속 잡아냈습니다.

결론

이 논문은 해커를 막는 새로운 방법을 발명하는 것이 아닙니다. 대신, 이는 진단 도구로서 역할을 합니다. 논문은 다음과 같은 사실을 알려줍니다:

  1. 해상도가 중요합니다: 만약 당신의 AI 보안 요원이 이러한 특정 속임수를 잡아내길 원한다면, 이미지를 먼저 축소하여 요원이 작은 단어들을 읽는 대신 큰 형상을 보도록 만들어야 할 수도 있습니다.
  2. 잡을 수 없는 속임수도 있습니다: 현재로서는 나쁜 단어를 긍정적인 영어 단어 안에 숨기는 것은 매우 강력한 속임수이며, 대부분의 AI 요원들은 이를 보지 못합니다.
  3. 하나의 정답은 없습니다: 서로 다른 AI 모델은 각기 다른 "사각지대"를 가지고 있습니다. 한 모델을 사용하는 시스템은 다른 모델이 잡아낼 수 있는 것을 놓칠 수 있습니다.

요약하자면, 이 논문은 이미지를 흐리게 만드는 것이 AI가 나무를 보느라 숲을 놓치는 대신 숲을 볼 수 있게 돕는 간단한 방법임을 보여주지만, 어떤 "숲"(예: 긍정적인 단어로 이루어진 숲)은 여전히 포착하기 매우 어렵다는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →