GHOST: Hallucination-Inducing Image Generation for Multimodal LLMs
이 논문은 이미지 임베딩을 최적화하여 멀티모달 거대 언어 모델의 환각 취약성을 능동적으로 유도하고 노출함으로써 자연스러워 보이는 객체 없는 이미지를 생성하는 자동화된 방법인 GHOST를 소개하며, 이는 기존 방식보다 현저히 높은 성공률을 달ей는 동시에 미세 조정을 통해 모델의 강건성을 향상시키는 도구로도 활용될 수 있다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대한 문제: "과잉 상상"을 하는 AI
당신에게 사진을 보고 그 안에 무엇이 있는지 설명할 수 있는 아주 똑똑한 로봇 비서가 있다고 상상해 보세요. 이 비서는 대부분의 일을 잘 해내지만, 이상한 결함이 하나 있습니다. 가끔 존재하지 않는 것을 본다고 믿는 것이죠.
만약 당신이 접시 위의 바나나 사진을 보여주면, 이 비서는 옆에 칼이 없는데도 자신 있게 "네, 바나나 옆에 칼이 보입니다"라고 말할 수 있습니다. AI의 세계에서는 이를 **환각(Hallucination)**이라고 부릅니다. 이는 마치 누군가가 상대방을 기쁘게 하고 싶어서, 혹은 특정 패턴에 너무 익숙해진 나머지 빈칸을 채우기 위해 스스로 디테일을 지어내는 것과 같습니다.
기존 방식: 고정된 목록 확인하기
이전에는 연구자들이 AI에게 고정된 사진 목록(마치 객관식 시험처럼)을 보여주며 이러한 실수를 찾아내려 했습니다. 그들은 "칼이 보이나요?"라고 물으며 AI가 틀리는지 확인했습니다.
- 결함: 이것은 운전자에게 특정 빈 주차장에서만 운전 테스트를 하는 것과 같습니다. 도로 위로 빨간 공이 굴러 들어올 때 운전자가 당황할 수 있다는 사실을 놓칠 수 있죠. 기존의 테스트는 너무 경직되어 있어서, AI가 저지를 수 있는 새롭거나 기이한 방식의 오류들을 찾아내지 못했습니다.
새로운 솔루션: GHOST ( "마술사" 아티스트)
저자들은 GHOST(Stealth Token 최적화를 통한 환각 생성)를 소개합니다. GHOST를 단순한 사진을 보여주는 것이 아니라, AI가 유령(Ghost)을 보게끔 설계된 새로운 그림을 그려내는 마술사라고 생각해보세요.
GHOST가 작동하는 단계별 과정은 다음과 같습니다.
1. "투명 잉크" 최적화 (The "Invisible Ink" Optimization)
GHOST는 일반적인 사진(예: 접시 위의 바나나)에서 시작합니다. GHOST의 목표는 AI가 칼이 있다고 믿게 만드는 것입니다.
- 눈에 띄는 칼을 직접 그리는 대신(그렇게 하면 사람에게 너무 명확히 보이니까요), GHOST는 **임베딩(Embeddings)**이라 불리는 "비밀 언어" 속에서 작업합니다. 이것을 AI의 내부적인 '꿈의 상태'라고 상상해 보세요.
- GHOST는 이 꿈의 상태를 아주 미세하게 조정합니다. "투명 잉크" 같은 단서들을 추가하는 것이죠. 예를 들어, 바나나 줄기의 곡선을 아주 살짝 수정하여 AI에게는 칼 손잡이처럼 보이게 만들지만, 사람의 눈에는 여전히 평범한 바나나로 보이게 만듭니다.
2. "번역가" (The "Translator" / Mapper)
문제는 사진을 보는 AI(MLLM)와 그림을 그리는 AI(Diffusion Model)가 서로 다른 언어를 사용한다는 점입니다.
- GHOST는 번역가(매퍼, Mapper)를 구축합니다. 이 번역가는 화가(Diffusion Model)로부터 온 "비밀스러운 꿈의 수정 사항"을 받아, 매번 관찰자(MLLM)에게 도움을 요청하지 않고도 화가가 이해할 수 있는 지침으로 번양해 줍니다. 덕분에 이 과정은 매우 빠르게 진행됩니다.
3. "꿈을 그리는 화가" (The "Dream Painter" / Diffusion)
비밀 지침이 준비되면, GHOST는 디퓨전 모델(Diffusion Model)(노이즈로부터 이미지를 생성하는 종류의 AI)을 사용하여 최종 그림을 그립니다.
- GHOST는 원래의 바나나 사진에서 시작하여 비밀 지침에 따라 부드럽게 "노이즈를 제거(denoise)"합니다.
- 결과: 최종 이미지는 사람에게 100% 자연스럽게 보입니다. 여전히 접시 위의 바나나일 뿐입니다. 하지만 AI에게는 빛의 밝기나 형태의 미세한 변화가 충분한 자극이 되어, AI가 "칼이 보여요!"라고 외치게 만듭니다.
이것이 왜 중요한가요?
이 논문은 GHOST가 거둔 세 가지 주요 승리를 주장합니다.
탁월한 탐정 (Master Detective):
- 기존 방식은 환각 사례의 약 **1%**만을 찾아냈습니다.
- GHOST는 28% 이상의 사례를 찾아냈습니다. 이는 거의 모든 동전을 찾아내지 못하는 금속 탐지기를, 거의 모든 것을 찾아내는 탐지기로 업그레이드한 것과 같습니다.
보편적인 함정 (Transferability):
- GHOST는 한 AI(예: Qwen)를 속인 뒤, 그 "속임을 당한" 이미지를 완전히 다른 AI(예: GPT-4o)에게 보여줄 수 있습니다.
- 결과: 두 번째 AI 역시 환각을 일으킵니다! 이는 서로 다른 AI들이 동일한 약점을 공유하고 있음을 증명합니다. 이는 특정 종류의 착시 현상이 당신의 눈뿐만 아니라 친구의 눈까지도 속이는 것과 같습니다.
단순한 테스트가 아닌 치료제 (A Cure, Not Just a Test):
- 저자들은 단순히 무언가를 망가뜨리기 위해 GHOST를 사용한 것이 아니라, 이를 통해 문제를 해결했습니다.
- 그들은 GHOST가 만들어낸 "속임수 이미지"를 AI에게 보여주며 정답("아니요, 칼은 없습니다")을 함께 제시했습니다.
- 결과: AI는 앞으로 환각을 일으키지 않는 능력이 향상되었습니다. 이는 학생에게 틀린 문제의 정확한 트릭을 알려주어 올바른 답을 배울 수 있게 하는 것과 같습니다.
핵심 요약 (The Bottom Line)
GHOST는 AI 시각 시스템을 스트레스 테스트하기 위해 "트릭 사진"을 자동으로 생성하는 도구입니다. 이는 현재의 AI 모델들이 얼마나 취약하며, 미세하고 자연스러운 변화에 얼마나 쉽게 속을 수 있는지를 보여줍니다. 하지만 더 중요한 것은, GHOST가 이러한 약점을 찾아내고 AI를 훈련시켜 더욱 신뢰할 수 있게 만드는 방법을 제공한다는 점입니다. 이를 통해 AI가 칼이 보인다고 말할 때, 실제로 칼이 있을 때만 그렇게 말하도록 보장할 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.