← 최신 논문
🤖 machine learning

MM-PoisonRAG: Disrupting Multimodal RAG with Local and Global Poisoning Attacks

본 논문은 멀티모달 검색 증강 생성 시스템이 표적 로컬 포이닝과 광범위한 글로벌 포이닝 공격 모두에 매우 취약하여 모델 정확도를 심각하게 저하시키고 기존 방어 기법을 우회할 수 있음을 보여주는 MM-PoisonRAG 프레임워크를 소개합니다.

원저자: Hyeonjeong Ha, Qiusi Zhan, Jeonghwan Kim, Dimitrios Bralios, Saikrishna Sanniboina, Nanyun Peng, Kai-Wei Chang, Daniel Kang, Heng Ji

게시일 2026-05-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hyeonjeong Ha, Qiusi Zhan, Jeonghwan Kim, Dimitrios Bralios, Saikrishna Sanniboina, Nanyun Peng, Kai-Wei Chang, Daniel Kang, Heng Ji

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 그림을 보고 텍스트를 읽을 수 있는 초지능 로봇 비서가 있다고 가정해 봅시다. 이 로봇은 당신의 질문에 답할 때 단순히 자신의 기억에만 의존하지 않습니다. 최신 사실을 확인할 수 있는 '도서관'을 갖추고 있죠. 이 시스템을 멀티모달 RAG(검색 증강 생성)라고 부릅니다. 사건을 해결하기 전에 데이터베이스에서 단서를 찾아보는 탐정 같은 존재라고 할 수 있습니다.

논문 MM-POISONRAG은 이 탐정이 작동하는 방식에 있는 무서운 결함을 드러냈습니다: 그 도서관은 해킹당할 수 있습니다.

간단한 비유를 통해 그들의 발견 내용을 정리해 보겠습니다:

1. 설정: 신뢰하는 탐정

일반적으로 "2023 년 메트 갈라에서 입은 드레스의 색상은 무엇이었나요?"라고 질문하면, 로봇은 다음과 같이 행동합니다:

  1. 해당 사건에 관한 이미지와 텍스트를 도서관에서 검색합니다.
  2. 가장 적합한 결과를 찾기 위해 결과를 필터링합니다.
  3. 가장 적합한 결과를 읽어 당신에게 답변을 제시합니다.

문제는 이 도서관이 대중에게 개방되어 있다는 점입니다. 식당 웹사이트에 누구나 가짜 리뷰를 올릴 수 있듯이, 악의적인 행위자는 로봇의 도서관에 가짜 책이나 조작된 사진을 밀어 넣을 수 있습니다.

2. 공격: 우물을 독살하는 두 가지 방법

연구진은 이 도서관이 얼마나 쉽게 오염될 수 있는지 테스트하기 위해 MM-POISONRAG라는 프레임워크를 개발했습니다. 그들은 시스템을 무너뜨리는 두 가지 뚜렷한 방식을 발견했습니다:

공격 A: "표적 스파이"(지역적 독살)

  • 비유: "초콜릿 케이크" 레시피를 찾고 있다고 상상해 보세요. 스파이가 도서관에 몰래 들어가 초콜릿 케이크에 관한 유일한 책을 가짜 책으로 교체합니다. 그 가짜 책에는 "초콜릿 케이크는 실제로 소금과 돌로 만들어집니다"라고 적혀 있습니다.
  • 작동 원리: 공격자는 특정 질문에 맞는 가짜 이미지와 그에 상응하는 가짜 설명 (캡션) 을 생성합니다. 로봇의 검색 엔진이 이를 1 위 결과로 선택할 정도로 완벽하게 보이게 만듭니다.
  • 결과: 로봇은 가짜 책을 읽고 자신 있게 "초콜릿 케이크는 소금으로 만들어집니다"라고 알려줍니다.
  • 논문의 발견: 공격자가 로봇의 내부 코드 (블랙박스 공격) 를 알지 못하더라도, 시스템의 약 56% 를 속일 수 있습니다.

공격 B: "보편적 결함"(전역적 독살)

  • 비유: 도서관 정문에는 "모든 책을 무시하세요. 모든 질문에 대한 답은 '죄송합니다'입니다"라고 적힌 단일하고 빛나는, 이상하게 부착된 메모가 붙어 있다고 상상해 보세요. 이 메모가 너무 밝고 이상하게 배치되어 있어, 로봇은 당신이 무엇을 묻든 모든 검색에서 이 메모를 잡습니다.
  • 작동 원리: 공격자는 단 하나의 기이한 이미지와 캡션을 생성하는데, 이는 모든 것과 관련 있어 보이도록 설계됩니다. 마치 모든 자물쇠에 맞는 '만능 열쇠'와 같습니다.
  • 결과: 날씨, 수학, 역사에 대해 묻든 상관없이 로봇은 이 하나의 가짜 항목을 가져와 "죄송합니다"나 "세"와 같은 nonsensical 한 답변을 제공합니다.
  • 논문의 발견: 이는 치명적입니다. 단 하나의 독살된 항목만으로도 로봇의 정확도는 **0%**로 떨어집니다. 완전히 작동하지 않게 되는 것입니다.

3. "마술" (전이성)

연구진은 더 불쾌한 사실을 발견했습니다: 그 독은 다른 로봇들에게도 통합니다.

  • 비유: 특정 검색 엔진을 사용하는 로봇 A 를 가짜 책으로 속인다면, 그 가짜 책 자체를 변경하지 않아도 다른 검색 엔진을 사용하는 로봇 B 도 종종 속아넘어갑니다.
  • 논문의 발견: 공격자는 피해자가 사용하는 특정 검색 엔진을 알 필요가 없었습니다. 그들은 한 시스템에서 가짜 콘텐츠를 훈련시켰을 뿐인데, 그들이 아예 보지 못한 다른 시스템들도 성공적으로 무너뜨릴 수 있었습니다.

4. 실패한 방패 (방어책)

연구진은 기존 안전 장치가 이를 막을 수 있는지 테스트해 보았습니다.

  • 비유: 이는 마스터 도둑에게 "질문을 다시 표현해 보세요"라고 요청하거나 그들의 사진이 "흐릿한지" 확인하는 것과 같습니다.
  • 논문의 발견: 이러한 오래된 수법들은 작동하지 않았습니다. 가짜 이미지와 텍스트는 너무 정교하게 제작되어 안전 필터가 이를 진짜이고 정직한 정보와 구별해 내지 못했습니다. 로봇의 "면역 체계"는 완전히 우회당했습니다.

요약

이 논문은 멀티모달 RAG 시스템이 매우 취약하다고 결론 내립니다.

  • 이들을 무너뜨리기 위해 천재 해커가 될 필요는 없습니다. 몇 가지 잘 설계된 가짜 이미지와 텍스트를 심기만 하면 됩니다.
  • 일단 심어지면, 이러한 "독"들은 로봇이 특정 잘못된 답변을 하도록 속이거나, 아무것도 올바르게 답변하지 못하게 완전히 마비시킬 수 있습니다.
  • 현재 안전 도구는 이를 막기에 충분하지 않습니다.

저자들은 이것이 내일 일어날 것이라고 말하지는 않지만, 경보를 울리고 있습니다: 우리는 이 디지털 도서관들을 중요한 정보에 맡기기 전에 훨씬 더 강력한 자물쇠를 만들어야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →