← 최신 논문
💬 NLP

SilentRetrieval: Hijacking Retrieval-Augmented Generation via Semantically-Preserving Adversarial Data Poisoning

본 논문은 의미적 일관성을 유지하여 탐지를 회피하면서도 높은 검색 순위를 유지하고 대규모 언어 모델의 출력을 성공적으로 조작하는 유창하게 제작된 적대적 문서를 주입함으로써 검색 증강 생성 시스템을 장악하는 2 단계 데이터 중독 공격인 SilentRetrieval 을 소개합니다.

원저자: Jiachen Qian

게시일 2026-05-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jiachen Qian

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

검색 증강 생성 (RAG) 시스템을 매우 똑똑하지만 약간 건망증이 있는 사서로 상상해 보세요. 질문을 받으면 이 사서는 자신의 기억 (구식이거나 사실을捏作할 수 있음) 에만 의존하지 않고, 거대한 책 도서관 (코퍼스) 으로 달려가 가장 관련성 높은 페이지를 찾아 읽고, 그 내용을 바탕으로 답변을 작성합니다.

논문 "SilentRetrieval" 은 이 사서를 해킹하는 새로운 교묘한 방법을 설명합니다. 소리를 지르거나 도서관 창문을 부수는 것 (명백한 행위) 대신, 공격자는 완벽하게 작성된 가짜 책 한 권을 책장에 슬쩍 끼워 넣습니다. 사서가 답변을 찾다가 이 가짜 책을 먼저 발견하고 읽은 후, 완전히 진실처럼 들리는 거짓말을 자신 있게 알려주는 것입니다.

다음은 이 공격이 작동하는 방식을 간단한 단계로 나눈 것입니다:

1. 문제: "나를 믿어" 도서관

사서는 책장에 있는 책들을 신뢰합니다. 책들이 깨끗하고 정확하다면 사서는 좋은 답변을 줍니다. 하지만 누군가 진짜 책과 똑같이 생긴 가짜 책을 몰래 끼워 넣으면, 사서는 실제 사실 대신 그 가짜 책을 집어 들게 되어 "할루시네이션"(자신감 있는 거짓말) 이 발생합니다.

2. 공격: "SilentRetrieval"

연구자들은 들키지 않고 이 가짜 책을 만들기 위한 두 단계 방법을 개발했습니다.

1 단계: "완벽한 맞춤" (Coordinated Beam Search)
실제 백과사전 항목의 단락을 거짓말로 대체하고 싶다고 가정해 보세요. 하지만 무작위적인 망가진 글을 그 위에 적어대면 사서가 즉시 발견하고 폐기해 버립니다.

  • 옛날 방식: 이전 해커들은 터무니없는 말이나 명백한 망가진 글을 작성했습니다. 사서의 "유창성 필터"(텍스트가 자연스럽게 들리는지 확인하는 도구) 가 즉시 이를 발견하고 거부했습니다.
  • SilentRetrieval 방식: 공격자는 정교한 알고리즘을 사용하여 실제 기사의 단어를 거짓말을 포함하도록 최소한으로 조정합니다. 하지만 문장 구조와 흐름은 매끄럽게 유지하여 여전히 정상적인 백과사전 항목처럼 들리게 만듭니다. 마치 레시피에 "소금" 대신 "독"을 넣으라고 수정하되, 레시피가 여전히 정상적이고 맛있는 요리처럼 보이도록 아주 세밀하게 조작하는 것과 같습니다.
  • 목표: 가짜 책이 사용자가 주제를 검색할 때 사서가 찾는 가장 관련성 높은 책이 되도록 보장하는 것입니다.

2 단계: "부드러운 전환" (Context-Adaptive Trigger Generation)
가짜 단락이 준비되면, 공격자는 사서가 그 거짓말을 읽을 때 실제로 믿게 만들어야 합니다.

  • 단순히 끝에 무작위 문장을 붙이는 것 (예: "하늘은 초록색이다!") 대신, 시스템은 또 다른 AI 를 사용하여 가짜 단락과 완벽하게 어우러지는 "트리거" 문장을 작성합니다.
  • 이는 기사의 어조에 맞는 자연스러운 결론이나 "확인된 사실"처럼 들립니다. 페이지에 붙인 어색한 메모와 이야기의 일부처럼 자연스럽게 흐르는 문장의 차이와 같습니다.

3. 결과: 이 해킹은 얼마나 효과적인가?

연구자들은 이 방법을 두 개의 거대한 디지털 도서관 (하나는 36 만 1 천 페이지, 다른 하나는 880 만 페이지) 에서 테스트했습니다.

  • 은밀성: 가짜 문서는 실제 문서와 거의 구별할 수 없었습니다. 인간 심사자들이 이를 검토했을 때, 15% 정도만 "의심스러움"으로 표시한 반면, 이전의 투박한 해킹 방법은 83% 에서 의심스러움으로 표시되었습니다. "이상한 단어 패턴"을 확인하는 컴퓨터에게도 가짜 책은 실제 책과 거의 비슷하게 정상적으로 보였습니다.
  • 성공률: 사서에게 질문을 했을 때, 가짜 책은 (작은 도서관에서) 84.6% 의 빈도로 발견되었습니다. 일단 발견되면 사서는 그 거짓말을 믿고 57.5% 의 확률로 잘못된 답변을 제공했습니다.
  • "큰 도서관" 테스트: 2,100 만 페이지가 있는 거대한 도서관에서도 테스트했을 때, 가짜 책은 여전히 검색 결과 최상단에 74.2% 의 빈도로 나타났습니다.

4. 방어: 이를 어떻게 막을 것인가?

논문은 사서를 보호하는 방법도 테스트했습니다:

  • "제 2 의 의견" (재순위화): 사서가 최상위 결과를 더 엄격하고 비판적인 "제 2 의 사서"(크로스 인코더) 로 다시 확인하면, 가짜 책이 선택될 가능성이 줄어듭니다.
  • "그룹 투표" (Passage Isolation): 사서가 한 페이지만 읽고 결정하도록 하는 대신, 다섯 개의 다른 페이지를 읽게 하고 답변에 대해 투표하게 합니다. 가짜 책이 거짓말을 담고 있는 유일한 책이라면, 나머지 네 개의 실제 책이 이를 압도할 것입니다.
  • 결과: 이러한 방어 수단들을 결합 (제 2 의 사서 + 그룹 투표) 하면 공격의 성공률을 57.5% 에서 21.3% 로 낮출 수 있었습니다. 다만, 이로 인해 사서의 속도가 약 6 배 느려집니다.

결론

이 논문은 RAG 시스템에 숨겨진 약점이 있음을 보여줍니다: 코퍼스 무결성. 공격자가 데이터베이스에 몇 개의 완벽하게 작성된 "은밀한" 가짜 문서를 주입할 수만 있다면, 시스템이 문제가 있음을 깨닫지 못한 채 시스템의 답변을 장악할 수 있습니다.

핵심 교훈은 유창성은 양날의 검이라는 점입니다. 공격 텍스트를 너무 완벽하게 들리게 만들면 단순한 필터가 잡아내기 어려워지지만, 동시에 AI(그리고 인간) 가 이를 더 신뢰할 가능성이 높아져 공격이 훨씬 더 위험해집니다. 논문은 안전을 유지하기 위해 가짜 뉴스를 한 가지 방법으로만 탐지하는 데 의존하기보다는, 여러 가지 검증과 견제 장치를 갖춘 "계층적" 방어가 필요하다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →