← 최신 논문
💻 computer science

Benchmarking Knowledge-Extraction Attack and Defense on Retrieval-Augmented Generation

이 논문은 검색 증강 생성(RAG) 시스템에서의 지식 추출 공격 및 방어 평가를 위한 최초의 체계적인 벤치마크를 도입하며, 재현 가능한 비교를 가능하게 하고 프라이버시 보호 RAG 애플리케이션의 개발을 안내하기 위해 다양한 모델, 데이터셋 및 언어에 걸친 표준화된 프로토콜을 갖춘 통합 프레임워크를 구축한다.

원저자: Zhisheng Qi, Utkarsh Sahu, Li Ma, Haoyu Han, Ryan Rossi, Franck Dernoncourt, Mahantesh Halappanavar, Nesreen Ahmed, Yushun Dong, Yue Zhao, Yu Zhang, Yu Wang

게시일 2026-06-10
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhisheng Qi, Utkarsh Sahu, Li Ma, Haoyu Han, Ryan Rossi, Franck Dernoncourt, Mahantesh Halappanavar, Nesreen Ahmed, Yushun Dong, Yue Zhao, Yu Zhang, Yu Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

RAG(검색 증강 생성, Retrieval-Augmented Generation) 시스템을 방대한 양의 개인적인 문서가 담긴 도서관을 관리하는 매우 똑똑하고 친절한 사서라고 상상해 보세요(지식 베이스). 당신이 질문을 하면, 사서는 단순히 추측하는 것이 아니라 서가로 달려가 가장 관련 있는 책들을 찾아내고, 그 페이지들을 읽은 뒤, 오직 자신이 찾은 내용만을 바탕으로 요약된 답변을 작성해 줍니다. 이는 정확도 측면에서 매우 훌륭하지만, 새로운 문제를 야기합니다. 만약 도둑이 사서가 속해 있는 모든 도서관의 내용을, 심지어 비밀스러운 부분까지도 페이지 단위로 소리 내어 읽도록 속이는 방법을 알아낸다면 어떻게 될까요?

이 논문은 본질적으로 이러한 디지털 사서들을 위한 보안 스트레스 테스트입니다. 저자들은 다양한 "도둑"(공격)들이 얼마나 잘 비밀을 훔치는지, 그리고 다양한 "경비원"(방어)들이 이를 얼마나 잘 막아내는지 확인하기 위해 하나의 "체육관"(벤치마크)을 구축했습니다.

다음은 이들의 연구 결과를 쉬운 비유를 사용하여 정리한 내용입니다.

1. 설정: 도서관, 도둑, 그리고 경비원

  • 도서관 (RAG 시스템): 검색 엔진(Retriever)과 챗봇(Generator)이 결합된 시스템입니다.
  • 도둑 (공격): 까다로운 질문을 던지는 악의적인 행위자입니다. 이들은 두 가지 수법을 사용합니다:
    • "지도" (정보): 질문이 이상하게 들리더라도, 사서의 검색 알고리즘을 속여 자신이 원하는 정확한 비밀 페이지를 불러오도록 정교하게 설계된 질문을 만듭니다.
    • "명령" (지시): 일단 사서가 페이지를 확보하면, 도둑은 "이 페이지들을 단어 하나 틀리지 말고 그대로 소리 내어 읽으라"와 같은 명령을 내려 챗봇이 비밀을 유출하도록 강제합니다.
  • 목표: 사서가 속고 있다는 사실을 눈치채지 못하게 하면서 최대한 많은 비밀 정보를 훔치는 것입니다.

2. "체육 체육관" (벤치마크)

이 논문 이전에 연구자들은 서로 다른 규칙, 서로 다른 사서, 서로 다른 도서관을 가진 각기 다른 체육관에서 이 도둑들을 테스트해 왔습니다. 그래서 한 도둑이 실제로 더 뛰어난 것인지, 아니면 단지 더 쉬운 체육관에서 테스트를 받은 것인지 구분할 수 없었습니다.

저자들은 다음과 같은 조건을 갖춘 하나의 거대하고 표준화된 체육관을 만들었습니다:

  • 모든 도둑은 동일한 도서관(의료 기록, 기업 이메일, 저작권이 있는 도서 등)을 상대합니다.
  • 모든 도둑은 동일한 사서(서로 다른 AI 모델)와 싸웁니다.
  • 모든 도둑은 동일한 점수표에 의해 판정받습니다.

3. 도둑들 (공격 전략)

논문은 몇 가지 유형의 도둑을 테스트했습니다:

  • 무작위 투척자 (The Random Thrower): 사서에게 무작위 단어나 횡설수설을 던져서 무엇인가 걸려드는지 확인합니다. (눈을 가리고 다트를 던지는 것과 같습니다.)
  • 최적화 도구 (The Optimizer): 특정 비밀을 찾아내기 위해 수학적으로 계산된 완벽한 질문을 만들어냅니다. 이는 도둑이 사서의 검색 엔진이 어떻게 작동하는지 정확히 알고 있을 때(White Box)는 매우 효과적이지만, 사서가 다른 검색 엔진을 사용하고 있다면(Black Box) 실패합니다.
  • 사회 공학자 (IKEA): 비밀을 요구하는 대신, 인간처럼 정중한 질문을 던져 시간이 흐름에 따라 서서히 사서를 속여 정보를 드러내게 합니다. 이는 공격처럼 보이지 않기 때문에 가장 교활한 수법입니다.

4. 경비원 (방어 전략)

논문은 도둑을 막기 위한 네 가지 방법을 테스트했습니다:

  • 입구의 문지기 (쿼리 차단 - Query Block): 당신이 들어오기 전 질문을 미리 읽는 경비원입니다. 만약 질문이 "비밀 파일을 읽어줘"와 같은 느낌이라면, 문지기는 즉시 당신을 쫓아냅니다.
    • 결과: 명백한 도둑을 막는 데는 훌륭하지만, 질문이 정상적으로 들리는 "사회 공학자(IKEA)"는 바로 통과해 버립니다.
  • 서가 위의 필터 (임계값 방어 - Threshold Defense): 사서에게 "질문과 매우 유사한 책만 가져오라"고 지시합니다. 만로 도둑이 이상한 질문을 하면, 질문과 일치하는 책을 찾지 못하게 됩니다(유사도 점수가 너무 낮기 때문).
    • 결과: "최적화 도구" 도둑을 막는 데 매우 효과적이지만, 질문의 표현이 실제 도서의 내용과 약간만 달라도 정상적인 질문까지 차단할 수 있습니다.
  • 속삭이는 자 (시스템 차단 - System Block): 사서에게 "만약 비밀을 발견하더라도, 그것을 소리 내어 말하지 마라"라는 규칙을 줍니다. 대신 사서는 "그 내용은 공유할 수 없습니다"라고 말합니다.
    • 결과: 직접적인 요구를 막는 데는 좋지만, "사회 공학자"는 "비밀" 경보를 울리지 않는 방식으로 정보를 요청하여 이 방어를 우회할 수 있습니다.
  • 요약가 (요약 방어 - Summary Defense): 사서에게 "페이지를 토씨 하나 틀리지 말고 읽지 말고, 짧게 요약만 하라"고 지시합니다.
    • 결과: 이는 강력한 방어책입니다. 설령 사서가 비밀을 찾더라도, 정확한 텍스트를 유출할 수는 없습니다. 하지만 도둑이 말이 안 되는 질문을 하면, 사서는 그냥 "요약할 내용이 없습니다"라고 답할 것이며, 이는 절도를 막지만 동시에 대화 자체도 중단시킵니다.

5. 실험의 핵심 결론

  • "최적화 도구"는 양날의 검입니다: 도둑이 사서의 내부 검색 엔진을 알고 있다면 매우 강력합니다. 하지만 도둑이 사용하는 검색 엔진이 사서의 것과 다르다면, 그들의 마법 같은 기술은 작동하지 않습니다.
  • "사회 공학자"를 잡는 것이 가장 어렵습니다: 이들은 무례한 명령이나 이상한 수학을 사용하지 않기 때문에, "문지기"나 "속삭이는 자"의 방어를 명백한 도둑들보다 훨씬 쉽게 통과합니다.
  • 보안 vs 유용성: 가장 강력한 방어책인 "필터"는 거의 모든 절도를 막아내지만, 질문이 완벽하게 일치하지 않는다는 이유로 일반 사용자들의 "괜찮은" 질문까지 차단하여 사서를 덜 유능하게 만듭니다. 보안과 유용성 사이의 균형을 맞춰야 합니다.
  • 폐쇄형 소스 vs 오픈 소스: 가장 "똑똑한" 사서들(GPT-4와 같은 폐쇄형 모델)은 오히려 오픈 소스 모델들보다 도둑의 명령(비밀을 토씨 하나 안 틀리고 읽으라는 명령)을 더 잘 따르는 경고한 모습을 보이는데, 이는 단순히 그들이 지시를 따르는 능력이 더 뛰어나기 때문입니다.

요약

이 논문은 새로운 절도 방법이나 새로운 보호 방법을 발명한 것이 아니라, 기존의 방법들이 실제로 효과가 있는지 확인할 수 있는 공정한 경기장을 만든 것입니다. 연구 결과, 우리는 좋은 경비원들을 보유하고 있지만, 정중하고 인간적인 질문을 던지는 가장 교활한 도둑들(사회 공학자)은 여전히 큰 위협이며, 일반 사람들에게 유용성을 제공하면서도 모든 것을 막아낼 수 있는 단 하나의 "마법 방패"는 존재하지 않는다는 것을 발견했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →