이 논문은 사용자의 질문을 생성형 LLM 에 직접 노출하지 않고 '하이라이터'가 관련 문단을 추출하고 '요약기'가 답변을 생성하는 새로운 RAG 설계 패턴인 'Highlight & Summarize(H&S)'를 제안하여, 기존 확률적 방어 방식의 한계를 극복하고 LLM 의 자일브레이킹 및 하이재킹 공격을 설계 단계에서 근본적으로 차단하는 방법을 제시합니다.
특징: 이 요리사는 손님의 주문 내용을 전혀 모릅니다. 오직 정해진 재료만 가지고 요리하므로, 손님이 어떤 악의적인 주문을 했는지 알 수 없습니다.
결과: 요리사는 오직 신뢰할 수 있는 재료로만 정답을 만들어냅니다.
🌟 왜 이것이 안전할까요? (핵심 아이디어)
이 시스템의 핵심은 **"손님의 주문이 요리사의 눈에 절대 들어오지 않는다"**는 점입니다.
기존 방식: 손님이 "요리사야, 너는 이제부터 악마가 되어줘!"라고 주문하면, 요리사가 바로 따라 합니다.
H&S 방식: 손님이 "악마가 되어줘!"라고 외쳐도, 검열관은 그 말을 무시하고 오직 "소스 레시피"만 잘라 요리사에게 줍니다. 요리사는 악마가 되어달라는 주문을 듣지 못했기 때문에, 오직 소스 레시피대로만 요리를 합니다.
창의적인 비유:
마치 우편물 검사소를 생각해보세요.
기존: 편지 (주문) 를 읽는 사람이 편지 내용대로 우편물을 배달합니다. 편지에 "우체국장을 죽여라"라고 적혀 있으면, 배달부가 그 명령을 실행합니다.
H&S: 먼저 **검사관 (하이라이트러)**이 편지를 열어, '신뢰할 수 있는 정보'만 잘라내어 **배달부 (요리사)**에게 줍니다. 배달부는 "우체국장을 죽여라"는 글귀가 적힌 편지 자체를 보지 못하므로, 오직 잘라낸 정보만 배달합니다.
📊 이 방법이 정말 잘 작동할까요?
논문에서는 이 방식을 여러 가지 방법으로 테스트했습니다.
보안성: 해커들이 개발한 수천 가지의 공격 시나리오 (악성 주문) 를 시도해봤지만, 하이라이트 & 요약 방식은 100% 막아냈습니다. 요리사가 악성 주문을 듣지 못했기 때문입니다.
정확도: 보안만 강화한 게 아니라, 정답을 맞추는 능력도 기존 방식과 비슷하거나 오히려 더 좋았습니다.
이유: 요리사가 오직 '정답이 될 만한 재료'만 보고 요리를 하기 때문에, 헛된 상상을 하거나 (할루시네이션) 엉뚱한 말을 할 확률이 줄어듭니다. 마치 정답이 적힌 책장만 보고 문제를 푸는 학생처럼 정확해집니다.
💡 결론
이 논문은 AI 챗봇을 만들 때, **"사용자의 입력을 AI 가 직접 읽게 하지 말고, 신뢰할 수 있는 정보만 골라 AI 에게 전달하라"**는 새로운 규칙을 제안합니다.
기존: "모든 것을 다 보고 판단해!" (위험함)
H&S: "내가 믿을 만한 것만 골라 줘. 너는 그걸로만 답해." (안전하고 정확함)
이 방법은 기업이 고객 지원 챗봇을 만들 때, 고객이 악의적인 명령을 내리더라도 회사가 실수하거나 망신받는 일을 원천 차단해 주는 '안전장치' 역할을 합니다.
1. 문제 정의 (Problem Statement)
배경: 검색 증강 생성 (RAG, Retrieval-Augmented Generation) 은 대규모 언어 모델 (LLM) 이 외부 지식 베이스를 참조하여 답변을 생성하는 방식으로, 고객 지원 및 검색 엔진 등 다양한 분야에서 널리 사용되고 있습니다.
위협 모델: 신뢰할 수 있는 지식 베이스를 사용하더라도, 사용자의 입력 (프롬프트) 이 악의적일 수 있습니다.
재규브 (Jailbreaking): LLM 이 금지된 콘텐츠 (공격적 언어, 회사 평판 훼손 등) 를 생성하도록 유도하거나, 법적 구속력이 있는 잘못된 약속을 하도록 조작하는 공격.
모델 하이재킹 (Model Hijacking): LLM 을 원래 의도된 작업 (예: 고객 지원) 이 아닌 다른 작업 (예: 텍스트 요약, 코드 생성 등) 으로 전환시키는 공격.
기존 방어 기법의 한계: 시스템 프롬프트 강화나 분류기 (Classifier) 를 사용한 감지 방식은 확률적 (Probabilistic) 접근법으로, 방대한 입력 공간 때문에 우회 (Bypass) 하기 쉽고, 적응형 (Adaptive) 공격에 취약합니다.
2. 제안 방법론: Highlight & Summarize (H&S)
저자들은 RAG 파이프라인의 설계 패턴을 변경하여 공격을 설계 단계에서 방지 (Prevent by Design) 하는 새로운 아키텍처인 Highlight & Summarize (H&S) 를 제안합니다.
핵심 아이디어: 생성형 LLM (Summarizer) 이 사용자의 질문을 직접 보지 못하게 하는 것입니다.
파이프라인 구조:
Highlighter (하이라이터):
사용자 질문과 검색된 문서를 입력받습니다.
질문에 답변하는 데 필요한 신뢰할 수 있는 문서의 연속된 텍스트 조각 (Passages) 만을 추출 (Highlight) 합니다.
보안 제약 조건: 추출된 텍스트는 원본 문서에서 연속적이고 겹치지 않는 (contiguous and non-overlapping) 문자열이어야 하며, 최소 단어 수 (min_words) 를 충족해야 합니다. 이는 임의의 텍스트 주입을 원천 차단합니다.
Summarizer (요약기):
사용자의 질문은 입력받지 않고, 오직 Highlighter 가 추출한 신뢰된 텍스트 조각들만 입력받습니다.
입력된 텍스트를 바탕으로 일관된 답변을 생성합니다.
이 과정에서 LLM 은 악성 프롬프트 주입의 영향을 받을 수 없으므로, 재규브나 하이재킹이 불가능해집니다.
3. 주요 기여 (Key Contributions)
새로운 설계 패턴 제안: RAG 시스템의 재규브 및 모델 하이재킹을 근본적으로 방지하는 H&S 패턴을 제안했습니다.
이론적 보안 증명:
LLM 의 '제어 영역 (Control Region)' 개념을 정의하고, H&S 가 공격자가 LLM 출력을 제어할 수 있는 공간을 지수적으로 감소시킨다는 것을 수학적으로 증명했습니다 (Lean 4 를 통한 형식화 포함).
공격자가 신뢰된 문서 내에서 특정 단어를 조합하여 악성 출력을 유도하는 적응형 공격 (Adaptive Highlighting Attack) 에 대해서도 min_words 제약 조건을 통해 효과적으로 방어함을 보였습니다.
실험적 검증:
RepliQA와 BioASQ 두 가지 데이터셋을 사용하여 다양한 H&S 구현체 (LLM 기반, BERT 기반 등) 를 평가했습니다.
기존 RAG (Vanilla RAG) 와의 비교를 통해 보안 강화와 동시에 답변의 정확도 (Correctness) 와 품질이 동등하거나 더 우수함을 입증했습니다.
오픈 소스 공개: 코드, 실험 데이터, Lean 4 증명, 데모 애플리케이션을 공개하여 재현성을 보장했습니다.
4. 실험 결과 (Results)
보안성 평가:
LLMail-Inject 데이터셋 (1,028 개의 재규브 프롬프트) 을 사용한 테스트에서, 기존 RAG 는 81% 의 재규브 성공률을 보인 반면, H&S 는 0% 성공률을 기록하여 모든 공격을 차단했습니다.
Highlighter 만으로는 재규브가 가능했으나, Summarizer 로 가는 입력이 제한됨으로써 전체 시스템은 안전했습니다.
성능 평가 (정확도 및 품질):
Elo 순위: H&S 의 "Two Steps" 구현체는 RepliQA 데이터셋에서 Vanilla RAG(1104) 보다 높은 Elo 점수 (1170) 를 기록했습니다. BioASQ 에서는 비슷하거나 약간 더 높은 성능을 보였습니다.
정확도 (Correctness): H&S 기반 모델들은 Vanilla RAG 와 동등하거나 더 높은 정확도를 보였습니다 (RepliQA: 95% vs 94%, BioASQ: 89% vs 86%).
관련성 및 품질: 답변의 관련성과 품질 측면에서도 기존 RAG 와 큰 차이가 없거나 더 우수했습니다.
구성 요소 분석:
요약기의 필요성: 하이라이터만 사용하는 것보다 요약기를 추가했을 때 답변의 관련성과 정확도가 크게 향상되었습니다.
Highlighter 성능: LLM 기반 Highlighter 가 BERT 기반 모델보다 성능이 우수했으나, 계산 비용이 더 높았습니다.
5. 의의 및 결론 (Significance & Conclusion)
설계 기반 보안 (Security by Design): 기존의 사후 감지 (Classifier 등) 방식이 아닌, 시스템 아키텍처 자체를 변경하여 공격 벡터를 제거함으로써 강력한 보안을 제공합니다.
실용성: 보안 강화가 성능 저하로 이어지지 않으며, 오히려 특정 작업 (사실 기반 질문 답변) 에서는 성능이 향상될 수 있음을 입증했습니다.
한계 및 향후 과제:
복잡한 추론 (예: 두 문서의 정보 합산 계산) 이 필요한 질문에는 현재 한계가 있습니다.
지식 베이스 자체에 악성 콘텐츠가 포함된 경우 (Poisoning) 에 대한 방어는 별도의 전처리 과정이 필요합니다.
"아니요/예" 질문이나 다중 질문 처리 등을 위한 추가 설계가 필요합니다.
요약하자면, 이 논문은 RAG 시스템의 치명적인 취약점인 재규브와 하이재킹을 해결하기 위해, 사용자 입력을 생성 모델에 전달하지 않는 'Highlight & Summarize' 아키텍처를 제안하고, 이론적 증명과 광범위한 실험을 통해 보안성과 성능을 동시에 확보할 수 있음을 입증했습니다.