← 최신 논문
💬 NLP

TriShieldRAG: A Three-Ring Defense-in-Depth Framework Against Knowledge Corruption in Retrieval-Augmented Generation

TriShieldRAG는 인제스트 가드(ingest guard), 리트리벌 스코어러(retrieval scorer), 그리고 교차 LLM 합의 메커니즘을 결합함으로써 일반적인 질의에 대한 정확도를 유지하면서도 검색 증강 생성(RAG) 시스템의 지식 포이즈닝 공격 성공률을 약 91%에서 13%로 크게 낮추는 3계층 방어 프레임워크입니다.

원저자: Susil Kumar Mohanty, Rohit Patel, Kosuru Yuvaraj, Jeenal Chaudhary, Disha Singhania

게시일 2026-07-28
📖 5 분 읽기🧠 심층 분석

원저자: Susil Kumar Mohanty, Rohit Patel, Kosuru Yuvaraj, Jeenal Chaudhary, Disha Singhania

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 가장 똑똑한 로봇 친구인 "오라클(The Oracle)"이 거의 모든 것을 알고 있는 세상을 상상해 보세요. 하지만 여기 함정이 있습니다. 오라클은 수년 전 학교에서 배웠던 것들만 기억합니다. 만약 당신이 아주 최신 영화나 비밀스러운 가족 레시피에 대해 묻는다면, 오클은 추측하거나 이야기를 지어내야 합니다. 이를 해결하기 위해 우리는 오라클에게 도서관 대출 카드를 주었습니다. 이제 당신이 질문을 할 때마다, 오라클은 도서관에서 몇 권의 책을 빠르게 가져와 읽고, 그 신선한 정보를 사용하여 답변합니다. 이것을 검색 증강 생성(Retrieval-Augmented Generation), 줄여서 RAG라고 부릅니다. 이것은 마치 시험 직전에 천재에게 커닝 페이퍼를 주는 것과 같습니다.

하지만 이 설정에는 교활한 문제가 있습니다. 만약 누군가 도서관에 몰래 잠입하여 진짜 책과 똑같이 생긴 가짜 책 몇 권을 심어 놓는다면 어떻게 될까요? 만약 그 가짜 책들이 진짜 정답 바로 옆에 놓인다면, 오라클은 그것을 읽고 사실이라고 믿어버려 당신에게 완전히 틀린 답을 줄 수도 있습니다. 이것을 **데이터 포이즈닝(data poisoning)**이라고 합니다. 이것은 마치 케이크 레시피의 재료를 소금과 모래로 바꿔치기하는 장난과 같습니다. 제빵사(오라클)는 지시사항을 완벽하게 따르지만, 결과는 재앙이 됩니다. 과학자들이 현재 던지는 큰 질문은 이것입니다: 어떻게 하면 우리 똑똑한 로봇들이 가짜 도서관 책에 속아 넘어가는 것을 막을 수 있을까?

이 논문은 TriShieldRAG라는 이름의 새롭고 매우 안전한 도서관 시스템을 소개합니다. 단 한 명의 보안 요원이 책을 확인하는 대신, 저자들은 마치 세 겹의 보호층이 있는 성처럼 세 개의 고리 방어 체계를 구축했습니다. 그들은 이 시스템을 특정 종류의 장난꾸러기(로봇을 속이기 위해 다섯 권의 가짜 책을 심는 사람)를 대상으로 테스트했으며, 방어 장치가 없을 때는 로봇이 속는 비율이 **91%**였던 반면, 새로운 삼중 고리 시스템을 사용했을 때는 그 속임수 비율이 단 **13%**로 떨어졌음을 발견했습니다.

세 개의 방어 고리

도서관을 바쁜 공항이라고 생각해 보세요. 가짜 책들은 통과하려고 시도하는 "독(poison)"입니다. 저자들은 책이 오라클에게 도달하기 전에 통과해야 하는 세 개의 체크포인트, 즉 "고리(ring)"를 설계했습니다.

고리 1: 입구의 문지기 (Ingest Guard)
첫 번째 고리는 누군가 책을 선반에 넣으려고 할 때마다 모든 책을 엄격하게 검사하는 엄격한 문지기와 같습니다. 이 문지기는 명백한 위험 신호를 찾습니다. 만약 책이 이상하고 반복적인 방식으로 쓰여 있거나, 당신이 물어볼 질문 그 자체를 포함하고 있다면(예를 들어, "전구를 누가 발명했는가?"라는 제목의 책이 정답 바로 옆에 놓여 있는 경우), 문지기는 즉시 그 책을 쫓아냅니다. 논문의 테스트에서, 이 고리는 가짜 책의 대다수를 도서관에 들어오기도 전에 잡아내는 핵심적인 역할을 했습니다. 이것은 첫 번째 방어선으로, 가장 조잡한 속임수들을 문앞에서 차단합니다.

고리 2: 신뢰할 수 있는 사서 (Retrieval Scorer)
때로는 가짜 책이 너무 잘 쓰여서 문지기가 놓칠 수도 있습니다. 그 책은 선반에 슬쩍 올라갑니다. 당신이 질문을 하면, 도서관은 가장 관련성이 높아 보이는 상위 5권의 책을 꺼냅니다. 고리 2는 이 다섯 권의 책을 재평가하는 똑똑한 사서입니다. 이 사서는 단순히 책이 질문과 얼마나 잘 매치되는지만 보는 것이 아니라, 두 가지 다른 사항을 추가로 확인합니다: 출처(Provenance) (이 책은 어디에서 왔는가? 유명한 백과사전처럼 신뢰할 수 있는 출처인가, 아니 아니면 무작위 블로그인가?) 그리고 일관성(Consistency) (다른 책들이 이 책과 일치하는가?). 만약 어떤 책이 출처가 불분명하고 나머지 네 권의 책과 모순된다면, 사서는 그 책을 의심스럽다고 표시하고 줄의 맨 뒤로 밀어냅니다. 논문은 이 고리가 가짜 책들이 여전히 더미 안에서 "소수"인 동안에는 가장 잘 작동한다고 언급합니다. 만약 장난꾸러기가 전체 선반을 가짜로 채워버린다면, 이 고리는 혼란에 빠질 수 있습니다.

고리 3: 판사단 (Cross-LLM Consensus)
책들이 첫 번째와 두 번째 고리를 통과하여 오라클에게 전달되면, 고리 3이 개입합니다. 단 하나의 로봇에게 답을 구하는 대신, 이 고리는 세 대의 서로 다른 로봇(구체적으로 Claude, Mistral Small, Llama 3.2라는 모델)에게 동일한 책을 읽고 질문에 답하도록 요청합니다. 이 세 로봇은 서로 다른 회사에서 만들어졌으며 서로 다른 "성격"을 가지고 있습니다. 세 로봇이 정답에 동의한다면 좋습니다! 하지만 만약 의견이 갈린다면, 시스템은 무언가 수상하다고 가정합니다. 그런 다음 가장 의심스러운 책들을 버리고 로봇들에게 새로운 책 세트로 다시 시도하라고 요청합니다. 이 "투표" 시스템은 설령 한 로봇이 영리한 가짜 책에 속더라도, 다른 두 로로봇이 거짓을 찾아내어 경로를 바로잡을 수 있도록 보장합니다.

논문이 발견한 것 (그리고 발견하지 못한 것)

저자들은 5,000개의 실제 위키피디아 문서10개의 특정 질문을 사용하여 테스트를 수행했습니다. 그들은 시스템을 속이기 위해 설계된 5권의 가짜 책을 심었습니다. 방어 장치가 없을 때, 시스템은 **91%**의 확률로 속았습니다. 전체 TriShieldRAG 시스템을 켰을 때, 속임수 비율은 **13%**로 급감했습니다.

하지만 이 논문은 아직 무엇을 입증하지 못했는지에 대해서도 매우 솔직합니다. 그들이 테스트한 "장난꾸러기"는 **비적응형(non-adaptive)**이었습니다. 즉, 장난꾸러기는 세 개의 고리에 대해 알지 못했고 표준적인 속임수만을 사용했습니다. 저자들은 더 똑똑한 장난꾸러기가 문지기와 사서가 어떻게 작동하는지 정확히 알고 있다면, 그들을 뚫고 가짜 책을 몰래 들여보낼 수도 있다는 점을 인정합니다. 또한 그들은 자신들의 "소수 독성(minority-poison)" 규칙(가짜 책이 진짜 책보다 적을 때 고리 2와 3이 더 잘 작동한다는 규칙)이 수학과 논리에서 도출되었지만, 모든 시나리오에서 이것이 유효하다는 것을 증证明하기 위한 대규모 실험은 아직 수행하지 않았다고 지적합니다.

또한 저자들은 시스템이 세 개의 서로 다른 로봇에게 의견을 물어야 하기 때문에 실행하는 데 시간이 더 걸리고 비용이 더 많이 든다는 점을 언급했습니다. 실제 애플리케이션에서는 모든 질문에 대해 이 강력한 검사를 사용하는 것이 아니라, 까다로운 질문에 대해서만 사용할 수도 있습니다.

결론

TriShieldRAG는 데이터 포이즈닝을 불가능하게 만드는 마법 지팡이가 아닙니다. 대신, 그것은 장난꾸러기가 성공하기를 매우 어렵게 만드는 견고하고 다층적인 방패입니다. 책이 도착할 때 확인하고, 선택될 때 재확인하며, 판사단이 최종 답변을 검증함으로써, 이 시스템은 거의 모든 속임수를 잡아냅니다. 이 논문은 우리가 아직 모든 공격을 막을 수는 없지만, 이 세 개의 고리 접근 방식이 우리의 AI 친구들이 가짜 정보에 속지 않도록 하는 데 있어 거대한 진전임을 시사합니다. 저자들은 이미 더 똑똑한 장난꾸러기와 더 큰 규모의 도서관를 대상으로 테스트할 계획을 세우고 있지만, 현재로서는 세 개의 머리(그리고 세 개의 고리)가 하나보다 확실히 낫다는 것을 보여주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →