← 최신 논문
🤖 AI

Addressing Corpus Knowledge Poisoning Attacks on RAG Using Sparse Attention

이 논문은 검색 증강 생성(RAG) 시스템에서 유해한 문서 간 상호작용을 방지하기 위해 블록 희소 주의 집중(block-sparse attention)을 사용하는 새로운 방어 메커니즘인 Sparse Document Attention RAG(SDAG)를 소개하며, 이를 통해 코퍼스 지식 오염 공격을 유의미하게 완화하고 기존의 최첨단 방어 기제들을 능가하는 성능을 보여준다.

원저자: Sagie Dekel, Moshe Tennenholtz, Oren Kurland

게시일 2026-08-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sagie Dekel, Moshe Tennenholtz, Oren Kurland

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 인공지능의 지형에서 대규모 언어 모델은 인간 지식의 방대한 저장소 역할을 하며, 놀라운 유창함으로 질문에 답하고 텍스트를 생성할 수 있습니다. 그러나 이 모델들에는 한계가 있습니다. 이들은 특정 시점에서 멈춘 데이터로 학습되었기 때문에, 도움 없이는 최근의 사건이나 특정 분야의 미세한 사실들을 알 수 없다는 점입니다. 이를 해결하기 위해 연구자들은 검색 증강 생성(Retrieval-Augmented Generation)이라 불리는 시스템을 개발했습니다. 이 설정에서는 사용자가 질문을 던지면, 시스템이 먼저 방대한 문서 라이브러리를 검색하여 관련 정보를 찾습니다. 그런 다음 질문과 검색된 문서들을 모두 언어 모델에 입력하며, 모델은 이들을 가이드 삼아 정확한 답변을 작성합니다. 이 방식은 AI의 지식을 최신 상태로 유지하고, '환각(hallucination)'이라고 알려진 문제, 즉 AI가 사실을 지어내는 가능성을 줄여줍니다. 하지만 외부 문헌에 대한 바로 이 의존성은 새로운 취약점을 만들어냅니다. 시스템은 찾아낸 문서를 신뢰하기 때문에, 악의적인 행위자가 라이브러리에 거짓 정보를 몰래 주입할 수 있습니다. 만약 시스템이 이렇게 오염된 문서를 검색하게 되면, 진실을 무시하고 대신 거짓을 전달하도록 속을 수 있습니다.

이스라엘 테크니온 공대의 연구진은 이러한 시스템이 정보를 처리하는 방식에서 발생하는 특정한 약점을 식별해냈으며, 이것이 시스템을 그러한 기만에 취약하게 만든다는 것을 밝혀냈습니다. 표준 언어 모델에서 AI가 텍스트의 서로 다른 부분에 집중할 수 있게 해주는 메커니즘은, 모든 단어가 이전의 모든 단어를 연속적인 흐름 속에서 되돌아볼 수 있도록 설계되어 있습니다. 이는 이야기를 쓰거나 단일 기사를 요약할 때처럼 맥락이 한 문장에서 다음 문장으로 자연스럽게 흐르는 경우에는 잘 작동합니다. 그러나 검색 시스템에서 입력값은 종종 함께 붙여넣어진 별개의 독립적인 문서들의 집합체입니다. 연구진은 이러한 문서들을 처리하는 표준 방식이 한 문서의 단어들이 다른 문서의 단어들과 상호작용하게 함으로써 해로운 결과를 초래할 수 있다고 주장합니다. 악의적인 문서가 존재할 때, 그 오도하는 내용은 AI가 진실된 문서들을 이해하는 방식에 영향을 미칠 수 있으며, 결과적으로 전체 답변을 오염시킬 수 있습니다.

이를 해결하기 위해 연구팀은 '희소 문서 주의 집중(Sparse Document Attention)'이라는 새로운 방어 전략을 도입했습니다. AI가 검색된 세트 내의 모든 단어가 다른 모든 단어를 살펴보도록 허용하는 대신, 이 방법은 문서 사이에 엄격한 경계를 만듭니다. 이는 시스템이 각 검색된 문서를 하나의 고립된 섬으로 취급하도록 강제합니다. 단일 문서 내에서는 단어들이 맥락을 유지하기 위해 서로를 참조할 수 있지만, 다른 검색된 문서의 단어들을 보거나 그로부터 영향을 받는 것은 완전히 차단됩니다. 이러한 변화는 시스템이 답변을 생성할 때만 적용되며, 기본 AI 모델을 재학습시키거나 소프트웨어 파이프라인에 복잡한 기능을 추가할 필요가 없습니다. 이는 주의 집중(attention)의 규칙을 단순하게 조정한 것으로, 거짓말쟁이와 진실을 말하는 자 사이의 해로운 교차 대화(cross-talk)를 방지합니다.

연구진은 다양한 시나리오에 걸쳐 서로 다른 질문 답변 데이터셋과 여러 유형의 언어 모델을 사용하여 이 접근 방식을 엄격하게 테스트했습니다. 그들은 공격자가 AI를 특정 오답으로 유도하기 위해 설계된 오도하는 문서들을 주입하는 상황을 시뮬레이션했습니다. 이 테스트에서, 문서들이 서로 영향을 주고받도록 허용했던 표준 시스템은 빈번하게 속임수에 빠져 공격자가 원하는 거짓 답변을 생성하곤 했습니다. 반면, 새로운 희소 주의 집중 방식을 사용한 시스템은 훨씬 더 높은 회복력을 보여주었습니다. 이 시스템은 대다수의 경우에서 오염된 문서를 성공적으로 무시했으며, 답변의 정확성을 유지하고 공격의 성공률을 획기적으로 낮추었습니다. 개선 효과가 매우 커서, 이 새로운 방식은 이러한 공격을 잡아내기 위해 개발된 기존의 더 복잡한 방어 전략들보다 우수한 성능을 보였습니다.

연구는 또한 가짜 문서의 위치가 결과에 어떤 영향을 미치는지 탐구했습니다. 그들은 만약 기만적인 문서가 진실된 문서들과 내용 면에서 매우 유사할 경우, 시스템이 그 영향에 저항하기가 더 어려워진다는 것을 발견했습니다. 그러나 새로운 방식은 이러한 어려운 상황에서도 여전히 효과적이었습니다. 나아가, 연구진은 이 방어책이 여러 문서의 정보를 결합해야 하는 다단계 추론 질문과 같은 복잡한 문제를 해결하도록 AI에게 요청될 때도 잘 작동한다는 것을 발견했습니다. 초기 설정에서는 표준 방식에 비해 약간의 성능 저하가 나타났으나, 연구진은 모델을 새로운 규칙에 맞춰 짧은 기간 동안 미세 조정(fine-tuning)함으로써 이 손실을 완전히 회복할 수 있음을 찾아냈습니다. 그 결과, 공격에는 강력하면서도 매우 정확한 시스템을 구현해 냈습니다.

이 연구 결과는 AI가 소스 자료를 바라보는 방식이 자료 그 자체만큼이나 중요하다는 것을 시사합니다. 단순히 서로 다른 문서들이 서로 대화하는 것을 막는 것만으로도 시스템을 속이기가 훨씬 어려워집니다. 이 접근법은 검색 기반 AI 시스템을 보호할 수 있는 실용적이고 효율적인 방법을 제공하며, 시스템이 가장 설득력 있는 거짓말에 휘둘리는 대신 진실에 의존하도록 보장합니다. 이 연구는 이러한 시스템을 보호하기 위한 새로운 기준을 세우며, 정보를 처리하는 방식에 대한 근본적인 변화가 복잡한 탐지 도구들을 층층이 쌓는 것보다 더 효과적일 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →