← 최신 논문
💻 computer science

DenialRAG: Single-Document RAG Poisoning via Embedded Parametric Denial

이 논문은 검색된 구절 내에서 정답을 명시적으로 언급하고 이를 반박함으로써 LLM을 공격자가 선택한 오답으로 유도하는 새로운 단일 문서 RAG 포이즈닝 공격인 DenialRAG를 소개하며, 이것의 효과가 모델 의존적이며 현재의 방어책은 부분적이고 비균일한 보호만을 제공한다는 점을 입증한다.

원저자: Abay Zhurekbay, Tao Liu, Fan Li

게시일 2026-08-05
📖 3 분 읽기☕ 가벼운 읽기

원저자: Abay Zhurekbay, Tao Liu, Fan Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷을 모든 책, 블로그 포스트, 위키 항목이 잠재적인 단서가 될 수 있는 거대하고 혼란스러운 도서관이라고 상상해 보세요. 이제 거의 모든 것을 읽었지만, 아주 새롭거나 매우 구체적인 것을 알아내야 할 때 막히는 데커한 똑똑한 로봇 사서를 상상해 보세요. 이를 해결하기 위해 우리는 사서에게 특별한 도구인 '검색 증강 생성(Retrieval-Augmented Generation, RAG)' 시스템을 주었습니다. 이것은 마법의 돋보기라고 생각하면 됩니다. 당신이 질문을 하면, 이 돋구는 도서관에서 가장 관련 있는 페이지들을 즉시 찾아 로봇에게 건네주고, 로봇은 그 페이지들을 사용하여 답변을 작성합니다. 이는 기억력에만 의존하는 대신 사실을 즉시 찾아볼 수 있는 천재를 갖게 되는 것과 같습니다. 이는 정보를 최신 상태로 유지하는 데 놀라운 일이지만, 무서운 이면도 있습니다. 만약 누군가 도서관에 가짜 페이지를 몰래 집어넣는다면 어떻게 될까요? 만약 사서가 그 가짜 페이지를 집어 든다면, 로봇은 거짓을 믿고 아주 자신만만하게 틀린 답을 말할 수도 있습니다. 이것이 바로 '코퍼스 포이즈닝(corpus poisoning, 말뭉치 오염)'의 세계입니다. 여기서의 위험은 로봇의 뇌를 해킹하는 것이 아니라, 로봇이 신뢰하는 도서관을 속이는 것입니다.

여기에 이 시스템들을 속이는 교묘한 방법을 탐구하는 새로운 연구인 DenialRAG가 등장했습니다. 연구진은 대담한 질문을 던졌습니다. 진실을 숨기는 대신, 로봇에게 진실을 말한 뒤 곧바로 그 진실이 왜 틀렸는지 말한다면 어떻게 될까? 기존의 대부분의 속임수들은 정답을 언급하면 로봇의 기억을 깨워 속임수를 망칠까 봐, 정답을 언급하지 않고 오답을 속삭이려 했습니다. 하지만 이 논문의 저자들은 그러한 두려움이 불필요할 수도 있다는 것을 발견했습니다. 그들은 "당신은 답이 X라고 생각할 수도 있지만, 그것은 사실 실수입니다! 진짜 답은 Y이며, 왜 Y가 더 나은지에 대한 이유는 다음과 같습니다"라고 명시적으로 적힌 '오염된' 문서를 만들었습니다. 그들은 이를 DenialRAG라고 부릅니다.

이 연구는 이 아이디어를 8가지 서로 다른 로봇 두뇌(거대 언어 모델)와 3가지 유형의 질문을 대상으로 테스트했습니다. 그들은 이 '진실 부정' 전략이 매우 효과적이며, 특히 특정 모델에서 그렇다는 것을 발견했습니다. 실제로 일부 시스템에서는 이 방식이 그들이 시도한 다른 어떤 속임수보다 더 효과적이었으며, 특정 테스트에서 최대 **94%**의 성공률을 기록했습니다. 연구진은 또한 로봇에게 더 회의적이 되라고 요청하거나 질문을 재구성하는 것과 같은 5가지 다른 안전망을 사용하여 공격을 막으려 노력했습니다. 이러한 안전망들이 도움이 되기는 했지만, 공격을 완전히 막지는 못했습니다. "DenialRAG" 속임수는 여전히 많은 경우에 작동하여, 로봇이 틀린 답을 내놓을 상당한 가능성을 남겼습니다.

이 논문은 비결이 단순히 거짓말을 하는 것이 아니라, 바로 '갈등'에 있다고 제안합니다. 정답과 가짜 답을 같은 단락에 넣고 논쟁을 가짜 쪽으로 유리하게 해결함으로써, 독(poison)은 로봇이 무시하기 어려운 하나의 완결된 이야기가 됩니다. 또한 연구는 모든 로봇이 똑같이 잘 속는 것은 아니라는 점을 보여주었습니다. 작고 저렴한 모델들은 쉽게 속았지만, 가장 최신의 강력한 모델들은 속이기 더 어려웠으나 불가능한 것은 아니었습니다. 연구진은 모든 공격을 막아낼 수 있는 단 하나의 '마법 방패'는 없다고 결론지었습니다. 대신, 위험은 공격이 어떻게 작성되었는지와 어떤 로봇이 그것을 읽는지에 크게 달려 있습니다. 이는 AI 시대에 도서관의 단 한 문장조차 로봇이 당신에게 들려주는 이야기를 바꿀 수 있다는 점을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →