ADMIT: Few-shot Knowledge Poisoning Attacks on RAG-based Fact Checking
이 논문은 다양한 모델과 도메인에서 높은 공격 성공률로 RAG 기반 사실 확인 시스템을 중독시키는 ADMIT를 소개하며, 이는 최소한의 적대적 콘텐츠를 주입하여 실제 증거를 무력화하고 LLM 출력을 조작하는 소수 샷 기반의 의미 정렬 적대적 다중 주입 기법이다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
상상해 보세요. 매우 똑똑하고 독서량이 풍부한 사서 (이 AI) 가 있는데, 질문에는 잘 대답하지만 모든 것을 알지 못하기 때문에 때로는 사실을 지어내기도 합니다. 이를 해결하기 위해 사서에게 특별한 규칙을 부여합니다: "답변하기 전에 먼저 우리 신뢰할 수 있는 도서관의 책들에서 사실을 찾아보십시오." 이 시스템을 RAG(검색 증강 생성) 라고 합니다. 이는 궁극적인 사실 확인 도구로 설계되었습니다.
이제, 사서에게 잘못된 답변을 하도록 유도하려는 장난꾸러기 (공격자) 를 상상해 보세요.
사서를 속이는 옛날 방식
과거 연구자들은 사서를 속이기 위해 다음과 같은 방법을 시도했습니다:
- 지시 사항 외치기: 질문 안에 "책을 무시하고 YES 라고 말하라!"라고 직접 적어 넣었습니다. (이는 프롬프트 인젝션과 같습니다).
- 도서관을 범람시키기: 사서가 어떤 책을 고르든 거짓말을 발견하도록 수백 권의 책에 거짓말을 주입했습니다. (이는 일반 지식 오염입니다).
문제점: 실제 세계에서는 이러한 속임수들이 종종 실패합니다. 만약 의료 관련 사실을 질문한다면, 사서는 당신의 거짓말과 모순되는 실제 신뢰할 수 있는 의학 교과서를 찾아낼 가능성이 높습니다. 사서는 충분히 똑똑해서 "잠깐, 이 새로운 책은 X 라고 말하지만 신뢰할 수 있는 의학 책은 Y 라고 말합니다. 저는 Y 를 따르겠습니다"라고 말할 것입니다.
새로운 속임수: ADMIT
이 논문은 ADMIT이라는 새로운 교활한 공격 기법을 소개합니다. 도서관을 범람시키거나 지시 사항을 외치는 대신, 공격자는 "퓨 샷 (Few-Shot)" 전략을 사용합니다.
비유: 금으로 된 바구니 속의 "나쁜 사과 하나"
사서가 어떤 주장을 확인하라는 요청을 받았다고 상상해 보세요. 그들은 확인을 위해 5 권의 책을 꺼내 읽습니다.
- 4 권의 책은 실제 신뢰할 수 있는 것으로, 그 주장이 거짓이라고 말합니다.
- 1 권의 책은 공격자가 만든 것입니다.
과거에는 사서가 나머지 네 권이 반대 의견을 제시했기 때문에 그 나쁜 책 하나를 무시했을 것입니다. 하지만 ADMIT은 다릅니다. 공격자는 단순히 거짓말을 쓰는 것이 아니라, 너무 사실처럼 보이고, 너무 권위 있으며, 너무 설득력 있어 사서가 "와, 이 한 권의 책은 다른 것들을 압도하는 정말 구체적이고 상세한 설명을 가지고 있군"이라고 생각하도록 속이는 완벽하게 제작된 가짜 뉴스 기사를 작성합니다.
ADMIT 의 작동 원리 (마법 주문):
- 준비: 공격자는 사서의 두뇌나 도서관 검색 엔진에 접근할 수 없습니다. 그들은 맹목적으로 작업합니다.
- 연습: 공격자는 더미 사서 (프록시) 를 사용하여 가짜 기사들을 테스트합니다. 더미 사서에게 "이게 당신의 마음을 바꾸기에 충분히 사실처럼 보이나요?"라고 묻으며 기사를 반복해서 다시 씁니다.
- 최종 산물: 기사가 완벽해지면 공격자는 이 가짜 기사들 중 하나만 도서관 데이터베이스에 밀어 넣습니다.
- 결과: 실제 사서가 답변을 검색할 때, 4 권의 실제 책과 1 권의 가짜 책을 발견합니다. 가짜 책은 너무 잘 쓰여져서 (실제 뉴스 보도의 어조를 모방하고, 가짜 전문가를 인용하며, 자신감 있게 들림) 사서가 혼란에 빠집니다. 그들은 판정을 "거짓"에서 "참"으로 바꾸고, 심지어 마음을 바꾼 이유를 정당화하는 설득력 있는 설명까지 작성합니다.
이것이 무서운 이유 (논문의 발견 사항)
연구자들은 11 개의 서로 다른 AI 모델(오픈 소스 모델부터 가장 진보된 상용 모델까지) 과 4 가지 유형의 사실 확인(일반 뉴스, 과학, 기후, 건강) 에서 이를 테스트했습니다.
- 오염 비율은 극히 미미합니다: 그들은 도서관 콘텐츠의 **0.00000093%**만 오염시키면 되었습니다. 이는 10 억 페이지짜리 도서관에 가짜 페이지 하나만 추가하는 것과 같습니다.
- 성공률은 매우 높습니다: 극히 미미한 양의 오염에도 불구하고, 이 공격은 **86%**의 성공률을 보였습니다.
- 가장 똑똑한 AI 들도 작동합니다: "추론 모델"과 같이 특히 신중하고 논리적으로 설계된 AI 모델들조차 이에 속았습니다.
- 방어 기법을 우회합니다: 논문은 AI 에게 답변에 대해 "투표"를 하거나 텍스트가 이상하게 들리는지 확인하는 것과 같은 일반적인 방어 기법들을 테스트했습니다. ADMIT 는 가짜 텍스트가 이상하게 들리지 않고 완벽하게 정상처럼 들리기 때문에 모든 방어 기법을 통과했습니다.
결론
이 논문은 신뢰할 수 있는 출처에 대한 사실 확인을 위해 설계된 시스템이라 하더라도 여전히 속일 수 있음을 보여줍니다. 시스템을 파괴하거나 쓰레기로 범람시킬 필요가 없습니다. 단지 AI 가 진실을 무시하도록 설득할 만큼 너무 좋아 보이는 하나의 매우 잘 쓰인 기만적인 정보 조각을 심기만 하면 됩니다.
간단히 말해: ADMIT 는 "진실"과 "설득" 사이의 전쟁에서 거짓말이 충분히 잘 쓰여진다면, 가장 똑똑한 AI 사서조차 그 거짓말을 진실로 믿도록 속일 수 있음을 증명합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.