Inference Cost Attacks for Retrieval-Augmented Large Language Models
이 논문은 LLM 에이전트와 메모리 증강 그룹 상대 정책 최적화(Memory-Augmented Group Relative Policy Optimization) 알고리즘을 활용하여, 답변의 무결성은 유지하면서도 RAG 기반 LLM 시스템의 토큰 소비를 크게 부풀리는 악성 문서를 통해 외부 지식 베이스를 오염시키는 새로운 프레임워크인 검색 증강 추론 비용 공격(Retrieval-Augmented Inference Cost Attack, RA-ICA)을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
"RAG-LLM"이라는 이름의 고급 레스토랑을 상상해 보세요. 이 레스토랑은 단순히 셰프의 기억력에만 의존하지 않고, 요리를 하기 전 가장 신선한 사실들을 찾아내기 위해 연구원 팀이 거대한 도서관(인터넷)으로 즉시 달려가 정보를 찾는 것으로 유명합니다. 덕분에 이 음식(답변)은 매우 정확합니다.
하지만 이 도서관 조사 서비스를 운영하는 데는 비용이 많이 듭니다. 레스토랑 주인은 연구원들의 시간과 컴퓨터를 돌리는 데 드는 전기료를 분 단위로 지불합니다.
문제점: 새로운 종류의 "빌 쇼크(Bill Shock)"
이 논문은 이 시스템이 훌륭하긴 하지만, 숨겨진 약점이 있다고 주장합니다. 보통 사람들은 해커가 주방 창구에 이상한 지시를 외쳐서(사용자의 질문을 변경하여) 셰프를 직접 속이려 할 것이라고 생각합니다. 하지만 저자들은 더 똑똑하고 교활한 공격 방법이 있다고 말합니다. 바로 도서관 자체를 오염시키는 것입니다.
저자들은 이 새로운 위협을 RA-ICA(Retrieval-Augmented Inference Cost Attack, 검색 증강 추론 비용 공격)라고 부릅니다.
이렇게 생각해 보세요. 해커가 셰프에게 소리를 지르는 대신, 도서관에 몰래 잠입하여 몇 권의 가짜이면서도 복잡하고 난해한 책들을 선반에 배치해 두는 것입니다. 고객이 "봄의 여신은 누구인가요?"와 같은 간단한 질문을 하면, 연구원들은 단지 올바른 책을 찾는 것에 그치지 않고, 실수로 이 가짜 책 중 하나까지 함께 집어 들게 됩니다.
이 가짜 책은 까다로운 방식으로 쓰여 있기 때문에, 셰프는 이를 읽고, 다시 읽고, 그것과 논쟁하며, 그 안에 숨겨진 퍼즐을 풀어야만 단순한 답을 알아낼 수 있습니다. 결국 셰프는 평소보다 13배나 더 긴 시간을 들여 요리를 하게 됩니다. 고객은 올바른 답을 받지만, 레스토랑 주인은 이 추가된 시간 때문에 엄청나고 예상치 못한 청구서를 받게 됩니다.
공격 방식 (CREEP 프레임워크)
저자들은 이를 자동화하기 위해 CREEP(Computational Resource Exhaustion via External Poisoning, 외부 오염을 통한 계산 자원 고갈)이라 불리는 도구를 만들었습니다. CREEP을 이 가짜 도서관 책들을 쓰는 "악당 로봇"이라고 상상해 보세요.
이 로봇은 이 함정들을 만드는 두 가지 주요 방식을 사용합니다:
- 리라이트 아티스트 (Rewrite Artist): 일반적이고 지루한 책을 가져와서 혼란스러운 퍼즐이나 모순을 추가하도록 편집합니다.
- 크리에이티브 라이터 (Creative Writer): 겉보기에는 정상적으로 보이지만, 비밀리에 셰프를 더 힘들게 하도록 설계된 완전히 새로운 책을 처음부터 써 내려갑니다.
로봇은 셰프를 더 힘들게 만들기 위해 세 가지 특정 기술을 사용합니다:
- 디코이 (The Decoy): 텍text 내부에 가짜의 어려운 수학 문제나 논리 퍼즐을 추가합니다. 셰프는 사용자의 질문에 답하기 전에 반드시 이를 풀어야 한다는 강박을 느끼게 됩니다.
- 컨트라딕션 (The Contradiction): 진실과 반대되는 문장을 씁니다 (예: "봄은 사실 겨울이다"). 셰프는 어떤 사실이 진짜인지 결정하기 위해 멈춰 서서 생각하고 추가적인 추론을 해야 합니다 합니다.
- 태스크 트랩 (The Task Trap): 셰프에게 모호하고 개방적인 지시를 내려서, 안전을 위해 길고 장황한 설명을 쓰도록 강제합니다.
핵심 비결: 과거의 승리로부터 배우기 (MA-GRPO)
눈에 띄지 않으면서도 처리하기 힘든 가짜 책을 쓰는 것은 매우 어렵습니다. 책이 너무 이상하면 연구원들이 도서관에서 그 책을 집어 들지 않을 것이고, 너무 단순하면 셰프가 그것 때문에 시간을 더 쓰지 않을 것입니다.
이를 해결하기 위해 저자들은 MA-GRPO라는 특별한 학습 방법을 사용하여 이 "악당 로봇"을 가르쳤습니다.
이것을 로봇이 완벽한 함정을 쓰기 위해 노력하는 비디오 게임이라고 생각해 보세요.
- 메모리 뱅크 (The Memory Bank): 로봇은 자신이 썼던 최고의 함정들을 모아둔 "명예의 전당"을 보유합니다.
- 비교 (The Comparison): 로봇이 새로운 함정을 시도할 때마다, 이를 "명예의 전당" 우승자들과 비교합니다.
- 보상 (The Reward): 만약 새로운 함정이 최종 답변을 바꾸지 않으면서도 셰프를 더 오래 일하게 만든다면, 로봇은 "높은 점수"를 얻고 이를 다시 수행하는 법을 배웁니다. 만약 실패한다면, 무엇을 하지 말아야 할지를 배웁니다.
이 "메모리 뱅크" 덕분에 로봇은 눈에는 보이지 않으면서도 컴퓨터를 지치게 만드는 함정을 더 잘, 더 빠르게 작성할 수 있게 됩니다.
결과
저자들은 세 가지 실제 질의응답 데이터셋을 대상으로 테스트를 진행했습니다. 그 결과는 다음과 같습니다:
- 컴퓨터를 평소보다 13배 더 오래 일하게 만들 수 있었습니다.
- 이 공격은 90% 이상의 성공률을 보였습니다.
- 결정적으로, 사용자에게 제공되는 최종 답변은 여전히 정확했습니다. 레스토랑 주인은 비용을 지불하지만, 고객은 (배후의 비용은 훨씬 높아졌을지언정) 제때 음식을 받게 됩니다.
요약
요컨대, 이 논문은 우리가 질문을 바꾸려는 해커만을 걱정해서는 안 된다는 것을 보여줍니다. 우리는 우리가 신뢰하는 정보원 자체를 오염시키는 해커도 걱정해야 합니다. 공공 지식 베이스에 "끈적거리고 혼란스러운" 문서들을 심어 놓음으로써, 공격자는 똑똑한 AI 시스템이 막대한 양의 컴퓨팅 파워와 돈을 소모하게 만들 수 있으며, 이 모든 과정 중에도 사용자에게는 올바른 답을 줄 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.