A Survey on Poisoning Attacks, Defenses, andProvable Defense in the Era of LLMs
이 서베이는 위협을 가중치 포이즈닝(weight poisoning)과 컨텍스트 포이즈닝(context poisoning)으로 분류하는 포괄적인 분류 체계를 제안함으로써 대규모 언어 모델 시대의 포이즈닝 공격과 방어 기법을 체계적으로 검토하고, 대표적인 기술과 방어 전략을 분석하며, 컴파운드 AI 시스템을 보호하기 위한 향후 연구 방향을 제시한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
이 논문은 "LLM 시대의 포이즈닝 공격(Poisoning Attacks), 방어(Defenses), 그리고 증명 가능한 방어(Provable Defense)에 관한 조사"를 쉬운 개념과 창의적인 비유로 나누어 설명한 것입니다.
큰 그림: AI 주방
인공지능 대규모 언어 모델(LLM)을 단순히 똑똑한 로봇이 아니라, 첨단 주방의 **마스터 셰프(주방장)**라고 상상해 보세요.
과거에 이 셰프는 거대한 요리책(학습 데이터)과 칼 세트(모델 가중치)만을 가지고 있었습니다. 누군가 셰프에게 독이 든 음식을 서빙하게 만들고 싶다면, 도서관에 몰래 들어가 요리책의 페이지를 바꿔치기해야 했습니다. 이것이 AI를 공격하는 옛날 방식입니다.
하지만 오늘날 이 셰프는 **컴파운드 AI 시스템(Compound AI System)**의 일부입니다. 셰프는 단순히 기억력에만 의존하지 않고 다음과 같은 것들을 갖추고 있습니다:
- 실시간 뉴스 피드 (검색 증강 생성, RAG)
- 조수 팀 (AI 에이전트 - 문을 열거나, 이메일을 보내거나, 도구를 사용할 수 있음)
- 메모장 (메모리 - 어제 일어난 일을 기록함)
- 메뉴판 (도구 - 일을 완수하기 위해 선택할 수 있는 것들)
이 논문은 나쁜 놈들이 이 전체 주방 설정을 어떻게 오염시키려 하는지, 그리고 우리가 이를 막기 위해 얼마나 더 나은 방패를 만들고 있는지에 대한 방대한 성적표입니다.
파트 1: 셰프를 독살하는 두 가지 방법
저자들은 모든 공격을 두 가지 주요 카테고리, 즉 **가중치 포이즈닝(Weight Poisoning)**과 **컨텍스트 포이즈닝(Context Poisoning)**으로 나눕니다.
1. 가중치 포이즈닝: 셰프의 뇌를 조작하기
이것은 "클래식"한 공격입니다. 누군가 셰프가 훈련되거나 미세 조정(Fine-tuning)되는 동안 셰프의 뇌(모델의 파라미터)에 몰래 침입한다고 상상해 보세요.
- 공격 방식: 나쁜 놈이 셰프의 뇌에 아주 작고 숨겨진 명령어를 주입합니다. 이는 마치 "수면 스위치"와 같습니다. 셰프는 99%의 시간 동안 완벽하게 정상적으로 행동합니다. 하지만 당신이 특정 "트리거 단어"(예: 비밀 암호 문구)를 말하면, 셰프는 갑자기 독이 든 음식을 내놓거나 요리하기를 거부합니다.
- 발생 지점:
- 사전 학습(Pre-training): 셰프가 요리를 시작하기도 전에 읽는 거대한 도서관의 책들에 나쁜 레시피를 몰래 끼워 넣는 것.
- 미세 조정(Fine-tuning): 셰프가 예의 바르고 도움이 되도록 배우는 특정 레슨을 타락시키는 것.
- 적응(Adaptation): 셰프가 특정 요리를 할 수 있게 해주는 새로운 "특수 앞치마"(어댑터)를 건드리는 것.
- 배포 전(Pre-deployment): 셰프가 고용된 후라도, 식당을 열기 직전에 나쁜 놈이 몰래 들어와 셰프의 뇌를 마지막으로 수정하는 것.
2. 컨텍스트 포이즈닝: 재료와 환경을 오염시키기
이것은 훨씬 더 까다롭고 새로운 위협입니다. 셰프의 뇌는 깨끗하지만, 재료나 환경이 오염된 상태입니다.
- 공격 방식: 나쁜 놈은 셰프의 뇌를 건드리지 않습니다. 대신 뉴스 피드, 메모장, 또는 도구를 오염시킵니다.
- 인컨텍스트 러닝(In-Context Learning): 셰프가 당신이 준 레시피 카드를 읽고 있다고 상상해 보세요. 만약 당신이 그 카드에 가짜 단계("수프에 독을 넣으시오")를 적어 놓는다면, 셰프는 그 카드를 믿고 그대로 따를 것입니다.
- RAG (검색): 셰프가 데이터베이스에서 사실을 찾아봅니다. 만약 나쁜 놈이 그 데이터베이스에 "하늘은 초록색이다"라는 가짜 기사를 심어 놓았다면, 셰프는 당신에게 하늘이 초록색이라고 말할 것입니다.
- 에이전트 플로우(Agent Flow): 셰프가 식료품을 사러 조수를 보냅니다. 만약 나쁜 놈이 식료품점의 가격표를 조작하거나 조수의 지침을 건드렸다면, 조수는 잘못된 물건을 사거나 당신의 신용카드를 훔칠 수도 있습니다.
- 메모리: 셰프가 메모장에 "오늘은 화요일이다"라고 적습니다. 만약 나쁜 놈이 메모리를 지우고 "오늘은 금요일이다"라고 적는다면, 셰프는 혼란에 빠져 잘못된 날짜에 맞춰 행동하게 됩니다.
핵심 요점: 과거에는 셰프의 뇌를 부숴야 했습니다. 하지만 이제는 셰프가 살아가는 세상을 망가뜨리기만 하면 됩니다. 그러면 셰프는 당신이 원하는 대로 움직일 것입니다.
파트 2: 방어책 (보안 요원)
이 논문은 우리가 이러한 공격을 막기 위해 어떻게 노력하고 있는지 검토합니다. 방어책은 경험적(Empirical) 방어와 증명 가능한(Provable) 방어로 나뉩니다.
1. 경험적 방어: "좋은 추측" 보안
이것은 경험과 경험칙을 사용하는 보안 요원과 같습니다. 대부분의 경우 잘 작동하지만, 100%의 안전을 보장할 수는 없습니다.
- 데이터 클리닝(Data Cleaning): 셰프가 배우기 전에, 보안 요원이 도서관의 책들에 찢어진 페이지나 이상한 잉크 자국이 있는지 확인합니다.
- 새니티제이션(Sanitization): 셰프가 뉴스 기사를 읽기 전에, 보안 요원이 수상한 단어가 있는지 스캔합니다.
- 언러닝(Unlearning): 만약 셰프가 이미 나쁜 기술을 배웠다면, 보안 요원은 올바른 예시를 수천 개 보여줌으로써 나쁜 기억을 덮어쓰고 "가르치지 않도록" 시도합니다.
- 회의적인 요리(Skeptical Cooking): 셰프가 "잠깐, 이 뉴스 기사는 내가 아는 것과 다르다"라고 말하며, 음식을 내놓기 전에 다시 한번 확인하도록 훈련받는 것입니다.
- 샌드박싱(Sandboxing): 셰프의 조수가 식료품점에 갈 때, 보안 요원이 조수를 우리 안에 넣어두어 아무것도 함부로 만지지 못하게 합니다.
2. 증명 가능한 방어: "수학적 약속"
이것은 수학을 사용하여 "당신이 아무리 노력해도 셰프가 X를 하게 만들 수 없다"라고 증명하는 보안 시스템입니다.
- 무작위 평활화(Randomized Smoothing): 셰프에게 요리를 요청받았다고 상상해 보세요. 셰프가 요리를 한 번만 하는 대신, 보안 요원이 100가지의 약간씩 다른 버전(재료에 무작위 노이즈를 추가함)을 요리하도록 요청합니다. 만약 99개의 버전이 안전하다면, 설령 한 버전이 이상하더라도 보안 요원은 그 음식이 안전하다고 수학적으로 확신할 수 있습니다.
- 파티셔닝(Partitioning): 보안 요원이 재료를 10개의 서로 다른 그릇에 나눕니다. 그리고 10명의 서로 다른 셰프에게 각 그릇에서 요리하도록 요청합니다. 만약 10명 중 9명의 셰프가 "이것은 안전하다"라고 말한다면, 최종 요리는 안전하다고 인증됩니다.
- 왜 중요한가: 이것은 의료 조언이나 자율 주행 자동차처럼 "좋은 추측"만으로는 안 되는, 높은 수준의 안전이 요구되는 상황에서 매우 중요합니다. 당신에게는 보증이 필요합니다.
파트 3: 미래의 과제
논문은 우리가 여전히 이 보안 전쟁의 초기 단계에 있음을 지적하며 끝을 맺습니다.
- 복합 공격(Compound Attacks): 현재 연구자들은 도서관을 오염시키거나 뉴스 피드를 오염시키는 법을 각각 연구합니다. 하지만 현실 세계에서 나쁜 놈은 도서관과 뉴스 피드, 그리고 조수의 도구를 동시에 오염시킬 수 있습니다. 우리는 이 "퍼펙트 스톰"을 방어하는 법을 알아내야 합니다.
- 통합 규칙(Unified Rules): 모두가 공격이 성공했는지 확인하기 위해 서로 다른 테스트를 사용하고 있습니다. 모든 AI 시스템을 비교할 수 있는 표준화된 "보안 시험"이 필요합니다.
- 멀티모달 포이즈닝(Multimodal Poisoning): 대부분의 공격은 텍스트에 집중되어 있습니다. 하지만 만약 독이 이미지나 음성 파일에 있다면 어떨까요? 만약 셰프가 폭탄 사진을 본다면 패닉에 빠질 수 있습니다. 우리는 단어뿐만 아니라 사진과 소리를 이해하는 방어책이 필요합니다.
- 인간 참여(Human in the Loop): 때로는 최고의 방어책이 인간일 수 있습니다. 논문은 시스템이 왜 의심스러운지를 설명할 수 있어야 하며, 그래로 인간이 최종 결정을 내릴 수 있도록 해야 한다고 제안합니다.
요약
이 논문은 변화하는 전장의 지도입니다.
- 적: AI의 뇌를 부수는 것에서 AI의 환경(뉴스, 도구, 메모리)을 오염시키는 것으로 이동했습니다.
- 영웅: 단순히 "버그를 체크하는 것"(경험적)에서 "수학적으로 안전함을 증명하는 것"(증명 가능한)으로 진화하고 있습니다.
- 목표: 주변 세상이 자신을 속이려 할지라도, 단순히 똑똑한 것을 넘어 신뢰할 수 있는 AI 시스템을 구축하는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.