← 최신 논문
💻 computer science

The Defense Trilemma: Why Prompt Injection Defense Wrappers Fail?

이 논문은 연속성, 유용성 유지, 완전한 안전성이라는 세 가지 속성이 공존할 수 없음을 수학적으로 증명하여, 프롬프트 주입 공격에 대한 전처리 방어 Wrapper 의 근본적인 한계를 규명하고 그 이론을 Lean 4 로 기계적으로 검증했음을 보여줍니다.

원저자: Manish Bhatt, Sarthak Munshi, Vineeth Sai Narajala, Idan Habler, Ammar Al-Kahfah, Ken Huang, Blake Gatto

게시일 2026-04-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Manish Bhatt, Sarthak Munshi, Vineeth Sai Narajala, Idan Habler, Ammar Al-Kahfah, Ken Huang, Blake Gatto

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"대형 언어 모델 (LLM) 을 해킹으로부터 완벽하게 보호하는 '완벽한 방패'는 수학적으로 존재할 수 없다"**는 놀라운 결론을 내립니다.

저자들은 이를 **'방어 삼각형의 딜레마 (Defense Trilemma)'**라고 부릅니다. 마치 세 가지 속성 중 두 가지만 가질 수 있고, 세 가지를 모두 가지는 것은 불가능한 상황과 비슷합니다.

이 복잡한 수학 논리를 일상적인 비유로 쉽게 설명해 드리겠습니다.


🛡️ 핵심 비유: "완벽한 보안관"의 불가능한 임무

상상해 보세요. 거대한 도서관 (AI 모델) 에 들어가는 모든 책을 검사하는 **보안관 (Defense Wrapper)**이 있습니다.
이 보안관의 임무는 다음과 같습니다:

  1. 안전한 책은 절대 건드리지 말고 그대로 통과시켜야 합니다 (사용성 유지).
  2. 위험한 책은 내용을 고쳐서 안전한 책으로 만들어야 합니다 (완벽한 방어).
  3. 변화는 부드럽게 일어나야 합니다. 아주 조금만 다른 책이라도 보안관은 비슷한 방식으로 처리해야 합니다 (연속성).

논문의 결론은 이렇습니다: "이 세 가지 조건을 동시에 만족하는 보안관은 존재할 수 없습니다."

왜일까요? 수학적인 이유를 3 단계로 나누어 설명해 드릴게요.

1 단계: "경계선"의 함정 (Boundary Fixation)

  • 상황: 도서관에는 '안전한 책'과 '위험한 책'이 섞여 있습니다. 이 둘 사이에는 아주 미세한 경계선이 있습니다.
  • 문제: 보안관은 안전한 책은 절대 건드리지 못합니다. 그런데 수학적으로, 안전한 책과 위험한 책이 이어진 공간에서는 경계선 위의 책도 안전한 책과 너무 비슷해서 보안관이 건드리지 못하게 됩니다.
  • 결과: 보안관은 "이건 위험하니까 고쳐야지!"라고 생각하지만, 그 책이 경계선 위에 있으면 아무것도 못 고르고 그대로 통과시켜야 합니다. 즉, 아주 미세하게 위험한 책이 그대로 통과해 버리는 '구멍'이 생깁니다.

2 단계: "약간의 안전"도 불가능 (ε-Robust Constraint)

  • 상황: 보안관이 경계선 근처의 책을 고치려고 노력한다고 칩시다.
  • 문제: 하지만 보안관의 손은 '부드럽게' 움직여야 합니다 (갑자기 책 내용을 뚝뚝 잘라내면 안 됨). 그래서 경계선에서 아주 조금만 떨어진 책도, 보안관이 고칠 수 있는 능력의 한계 때문에 아직도 위험한 수준에 가깝게 남게 됩니다.
  • 결과: 완전히 안전해지지는 못합니다. "위험하지는 않지만, 완전히 안전하지도 않은" 회색 지대가 계속 존재하게 됩니다.

3 단계: "피할 수 없는 위험 구역" (Persistent Unsafe Region)

  • 상황: 위험한 책의 내용이 아주 급격하게 변하는 곳 (가파른 절벽) 이 있습니다.
  • 문제: 보안관의 고치는 능력은 일정한 속도 (부드러운 움직임) 로만 가능합니다. 그런데 위험한 책의 내용이 그 속도보다 훨씬 빠르게 나쁜 방향으로 변한다면?
  • 결과: 보안관이 아무리 노력해도 책이 나쁜 방향으로 변하는 속도를 따라잡지 못합니다. 그래서 수학적으로 계산했을 때, 무조건 위험한 책들이 통과하는 '영구적인 위험 구역'이 반드시 존재하게 됩니다.

🧩 이 세 가지 조건 중 무엇을 포기해야 할까?

논문에 따르면, 다음 세 가지 중 두 가지만 선택할 수 있습니다. 세 가지를 다 가질 수는 없습니다.

  1. 연속성 (부드러움): 비슷한 질문에는 비슷한 답변을 줘야 함.
  2. 사용성 유지: 안전한 질문은 절대 건드리지 않음.
  3. 완벽한 방어: 모든 위험한 질문을 100% 막음.

현재 대부분의 보안 시스템은 1 번과 2 번을 지키려다 보니, 3 번 (완벽한 방어) 을 포기하고 있습니다.


💡 그럼 우리는 어떻게 해야 할까? (실천 방안)

이 논문이 "아무것도 할 수 없다"고 말하는 것은 아닙니다. 대신 **"완벽한 방패를 만들려 하지 말고, 위험을 관리하자"**고 조언합니다.

  1. 경계선을 '부드럽게' 만들자:

    • 위험한 질문을 했을 때, AI 가 "이건 안 돼요"라고 거절하더라도, 그 거절이 매우 친절하고 안전하다면 문제가 되지 않습니다.
    • 비유: 문이 열려 있어도, 그 문이 '진흙탕'이 아니라 '부드러운 카펫'이라면 넘어져도 다치지 않는 것과 같습니다.
  2. 질문하는 방식을 단순화하자:

    • AI 에게 물어볼 수 있는 방법 (차원) 을 줄이면, 위험한 구멍을 찾기 훨씬 어려워집니다.
    • 비유: 미로가 너무 복잡하면 탈출구가 어디인지 모릅니다. 하지만 미로를 단순화하면 감시하기 쉽습니다.
  3. 완벽한 차단이 아니라 '모니터링'에 집중하자:

    • 위험한 질문이 경계선에 다가오는 것을 실시간으로 감지하고 경고하는 시스템을 만드는 것이, 모든 공격을 막으려 애쓰는 것보다 현실적입니다.

📝 한 줄 요약

"AI 를 100% 완벽하게 지키는 '불변의 방패'는 수학적으로 존재하지 않습니다. 대신, 위험이 발생해도 큰 피해를 주지 않도록 시스템을 설계하고, 위험을 감시하는 현명한 전략이 필요합니다."

이 연구는 AI 보안을 포기하라는 뜻이 아니라, "완벽함"을 추구하는 대신 "현실적인 안전"을 설계해야 한다는 중요한 통찰을 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →