STACK: Adversarial Attacks on LLM Safeguard Pipelines
이 논문은 새로운 퓨샷 프롬프트 기반 LLM 방어 파이프라인을 71%의 공격 성공률로 성공적으로 무력화하는 STACK 적대적 공격 절차를 소개하며, 이를 통해 현재의 프런티어 AI 방어 시스템의 치명적인 취약성을 강조하고 구체적인 완화 방안을 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신은 매우 강력하고 유능한 로봇 비서를 만들고 있다고 상상해 보세요. 당신은 이 로봇이 똑똑하기를 바라지만, 동시에 누군가에게 폭탄 제조법이나 위험한 바이러스를 만드는 법을 실수로(혹은 의도적으로) 알려줄까 봐 두려워합니다.
이를 막기 위해, 로봇의 제작자들은 단순히 하나의 "정지" 표지판에만 의존하지 않습니다. 대신, 그들은 마치 다층 구조의 요새와 같은 보안 파이프라인을 구축합니다. 이 논문인 STACK은 이러한 요새가 영리한 해커들의 공격에 실제로 얼마나 잘 버텨내는지 조사합니다.
다음은 이 논문의 내용을 쉬운 비유를 사용하여 정리한 내용입니다.
1. 요새: "심층 방어 (Defense in Depth)"
AI 안전 시스템을 세 명의 경비원이 일렬로 서 있는 성이라고 생각해 보세요:
- 경비원 1 (입력 분류기): 당신이 보낸 편지가 로봇에게 도달하기 전에 검사합니다. 만약 편지가 수상해 보이면 즉시 차단합니다.
- 로봇 (모델): 편지가 경비원 1을 통과하면, 로봇은 그 내용을 읽고 답장을 작성합니다.
- 경비원 2 (출력 분류기): 로봇의 답장이 당신에게 전달되기 전에 검사합니다. 만약 답장에 위험한 지침이 포함되어 있다면, 이 경비원은 편지를 가로챕니다.
이 아이디어의 핵심은 나쁜 놈이 성공하려면 두 명의 경비원과 로봇 모두를 속여야 한다는 것입니다. 이것을 "심층 방어"(또는 "스위스 치즈" 모델)라고 부릅니다. 하나의 층에 구멍이 생기더라도 다른 층들이 위협을 잡아낼 수 있도록 하는 방식입니다.
2. 문제점: 경비원들이 졸고 있다
연구진은 공개된 청사진(오픈 소스 도구)을 사용하여 이 요새의 테스트 버전을 구축했습니다. 그 결과, "경비원들"(안전 분류기)이 속아 넘어가기가 너무 쉽다는 것을 발견했습니다.
- 연구진은 표준적인 속임수들(질문을 재구성하거나 무작위 오타를 추가하는 등)을 테스트했으며, 기존의 많은 안전 가드들이 이를 막지 못한다는 것을 발견했습니다. 특히 요청 내용이 정말 위험할 때(예: 화학 무기 제조법을 묻는 경우) 더욱 그러했습니다.
- 하지만 연구진은 간단한 기술—경비원에게 무엇을 찾아야 하는지 몇 가지 예시를 주는 것(이를 "퓨샷 프롬프팅(few-shot prompting)"이라 함)—을 사용하면 경비원이 훨씬 더 예리해진다는 것도 발견했습니다. 이 간단한 경비원이 기존의 화려하게 사전 훈련된 모델들보다 더 뛰어난 성능을 보였습니다.
3. 새로운 공격 방식: STACK (단계적 공격, Staged AttaCK)
이것이 이 논문의 주요 발견입니다. 연구진은 요새가 튼튼하긴 하지만, 경비원들이 각자 따로 보고 있다는 사실을 깨달았습니다. 공격이 진행되는 동안 그들은 서로 대화하지 않습니다.
연구진은 STACK(Staged AttaCK)이라는 새로운 해킹 방법을 고안했습니다. 요새 전체를 한꺼번에 부수려고 하는 대신, 마치 도둑이 특정 순서대로 자물쇠를 따듯 한 단계씩 공략하는 방식입니다:
- 1단계: 로봇 속이기. 먼저 설득 기법을 사용하여 로봇이 자신의 내부 안전 규칙을 무시하고 위험한 질문에 답하도록 유도합니다.
- 2단계: 경비원 1 속이기. 메시지 앞에 "마법의 문구"(유니버설 탈옥 문구)를 붙이면 경비원 1이 해당 메시지를 무해한 것으로 인식하게 만드는 것을 발견했습니다.
- 3단계: 경비원 2 속이기. 이것이 가장 어려운 부분이었습니다. 로봇이 답장 끝에 특정 "마법의 문구"를 포함하여 작성하게 함으로써, 경비원 2가 그 답장을 안전하다고 믿게 만들어야 했습니다.
비유: 학교에 금지된 쪽지를 몰래 전달하고 싶다고 상상해 보세요.
- 먼저 선생님(로봇)이 읽고 답할 수 있는 방식으로 쪽지를 씁니다.
- 그다음, 보안 카메라(경비원 1)가 쪽지를 단순한 도시락 상자로 인식하도록 포장지로 감쌉니다.
- 마지막으로, 쪽지 뒷면에 출입 허가증처럼 보이게 만드는 특정 도장을 찍습니다.
이 세 가지 특정 기술을 결 조합함으로써, 연구진은 전체 요새를 통과하는 데 성공했습니다.
4. 결과: 얼마나 잘 작동했는가?
- 요새는 (어느 정도) 버텼다: 표준적인 공격을 사용했을 때는 요새가 아주 잘 작동했습니다. "퓨샷(few-shot)" 경비원은 가장 위험한 데이터셋에 대한 공격을 100% 차단했습니다.
- STACK은 요새를 무너뜨렸다: 연구진이 새로운 STACK 방식을 사용했을 때, 요새는 71%의 확률로 뚫렸습니다.
- "블랙박스"의 놀라운 결과: 해커들이 경비원의 내부 로직을 볼 수 없는 상황("블랙박스" 시나리오)에서 어떤 경비가 자신을 막았는지 추측해야 했음에도 불구하고, 여전히 33%의 확률로 성공했습니다. 이는 매우 무서운 결과인데, 시스템을 깨기 위해 내부 정보를 알 필요 없이 오직 영리함만 있으면 된다는 것을 의미하기 때문입니다.
5. 실전 테스트
연구진은 단순히 자신들의 장난감 모델로만 테스트하지 않았습니다. 그들은 이 방법을 실제 대기업의 최상위 AI 모델들(Anthropic의 Opus 4 및 OpenAI의 GPT-5 등)에 적용해 보았습니다.
- 연구진은 이러한 실제 시스템들도 정보 유출(예: 요청 처리 시간이나 특정 에러 메시지)이 발생하며, 이것이 해커에게 어떤 경비가 자신을 막았는지 알려주는 단서가 된다는 것을 발견했습니다.
- 이 정보를 활용하여, 연구진은 이러한 고도의 보안 시스템을 뚫고 위험한 답변을 얻어내는 데 성공했습니다. 기업들은 이 문제를 인정하고 패치를 적용했습니다.
6. 시사점
논문은 이러한 AI 요새를 만드는 설계자들에게 몇 가지 간단한 교훈을 남깁/니다:
- 비밀을 드러내지 마라: 만약 시스템이 해커에게 "입력 경비가 당신을 막았습니다" 또는 "출력 경비가 당신을 막았습니다"라고 알려준다면, 그것은 해커에게 지도를 주는 것과 같습니다. 모든 거절 메시지는 동일하게 보이도록 만드세요.
- 해커가 엿보지 못하게 하라: 만약 여러분의 메인 시스템을 보호하기 위해 약간 작은 규모의 "형제 모델(sibling model)"을 대중에게 공개한다면, 해커들은 그 모델을 대상으로 공격을 훈련시킨 뒤 본 시스템에 그대로 사용할 수 있습니다.
- 심층 방어는 좋지만 완벽하지 않다: 계층을 두는 것이 아무것도 없는 것보다 낫지만, 만약 그 계층들이 서로 소통하지 않거나 예측 가능하다면, 영리한 단계적 공격에 통째로 뚫릴 수 있습니다.
요약하자면: 이 논문은 AI 안전 계층이 좋은 아이디어이긴 하지만, 현재는 특정한 종류의 "분할 정복(divide and conquer)" 공격에 취약하다는 것을 보여줍니다. 만약 계층을 하나씩 차례대로 공격한다면, 전체 시스템을 무너뜨릴 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.