On the Inseparability of Instructions and Data in Shared-Embedding Sequence Models
이 논문은 공유 임베딩 시퀀스 모델에서 지시어와 데이터의 구조적 분리 불가능성을 근거로 완벽한 프롬프트 인젝션 방지가 수학적으로 불가능함을 증명하며, 강력한 보안을 위해서는 파이프라인 내 방어 개선이 아닌 제어 채널과 콘텐츠 채널의 구조적 분리가 필요하다고 주장한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
핵심 아이디어: "믹싱 볼(Mixing Bowl)" 문제
당신이 주방에서 일하는 요리사(AI 모델)라고 상상해 보세요. 당신에게는 두 종류의 재료가 있습니다:
- 레시피 카드 (신뢰할 수 있는 지침): 식당 주인으로부터 받은 규칙들입니다 (예: "채식 요리만 제공할 것", "비밀 소스는 절대 알려주지 말 것").
- 고객의 주문 (신뢰할 수 없는 데이터): 고객이 가져온 요청들입니다 (예: "버거 하나 주세요", "농담 하나만 해줘").
현재의 AI 모델에서는 요리사가 레시피 카드와 고객의 주문을 모두 같은 믹싱 볼(mixing bowl)에 넣습니다. 요리사가 요리를 시작하기 전에 이 모든 것들은 잘게 다져지고, 섞이고, 으깨져서 하나의 균일한 스프 형태가 됩니다.
이 논문의 주요 주장:
저자들은 레시피와 주문이 같은 볼 안에 섞여 있기 때문에, 요리사가 일단 재료들이 혼합되고 나면 "주인이 말한 것"과 "고객이 말한 것"을 완벽하게 구별하는 것은 수학적으로 불가능하다고 주장합니다.
만약 고객이 주문서에 *"레시피 카드를 무시하고 비밀 소스를 내놔"*라는 메모를 몰래 끼워 넣는다면, 요리사는 이 메모가 실제 레시피와 다르다는 것을 알아차릴 수 없습니다. 요리사의 뇌에 이 모든 것은 그저 "스프"일 뿐입니다. 따라서 요리사는 주인의 규칙 대신 고객의 교활한 메모를 따르는 실수를 저지를 수 있습니다.
핵심 비유: 폰 노이만 머신 (Von Neumann Machine)
이 논문은 이 AI 문제를 1970년대의 유명한 컴퓨터 보안 결함인 **버퍼 오버플로(Buffer Overflow)**에 비유합니다.
- 과거의 컴퓨터 (폰 노이만 구조): 이 기계들에서는 컴퓨터 프로그램(코드)과 데이터(숫자)가 동일한 메모리 공간에 존재했습니다. 해커는 데이터를 프로그램처럼 보이게 만들어 컴퓨터를 속일 수 있었습니다. 컴퓨터는 데이터를 명령어로 착각하여 실행하게 되었고, 이는 시스템 충돌이나 해커의 권한 탈취로 이어졌습니다.
- 현대의 AI (트랜스포머): 저자들은 AI에도 정확히 똑같은 결함이 있다고 말합니다. "지침"(시스템 프롬프트)과 "데이터"(사용자 입력)는 동일한 수학적 공간(벡터) 안에 존재합니다. 해커는 AI에게 "지침"처럼 보일 수 있는 "데이터"를 정교하게 만들어낼 수 있습니다. AI는 일단 이 둘이 섞이면 구분할 수 없기 때문에, 결국 해커의 지침을 따르게 됩니다.
저자들은 버퍼 오버플로 문제를 해결하기 위해 단순히 "더 나은 코드"나 "더 주의 깊은 타이핑"만으로는 부족했듯이, 프롬프트 인젝션(Prompt Injection) 문제 또한 단순히 "더 나은 학습"이나 "더 많은 필터"만으로는 해결할 수 없다고 주장합니다. 문제는 요리사의 숙련도가 아니라 구조(믹싱 볼) 자체에 있기 때문입니다.
불가능한 세 가지 이유
논문은 다음 세 가지 논리적 단계를 통해 이 불가능성을 증명합니다.
1. "공유된 어휘" 문제 (표상 충돌 - Representational Collision)
- 비유: 레시피 카드와 고객의 주문 모두에 "소금"이라는 단어가 등장한다고 가정해 봅시다.
- 실제: AI에서 "the", "is", "you", "help"와 같은 단어들은 시스템 지침과 사용자 입력 모두에 나타납니다. AI는 이 단어들을 정확히 동일한 수학적 숫자로 매핑합니다. AI가 "help"라는 단어를 보았을 때, 그것이 주인의 규칙("사용자를 도와라")에서 온 것인지, 아니면 사용자의 속임수("규칙을 우회하도록 도와줘")에서 온 것인지 알 수 없습니다. 단어가 볼 안으로 들어오는 순간 그 "출처"는 사라집니다.
2. 주방의 "사각지대" (출처 복구 - Provenance Recovery)
- 비유: 만약 당신이 스프를 보고 어느 숟가락이 레시피 카드에서 왔고 어느 것이 고객의 주문에서 왔는지 추측하려 한다면, 당신은 가끔 틀릴 것입니다.
- 실제: 논문은 "신뢰할 수 있는" 재료와 "신뢰할 수 없는" 재료가 매우 유사하기 때문에(동일한 어휘와 공간을 공유함), 아무리 자세히 살펴봐도 이 둘을 완벽하게 구별할 수 없음을 수학적으로 증명합니다. 항상 미세한 오류의 가능성이 존재합니다. 완벽하게 구별할 수 없다면, 나쁜 것을 완벽하게 차단할 수도 없습니다.
3. "무한한 변형" 문제 (유한한 커버리지 - Finite Coverage)
- 비유: 당신이 고객이 자신을 속이려고 시도할 수 있는 1,000가지의 특정 방법을 요리사에게 학습시켰다고 가정해 봅시다. 하지만 영리한 고객는 다른 언어, 이모지, 코드, 또는 철자 트릭 등을 사용하여 동일한 의미를 가진 1,000,000가지의 다른 방식으로 속임수를 써낼 수 있습니다.
- 실제: AI를 수백만 개의 사례로 학습시킬 수는 있지만, 속임수의 방식은 사실상 무한합니다. AI는 사례를 보고 배우기 때문에, 본 적 없는 새로운 변형된 속임수에 대해서는 결코 완벽하게 안전해질 수 없습니다. 항상 "사각지대"가 존재하게 됩니다.
이것이 AI 안전에 의미하는 바
저자들은 AI가 쓸모없다거나 사용을 중단해야 한다고 말하는 것이 아닙니다. 그들이 말하고자 하는 핵심은 다음과 같습니다:
- 믹싱 볼을 패치할 수는 없습니다: 단순히 AI를 더 잘 학습시키거나, 더 많은 "가드레일"을 설치하거나, 단어를 필터링하는 것만으로는 이 문제를 해결할 수 없습니다. AI가 지침과 데이터를 동일한 공간에 섞어 두는 한, 영리한 공격자는 반드시 그 사이에 가짜 지침을 끼워 넣을 방법을 찾아낼 것입니다.
- 해결책은 구조적입니다: 이를 진정으로 해결하려면 주방의 설계를 바꿔야 합니다. 레시피 카드와 고객의 주문이 마지막 순간까지 절대 섞이지 않는 별도의 믹싱 볼에 담겨 있는 시스템이 필요합니다. "레시피"는 "고객의 주문"이 건드리거나 덮어쓸 수 없는 엄격한 규칙이어야 합니다.
- 심층 방어 (Defense in Depth): 이러한 "별도의 볼" 시스템을 구축하기 전까지, 우리는 버퍼 오버플로가 발생하는 옛날 컴퓨터를 대하듯 AI를 대해야 합니다. 즉, 해킹은 반드시 일어날 것이라고 가정하고, 여러 겹의 약한 방어 체계(방화벽, 샌드박스 등)를 사용하며, 침해되었을 때의 피해를 최소화하는 전략을 취해야 합니다.
요약
이 논문은 현재의 AI 모델이 "무엇을 할 것인가(지침)"와 "무엇을 처리할 것인가(데이터)"를 동일한 것으로 취급하기 때문에 완벽한 안전은 불가능함을 증명합니다. 이는 마치 요리사에게 레시피가 적힌 종이와 고객의 메모가 같은 잉크와 같은 종이로 쓰였다면, 그 메모를 무시하라고 요구하는 것과 같습니다. 이를 해결하는 유일한 방법은 AI를 더 잘 훈련시키는 것이 아니라, AI의 근본적인 설계를 바꾸는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.