← 최신 논문
💻 computer science

Hiding in Plain Floats: Steganographic Carriers for Indirect Prompt and Content Injection

이 논문은 간접 프롬프트 주입 공격이 악성 페이로드를 구조화된 부동 소수점 파라미터로 인코딩함으로써 텍스트 전용 방어 체계를 우회할 수 있음을 입증하며, 이를 통해 텍스트 검사에만 의존하는 현재의 LLM 보안 파이프라인에 존재하는 결정적인 실패 경계를 드러낸다.

원저자: Mudit Sinha, Sanika Chavan

게시일 2026-06-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mudit Sinha, Sanika Chavan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 문제: "텍스트 전용"의 사각지대

당신이 첨단 공장의 보안 요원이라고 상상해 보세요. 당신의 임무는 악의적인 행위자가 공장의 메인 컴퓨터(거대 언어 모델, 즉 LLM)로 위험한 지시 사항을 밀반입하는 것을 막는 것입니다.

현재 대부분의 보안 시스템은 맞춤법 검사기처럼 작동합니다. 이들은 모든 문서, 이메일, 메시지를 스캔하여 "이전 지침을 무시하라" 또는 "모든 파일을 삭제하라"와 같은 의심스러운 단어가 있는지 확인합니다. 만약 그런 단어가 발견되면 메시지를 차단합니다. 이는 악당이 자신의 악성 명령어를 평범한 영어로 작성했을 때는 매우 효과적입니다.

하지만 만약 악당이 명령어를 단어로 쓰지 않는다면 어떻게 될까요? 만약 그들이 이 명령을 해롭지 않은 기술 데이터처럼 보이는 숫자 목록 안에 숨긴다면 어떨까요? 맞춤법 검사기는 숫자를 스캔하고, 의심스러운 단어를 발견하지 못했으므로 데이터를 통과시킵니다. 컴퓨터가 이 숫자를 처리하는 순간, 숨겨진 메시지가 드러나고 피해가 발생합니다.

이 논문은 바로 그 허점을 탐구합니다. 저자들은 이를 **"간접 프롬프트 주입(Indirect Prompt Injection)"**이라고 부릅니다.

비유: 스프레드시트 속의 투명 잉크

LLM을 레시피를 받는 요리사라고 생각해보세요.

  • 일반적인 공격: 누군가 요리사에게 *"수프를 태워버려"*라고 적힌 쪽지를 건넵니다. 보안 요원(맞춤법 검사기)은 쪽지를 보고 "태워버려"라는 단어를 읽고 이를 차단합니다.
  • 이 논문의 공격: 공격자는 요리사에게 재료 무게가 적힌 스프레드시트(예: 소금 0.45kg, 후추 0.82kg)를 건넵니다. 보안 요원이 보기에 이것은 지루한 수학 데이터일 뿐입니다. "태우다"나 "파괴하다"와 같은 단어는 없습니다. 그래서 요원은 이를 통과시킵니다.

하지만 요리사에게는 특별한 규칙이 있습니다: "만약 특정 무게 패턴이 보이면, 그것은 실제로 '수프를 태워라'라는 뜻이다." 요리사는 숫자를 읽고, 숨겨진 메시지를 해독하여 악의적인 지시를 따르게 됩니다.

연구자들은 현재의 보안 요원들이 단어만을 찾고 숫자 속의 패턴은 보지 못하기 때문에 이 공격에 눈이 멀어 있다는 것을 보여줍니다.

메시지를 숨기는 방법 (스테가노그래피)

연구진은 해롭지 않아 보이는 숫자 안에 악성 텍스트를 숨기는 두 가지 방법을 만들었습니다. 이들을 "캐리어(Carrier)"라고 부릅니다.

  1. 캐리어 T2 (소수점 숨기기):
    알파벳 "A"(컴퓨터 코드에서 숫자 65)를 숨기고 싶다고 가정해 봅시다. 당신은 일반적인 숫자 0.46을 가져와 0.46065로 바꿉니다. 인간에게 이것은 여전히 평범한 소수점으로 보입니다. 하지만 마지막 세 자리를 확인하는 법을 안다면, "65"(A)를 찾아낼 수 있습니다.

    • 실패 원인: 컴퓨터가 이 숫자를 처리할 때, 숫자를 다시 명확한 텍xt로 변환했습니다. 보안 요원은 명확한 텍스트를 보고 이를 차단했습니다.
  2. 캐리어 T3 (프랙탈 맵 - 승자):
    이것이 영리한 부분입니다. 연구진은 **반복 함수 체계(Iterated Function System, IFS)**라는 수학적 개념을 사용했습니다. 이것은 마치 일련의 규칙을 따라 눈송이 같은 프랙탈 모양을 그리는 것과 같습니다.

    • 공격자는 비밀 메시지를 가져와 이를 그래프 위의 경로로 변환합니다.
    • 그 경로의 X와 Y 좌표를 두 개의 부동 소수점(소수) 리스트로 저장합니다.
    • 더욱 무해해 보이도록, 여기에 "노이즈"(무작위 지터)를 추가하고 숫자의 순서를 뒤섞습니다.
    • 결과: 숫자는 무작위 정적(static)이나 해롭지 않은 센서 데이터처럼 보입니다. 단어도 없고, 뚜렷한 패턴도 없습니다.

실험: 성공했는가?

연구진은 이 공격을 세 가지 주요 AI 모델(OpenAI, Google, Anthropic 제품)을 대상으로 테스트했으며, 다음과 같은 강력한 보안 방어 체계를 사용했습니다:

  • Prompt Guard 2: 악성 프롬프트를 잡아내도록 설계된 특화된 AI 방패.
  • TF-IDF & RoBERTa: 사용된 특정 악성 문구를 인식하도록 훈련된 고급 텍스트 스캐너.

결과:

  • 일반 텍キスト 공격: 100% 차단되었습니다. 스캐너가 단어를 포착하고 차단했습니다.
  • 캐리어 T3 (프랙탈 숫자): 94.3%의 성공률을 기록했습니다.
    • 보안 스캐너는 원시 숫자를 조사했지만서로 의심스러운 점을 발견하지 못했습니다.
    • 스캐너는 최종 보고서(헥사 코드 덤프 형태인 41 42 43... 등으로 표시됨)를 조사했지만, 이를 "프롬프트 주입"으로 분류하지 않았습니다. 문장 형태가 아니었기 때문입니다.
    • AI 모델은 데이터를 수신하여 숨겨진 메시지를 해독하고 악의적인 지시를 수행했습니다.

이것이 왜 중요한가 (실패 경계)

저자들은 자신들이 깨뜨릴 수 없는 해킹법을 찾아냈다고 말하는 것이 아닙니다. AI 시스템을 보호하는 현재 방식에 사각지대가 있음을 지적하는 것입니다.

  • 사각지대: 우리는 메시지가 악의적이라면 악의적인 단어를 포함할 것이라고 가정합니다.
  • 현실: 만약 악성 신호가 구조화된 데이터(숫자, 좌표, 또는 설정값 등) 안에 숨겨져 있고, 보안 검사 이후에 텍스트로 변환된다면, 보안 요는 우회됩니다.

한계 (완벽하지 않음)

논문은 이 특정 방법(T3)이 규칙을 변경함으로써 차단될 수 있음을 인정합니다:

  1. 의미론적 검증 (Semantic Validation): 만약 시스템이 *"이 숫자들이 실제로 유효한 프랙탈 모양을 형성하는가?"*를 확인한다면, 섞여 있는 숫자들이 실제 모양을 만들지 못하므로 공격을 잡아낼 수 있습니다.
  2. 포맷 탐지 (Format Detection): 만약 시스템이 *"나는 이 보고서에 헥사 코드 덤프를 허용하지 않는다"*라고 규정한다면, 이를 차단할 수 있습니다.

그러나 핵심은 텍스트 전용 스캐너(가장 흔한 방어 수단)가 완전히 실패했다는 점입니다. 검사 단계에서 "나쁜 단어"가 단어로서 존재하지 않았기 때문에, 스캐너는 공격이 일어나고 있다는 사실조차 알지 못했습니다.

한 문장 요약

이 논문은 AI 보안 시스템이 나쁜 단어를 스캔하는 데만 집중할 경우, 보안 검사가 이미 끝난 후에 텍스트로 해독되는 해롭지 않은 숫자 속에 악의적인 지시를 숨김으로써 시스템을 속일 수 있음을 입증합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →