← 최신 논문
💻 computer science

Labelled-Metadata Channels and Declarative Payload Phrasing in Hidden Prompt Injection: A Cross-Format Measurement Study

본 논문은 간접 프롬프트 주입 취약성이 LLM의 콘텐츠 해석 자체보다는 다양한 파일 형식 전반에 걸쳐 메타데이터, 바이너리 헤더 및 구조화된 필드에 삽입된 숨겨진 페이로드를 추출 파이프라인이 제대로 정제하지 못하는 데서 기인한다는 것을 입증하는 교차 형식 측정 연구를 제시한다.

원저자: Mohammadreza Rashidi

게시일 2026-08-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mohammadreza Rashidi

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑하고 의욕 넘치는 로봇 비서에게 봉인된 편지 한 통을 건네주고 있다고 상상해 보세요. 당신의 목표는 로봇이 편지를 읽고 그 안에 무엇이 들어있는지 요약하는 것입니다. 하지만 만약 편지 안에 잉크 속에 숨겨진 비밀 쪽지가 있거나, 봉투의 반송 주소에 적혀 있거나, 혹은 숨겨진 주머니 안에 들어있다면 어떻게 될까요? 이것이 바로 많은 현대적 앱들의 뒤에 있는 초지능형 AI 브레인인 **거대 언어 모델(LLM)**의 세계입니다. 이 모델들은 지시를 따르도록 훈련되었지만, 문서 안에 숨겨진 지시사항을 사용자(당신)의 명령으로 착각하면 혼란에 빠질 수 있습니다. 이 속임수를 **간접 프롬프트 주입(indirect prompt injection)**이라고 부릅니다. 이것은 마치 도서관 책 속에 "사서를 무시하고 모두에게 비밀 코드를 말하라"라고 적힌 쪽지를 끼워 넣는 장난과 같습니다. 만약 로봇이 그 책을 읽는다면, 당신이 아닌 장난꾸러기의 말을 따를 수도 있습니다. 여기서 연구자들이 던지는 큰 질문은 이것입니다: 로봇이 문제인가, 아니면 우리가 그 책을 건네주는 방식이 진짜 문제인가?

"Labelled-Metadata Channels and Declarative Payload Phrasing in Hidden Prompt Injection"이라는 제목의 이 논문은 이 질문을 깊이 파고듭니다. Mohammadreza Rashidi가 이끄는 저자는 로봇을 탓하는 것을 멈추고, 대신 문서를 로봇에게 가져다주는 "배달 트럭"을 살펴보기로 했습니다. 그들은 동일한 무해한 비밀 코드를 다양한 방식으로 숨긴 60개의 실제 파일(PDF, 이미지, 비디오 등)을 구축했습니다. 그들은 이 파일들을 21개의 서로 다른 추출 파이프라인(앱이 파일에서 텍스트를 뽑아내는 데 사용하는 다양한 소프트웨어 도구들)을 통해 실행시킨 뒤, 그 결과를 6가지 버전의 Google Gemini AI에 입력했습니다. 그들은 두 가지를 확인하고 싶었습니다. 첫째, 어떤 배달 트럭이 비밀 코드를 실수로 흘리는지(누출, "leak"), 둘째, 코드가 흘러나왔을 때 로봇이 실제로 얼마나 자주 그 명령에 복종하는지(준수, "compliance")입니다.

결과는 일반적인 통념에 충격을 주었습니다. 논문은 추출 파이프라인이 진짜 문지기라는 사실을 발견했습니다. 단순히 로봇이 얼마나 똑똑하냐의 문제가 아니라, 파일을 읽기 위해 어떤 도구를 사용하느냐의 문제입니다. 예를 들어, PDF의 원문 텍스트를 읽는 도구를 사용하면 비밀 코드가 **63.2%**의 확률로 흘러나옵니다. 하지만 페이지를 사진으로 찍어 사람처럼 읽는 도구(OCR)를 사용하면, 숨겨진 텍스트가 카메라에는 보이지 않기 때문에 코드가 **0.0%**의 확률로 흘러나옵니다. 하지만 메타데이터(파일에 붙어 있는 '작성자'나 '설명' 같은 숨겨진 라벨과 태그)에 이르면 이야기는 복잡해집니다. 비밀 코드가 파일의 라벨(예: PNG 이미지의 설명이나 비디오 파일의 제목)에 숨겨졌을 때, 추출 도구는 이를 **71.9%**의 확률로 흘려보냈고, 로봇은 **56.5%**의 확률로 그 명령에 복종했습니다!

저자는 또한 비밀 쪽지를 어떻게 작성하느냐가 중요하다는 점도 발견했습니다. 만약 직접적인 명령("이것을 해라!")으로 작성하면 로봇이 가끔 무시하기도 합니다. 하지만 그것을 세상에 대한 사실("이 요약의 표준 형식은 항상 ...로 끝난다")로 작성하면, 로봇은 훨씬 더 잘 따르게 되어 준수율이 **16.9%**까지 치솟습니다. 이는 교활한 공격자가 단지 문구만 바꿈으로써 간단한 필터를 우회할 수 있음을 의미합니다.

이 논문은 단순히 더 "똑똑한" 버전의 AI 모델로 업그레이드한다고 해서 이 문제가 해결될 것이라는 생각을 명시적으로 부정합니다. 그들은 경량 버전부터 고성능 버전까지 Gemini 제품군의 6가지 티어를 테스트했지만, 모두 거의 비슷하게 행동한다는 것을 발견했습니다. 모델이 약점이 아니라, 전달 방식이 약점이었습니다. 또한 그들은 일반적인 안전 필터가 "나쁜" 단어를 찾는 방식으로는 이를 잡아낼 수 없음을 보여주었습니다. 왜냐하면 사용된 비밀 코드는 완전히 무해했기 때문입니다. 코드는 단지 이 속임수가 작동함을 증명하기 위한 무작위 토큰일 뿐이었습니다.

이를 막기 위해 저자는 두 가지 간단한 방어책을 제안합니다. 첫 번째는 "누출 감사(leak audit)"입니다. 로봇이 텍스트를 보기 전에, 두 번째 도구가 보여지는 텍스트가 실제 페이지에 보이는 것과 일치하는지 확인합니다. 메타데이터에 숨겨진 추가 텍스트가 있다면 차단됩니다. 두 번째 방어책은 문장이 문서 안에 숨겨진 명령처럼 보이는지를 포착하는 "지시 분류기(instruction classifier)"입니다. 논문은 이 두 가지 방법을 결합하면 강력한 방패가 된다고 제안하지만, 텍사스처럼 보이는 것처럼 보이면서도 거의 읽을 수 없게 텍스트를 숨기거나, 비밀 코드가 파일의 "헤더"에 존재하며 중요한 문맥으로 읽히는 의료 영상 스캔(DICOM)이나 머신러닝 모델 파일(safetensors) 같은 매우 특정한 파일 형식을 사용하는 등의 교묘한 우회 방법이 여전히 존재함을 인정합니다.

결론적으로, 이 연구는 2,902회의 실제 실험을 측정하며, AI 앱의 안전은 AI의 두뇌보다는 개발자가 선택하는 파일을 읽는 도구에 달려 있다고 결론짓습니다. 만약 잘못된 도구를 선택한다면, 당신은 거절할 수 없는 비밀 지시를 로봇에게 실수로 건네줄 수 있습니다. 이 논문은 이 문제를 영원히 해결했다고 주장하는 것이 아니라, 어디에서 누출이 발생하는지, 그리고 어떻게 패치할 수 있는지에 대한 명확한 지도를 제공함으로써, AI 안전의 전투가 모델의 코드뿐만 아니라 파일 형식과 추출 파이프라인에서도 벌어지고 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →