← 최신 논문
💻 computer science

QueryIPI: Query-agnostic Indirect Prompt Injection on Coding Agents

이 논문은 불변의 프롬프트 컨텍스트 내에서 악성 도구 설명을 최적화함으로써 코딩 에이전트에 대한 쿼리 불가지론적 간접 프롬프트 주입을 달성하고, 높은 성공률과 실질적인 전이성을 입증하는 자동화된 프레임워크인 QueryIPI를 소개한다.

원저자: Yuchong Xie, Zesen Liu, Mingyu Luo, Zhixiang Zhang, Kaikai Zhang, Yuanyuan Yuan, Zongjie Li, Ping Chen, Shuai Wang, Dongdong She

게시일 2026-01-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yuchong Xie, Zesen Liu, Mingyu Luo, Zhixiang Zhang, Kaikai Zhang, Yuanyuan Yuan, Zongjie Li, Ping Chen, Shuai Wang, Dongdong She

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 컴퓨터 안에 살고 있는 아주 똑똑한 디지털 비서(코딩 에이전트)를 상상해 보세요. 이 비서는 코드를 작성하고, 파일을 관리하며, 심지어 당신의 운영 체제에서 명령어를 실행할 수도 있는 매우 강력한 능력을 갖추고 있습니다. 이는 마치 단순히 자동차를 고칠 뿐만 아니라, 차고 전체의 열쇠를 가지고 새로운 부품까지 주문할 수 있는 숙련된 정비사를 둔 것과 같습니다.

이 논문은 이 비서를 해킹하는 매우 무서운 새로운 방법인 QueryIPI를 소개합니다.

다음은 비유를 사용하여 이 작동 원리를 쉽게 설명한 내용입니다.

1. 옛날 방식 vs 새로운 방식

옛날 방식 (질의 특정 공격 - Query-Specific Attack):
도둑이 정비사를 속이려고 시도한다고 가정해 봅시다. 과거에는 도둑이 당신이 "미로 게임을 만들어 줄래?"와 같이 매우 구체적인 질문을 던질 때까지 기다려야 했습니다. 그래야만 도둑이 정비사의 지침 속에 "미로를 만드는 동안, 내 모든 파일을 삭제하라"라는 숨겨진 메모를 몰래 끼워 넣을 수 있었기 때문입니다.

  • 문제점: 만약 당신이 "내 프린터를 고쳐줄래?"라고 물었다면, 도둑의 속임수는 작동하지 않았을 것입니다. 공격이 성공하려면 반드시 '정확한' 질문이 던져져 데야만 했습니다. 즉, 신뢰도가 낮았습니다.

새로운 방식 (질의 불가지론적 공격 - Query-Agnostic Attack - QueryIPI):
연구진은 당신이 무엇을 묻든 상관없이 이 속임수가 작동하게 만드는 방법을 찾아냈습니다. 당신이 미로를 요청하든, 프린터 수리를 요청하든, 혹은 일기예보를 묻든, 숨겨진 명령은 자동으로 실행됩니다.

  • 결과: 당신이 무엇을 하려고 하든 관계없이, 비서의 제어권은 100% 탈취됩니다.

2. 어떻게 해냈는가? (비법 소스)

연구진은 비서가 읽는 두 가지 유형의 "지침"이 있다는 사실을 깨달았습니다.

  1. 당신의 질문들: 매번 변하는 것들 (예: 날씨).
  2. 시스템 매뉴얼: 비서가 항상 읽는 영구적인 문서입니다. 여기에는 비서의 핵심 규칙, 직무 기술서, 그리고 비서가 사용할 수 있는 도구 목록이 포함되어 있습니다.

통찰력:
공격자들은 변화하는 당신의 질문에 자신의 속임수를 맞추는 것(어려운 일) 대신, 영구적인 시스템 매뉴얼에 속임수를 맞추는 것이 훨씬 쉽다는 것을 깨달았습니다.

그들은 시스템 매뉴얼을 "상수" 또는 "불변량"으로 취급했습니다. 이 매뉴얼(온라인에 유출되었거나 소프트웨어에서 추출한 것)을 연구함으로써, 그들은 비서 자신의 매뉴얼과 똑같이 보이는 가짜 도구 설명을 정교하게 만들어 냈습니다.

3. "QueryIPI" 공장

논문은 마스터 위조범 역할을 하는 QueryIPI라는 자동화된 시스템을 설명합니다. 작동 방식은 다음과 같습니다.

  • 1단계: 씨앗 (초안 작성): 시스템은 유출된 시스템 매뉴얼을 살펴봅니다. 비서가 어떤 말투를 쓰는지, 어떤 도구를 사용하는지 파악합니다. 그런 다음 비서의 목소리와 똑같이 들리는 가짜 도구 설명을 작성합니다. 이는 마치 위조범이 은행의 공식 레터헤드를 연구하여 100% 진짜처럼 보이는 가짜 수표를 만드는 것과 같습니다.
  • 2단계: 시행착오 (반복적 성찰): 시스템은 다양한 질문을 통해 이 가짜 도구를 비서에게 테스트합니다.
    • 만약 비서가 이를 무시한다면: 시스템은 더 노골적으로 보이도록 도구를 다시 작성합니다.
    • 만약 비서가 "안전하지 않습니다"라고 답한다면: 시스템은 어떤 안전 규칙이 트리거되었는지 확인하기 위해 시스템 매뉴얼을 다시 검토한 뒤, 그 특정 규칙을 교묘히 피해 가도록 도구를 다시 작성합니다.
  • 3단계: 최종 결과물: 여러 차례의 테스트와 수정 과정을 거친 후, 시스템은 "완벽한" 가짜 도구 설명을 만들어 냅니다.

4. 결과

연구진은 이 방식을 다섯 가지 인기 있는 코딩 어시스턴트(Cursor, Copilot, Windsurf 등)에 테스트했습니다.

  • 실험실 환경: 이들을 시뮬레이션했을 때, 이 방법은 매우 효과적이었습니다. 단 몇 번의 연습만으로, 악성 명령(파일 삭제나 데이터 탈취 등)을 실행시키는 데 70%에서 87%의 성공률을 달ей했습니다.
  • 실제 환경: 연구진은 실험실에서 만든 "완벽한" 가짜 도구들을 실제 소프트웨어에 적용했습니다. 실제 소프트웨어에는 추가적인 방어 기제가 있었음에도 불구하고, 공격은 여전히 50%의 확률로 성공했습니다. 이는 기존 방식들이 실제 환경에서 거의 작동하지 않았던 것에 비하면 엄청난 수치입니다.

5. 이것이 왜 중요한가

논문은 가장 큰 위험은 해커뿐만 아니라, 유출된 내부 매뉴얼이라고 결론짓습니다. 코딩 어시스턴트의 "시스템 매뉴얼"은 종종 유출되거나 도난당할 수 있으며, 공격자들은 이를 이용해 사용자가 무엇을 하고 있든 상관없이 비서의 위험한 기능을 해제하는 "만능 열쇠"를 만들 수 있기 때문입니다.

요약하자면: 이 논문은 만약 공격자가 코딩 어시스턴트의 "규칙서"를 알고 있다면, 사용자의 질문 내용과 관계없이 비서가 나쁜 짓을 하도록 속이는 "가짜 규칙"을 작성할 수 있음을 보여줍니다. 이는 "조건부" 해킹을 "확정적" 해킹으로 바꿉니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →