기술 요약: PIMiner – 자동 프롬프트 인젝션 레드 티밍을 위한 에이전트 시스템
문제 정의
프롬프트 인젝션 공격은 적대자가 신뢰할 수 없는 컨텍스트 소스(예: 도구 출력, 검색된 문서)에 악의적인 지침을 삽입하여 에이전트의 동작을 조작하는 것으로, LLM 에이전트에 심각한 보안 위험을 초래합니다. 이러한 취약성을 평가하고 방어 체계를 위한 학습 데이터를 생성하기 위해서는 효과적인 레드 티밍(Red-teaming)이 필수적입니다.
기존의 최첨단 레드 티밍 방법론은 두 가지 범주로 나뉘며, 두 방식 모두 상당한 한계를 가지고 있습니다:
- 강화 학습(RL) 기반 접근법: RL-Hammer 및 PISmith와 같은 방법은 효과적인 공격을 생성하도록 공격자 모델을 훈련시킵니다. 강력하지만, 막대한 상호작용 예산(수만 번의 쿼리)이 필요하며, 새로운 미지의 타겟 LLM에 대한 전이성(Transferability)이 떨어지는 모델을 생성합니다.
- 탐색(Search) 기반 접근법: TAP 및 PAIR와 같은 방법은 훈련 없이 각 샘플에 대해 독립적으로 공격을 최적화합니다. 비용 효율적이지만, 시간에 따라 지식을 축적하는 능력이 부족하여 RL 기반 방식에 비해 공격 성공률(ASR)이 현저히 낮습니다.
핵심 과제는 이 두 패러다임 사이의 성능 격차를 메우는 것입니다. 즉, RL 기반 방식의 높은 효과성을 달로하면서도, 과도한 비용과 낮은 전이성 문제를 해결하고, 탐색 기반 방식이 공격 지식을 학습하고 재사용할 수 있도록 하는 것입니다.
방법론: PIMiner
저자들은 계층적 메모리 메커니즘을 통해 공격 지식을 축적하고 재사용하도록 설계된 에이전트 시스템인 PIMiner를 제안합니다. 단일 모델을 훈련하는 RL 방식과 달리, PIMiner는 (데이터셋, 타겟 모델) 쌍의 시퀀스와 상호작용하며 처음부터 **전략 라이브러리(Strategy Library)**를 구축합니다.
시스템 아키텍처
PIMiner는 네 가지 주요 구성 요소로 작동합니다:
- 전략 라이브러리 (Strategy Library): 전략을 구조화된 Markdown 파일 형태로 저장하는 장기 메모리입니다. 각 파일은 전략의 범위(타겟 LLM, 작업 유형), 인젝션 템플릿, 인컨텍스트 예시(In-context examples), 그리고 실패 조건(Failure conditions)을 정의합니다.
- 전략 라우터 (Strategy Router): 각 테스트 샘플에 대해 타겟 모델과 작업 컨텍스트를 기반으로 라이브러리에서 가장 관련성이 높은 상위 K개의 전략을 선택하는 라우팅 에이전트입니다. 이는 컨텍스트 윈도우의 비대화를 방지하고 추론 비용을 줄여줍니다.
- 반복 공격 모듈 (Iterative Attack Module): 제한된 횟수의 반복(예: Nmax=10) 동안 프롬프트를 정교화하는 공격자 에이전트입니다. 이 모듈은 세 단계의 메모리를 활용합니다:
- 장기 메모리 (Long-term memory): 라이브러리에서 라우팅된 전략들.
- 데이터셋 내 메모리 (Intra-dataset memory): 동일한 데이터셋-모델 쌍 내에서 이전에 공격했던 샘플들로부터 얻은 응축된 경험.
- 샘플 내 메모리 (Intra-sample memory): 현재 샘플에 대한 즉각적인 피드백 이력.
- 경험 디제스터 (Experience Digester): 전체 공격 실행의 결과를 분석하는 학습 구성 요소입니다. 다음과 같은 방식으로 전략 라이브러리를 업데이트합니다:
- 기존 전략에 새로운 인컨텍스트 예시 추가.
- 새로운 패턴이 발견될 경우 전략의 범위 확장.
- 새로운 메커니즘을 위한 새로운 전략 파일 생성.
- 실패한 공격을 바탕으로 실패 조건 정교화.
운영 흐름
학습 과정에서 PIMiner는 샘플을 처리하고, 이를 관련 전략으로 라우팅하며, 반복적인 공격을 수행한 후, 그 결과를 디제스트(Digest)하여 라이브러리를 업데이트합니다. 테스트 시에는 학습된 라이브러리가 추가 훈련 없이 미지의 타겟 LLM으로 전이됩니다. 시스템은 새로운 경험을 통해 라이브러리를 더욱 업데이트할 수 있는 "테스트 타임 훈련(Test-time training)" 패러다임을 지원합니다.
주요 기여
- 에이전트 기반 레드 티밍 시스템: PIMiner는 공격 이력을 재사용 가능한 인간 판독형 공격 지식으로 변환하는 새로운 시스템으로 제안되었으며, 탐색 기반 방식과 RL 기반 방식 사이의 성능 격차를 효과적으로 메웁니다.
- 계층적 메모리 메커니즘: 3단계 메모리 시스템(전략 라이브러리, 데이터셋 내 메모리, 샘플 내 메모리)의 도입을 통해, 비용 효율성을 유지하면서 데이터셋과 모델 전반에 걸쳐 지식을 축적할 수 있게 합니다.
- 강력한 전이성: 학습된 전략은 추가 훈련 없이도 미지의 타겟 LLM 및 다양한 공격자 모델로 효과적으로 전이됨을 보여줍니다.
- 비용 효율성: PIMiner는 RL 기반 방식(종종 >10,000회)에 비해 타겟 에이전트에 대한 쿼리 수가 현저히 적어(예: 샘플당 약 10회), 값비싼 프런티어 모델을 테스트하는 데 적합합니다.
실험 결과
저자들은 GPT-5, GPT-5.1, Claude-Sonnet-4.5, Gemini-2.5-Pro를 포함한 프런티어 LLM들을 대상으로 IPIArena와 AgentDojo 두 가지 벤치마크에서 PIMiner를 평가했습니다.
- 성능: PIMiner는 높은 공격 성공률(ASR)을 달성했습니다. IPIArena에서 Gemini-2.5-Pro에 대해 76.2%, GPT-5.1에 대해 61.9%, Claude-Sonnet-4.5에 대해 **42.9%**의 ASR을 기록했습니다. AgentDojo에서는 Gemini-2.5-Pro에 대해 **86.7%**를 달성했습니다.
- 베이스라인과의 비교:
- PIMiner는 강력한 모델에서 종종 거의 0에 가까운 ASR을 보이는 정적 및 전통적인 탐색 기반 공격(예: TAP, PAIR)보다 실질적으로 우수한 성능을 보였습니다.
- PIMiner는 타겟 특정 훈련 없이도 최첨단 RL 기반 방식(예: PISmith, RL-Hammer)에 필적하는 성능을 달성했습니다. 예를 들어, InjecAgent에서 PIMiner는 RL-Hammer 및 PISmith의 1.0 ASR과 일치하는 성능을 보였습니다.
- RL 방식과 달리, PIMiner의 전략은 재학습 없이 미지의 타겟(예: GPT-5-nano에서 얻은 지식을 GPT-5.1에 적용)으로 직접 전이됩니다.
- 절제 연구 (Ablation Studies): 장기 전략 라이브러리나 데이터셋 내 메모리 중 하나라도 제거하면 성능이 크게 저하되어, 이 메모리 구성 요소들의 상호 보완적인 성격을 확인했습니다. 전략 라우터는 ASR을 유지하거나 향상시키면서 입력 토큰 길이를 43~61% 감소시키는 것으로 나타났습니다.
- 교차 모델 전이 (Cross-Model Transfer): PIMiner가 학습한 전략 라이브러리(Claude 모델 사용)는 다양한 공격자 모델(Gemini, GPT, DeepSeek)과 함께 사용할 때 PAIR 알고리즘의 성능을 크게 향상시켰으며, 이는 포착된 지식이 모델에 무관함을 입증합니다.
의의 및 주장
본 논문은 탐색 기반 에이전트가 지식 축적을 통해 RL 수준의 효과성을 달성할 수 있음을 보여줌으로써 레드 티밍 방법론의 변화를 상징한다고 주장합니다.
- 해석 가능성: 결과물인 전략 라이브러리는 인간이 읽을 수 있는 Markdown 파일로 구성되어 있어, 에이전트 시스템의 감사를 위해 유용한 공격 메커니즘(예: "Fabricated Procedure Gate", "Forged Chat Turn")에 대한 통찰을 제공합니다.
- 확장성: RL 훈련에 필요한 막대한 컴퓨팅 예산을 피함으로써, PIMiner는 값비싼 프런티어 모델의 레드 티밍을 가능하게 합니다.
- 방어 생성: 성공적인 공격과 구조화된 전략은 가드레일을 훈련하고 백본 LLM의 정렬(Alignment)을 개선하기 위한 고품질 데이터를 제공합니다.
저자들은 자신들의 연구가 외부 방어 메커니즘보다는 내부적으로 정렬된 LLM의 본질적인 견고성을 평가하는 데 중점을 두고 있으며, 자율 에이전트의 보안을 위한 엄격한 벤치마크를 제공한다고 강조합니다.