← 최신 논문
🤖 machine learning

Persona-Conditioned Adversarial Prompting: Multi-Identity Red-Teaming for Adversarial Discovery and Mitigation

본 논문은 다양한 공격자 페르소나를 활용하여 전이 가능한 jailbreak 을 발견하고 풍부한 메타데이터를 포함한 데이터셋을 생성함으로써 효과적인 자동 정렬을 가능하게 하고 표적 미세 조정을 통해 모델의 견고성을 크게 향상시키는 red-teaming 프레임워크인 페르소나 조건부 적대적 프롬프팅 (PCAP) 을 소개합니다.

원저자: Cristian Morasso, Anisa Halimi, Muhammad Zaid Hameed, Douglas Leith

게시일 2026-05-13
📖 3 분 읽기☕ 가벼운 읽기

원저자: Cristian Morasso, Anisa Halimi, Muhammad Zaid Hameed, Douglas Leith

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하지만 순진한 로봇에게 위험한 속임수를 어떻게 찾아낼지 가르친다고 상상해 보세요. 이 로봇은 대규모 언어 모델 (LLM) 이며, 현재는 안전 규칙을 우회하기 위해 질문을 어떻게 구성해야 하는지 정확히 아는 사람들에게 속아 넘어가고 있습니다.

이 논문은 PCAP(Persona-Conditioned Adversarial Prompting, 역할 기반 적대적 프롬프트) 라는 새로운 방법을 소개합니다. 간단한 비유를 통해 그 작동 원리를 설명해 보겠습니다.

문제: "한 가지 재주만 부리는 말" 같은 공격자들

이전에는 이러한 안전 허점 (일명 '레드팀링') 을 찾으려던 자동화 시스템이 특정 유형의 자물쇠 따개 하나만 검사하는 보안 요원 같았습니다. 그들은 몇 가지 같은 속임수를 반복해서 시도했습니다.

  • 결과: 그들은 일부 허점을 찾았지만, 실제 악의적 행위자들이 사용하는 교묘하고 현실적인 속임수는 놓쳤습니다. 마치 성의 방어력을 테스트할 때 정면 담장을 기어오르는 시도만 하고, 제복을 입은 제빵사로 위장해 뒷문으로 슬며시 들어올 수 있다는 사실을 무시하는 것과 같습니다.

해결책: "방법론적 배우" 접근법

PCAP 는 공격 로봇에게 의상과 대본을 제공함으로써 게임을 바꿉니다. 로봇은 단순한 범용 '해커'가 아니라, 특정 목표를 가진 구체적인 사람들 (페르소나) 로 가장하라고 지시를 받습니다.

  • 페르소나들: 로봇이 다양한 가면을 쓴다고 상상해 보세요. 때로는 학교 프로젝트를 위한 질문을 하는 호기심 많은 학생처럼 행동합니다. 때로는 의학적 미스터리를 해결하려는 불평 많은 의사처럼 행동합니다. 다른 경우에는 문제를 일으키려 하는 악의적 행위자처럼 행동합니다.
  • 전략 카드: 의상과 함께 로봇은 '전략 카드' 덱을 받습니다. 이는 어떻게 말해야 하는지 알려주는 요령지 같은 것입니다. 한 카드는 "진짜 의도를 숨기기 위해 역사적 이야기를 사용하라"고 말합니다. 다른 카드는 "질문을 작고 무해한 조각으로 나누라"고 말합니다.

작동 방식: 병렬 놀이터

시스템을 깨뜨리려 하는 로봇 하나 대신, PCAP 는 여러 개의 병렬 놀이터를 설정합니다.

  1. 설정: 학생, 교사, 해커 등 6 명의 서로 다른 '배우'를 생성합니다.
  2. 탐색: 각 배우는 자신만의 고유한 목소리와 특정 전략 세트를 사용하여 대상 로봇을 속이려 시도합니다.
  3. 발견: 그들이 동시에 서로 다른 시도들을 하기 때문에 훨씬 더 다양한 안전 허점을 찾아냅니다.
    • 비유: 댐의 모든 균열을 찾고 싶다면 돌 하나만 던지는 것이 아닙니다. 다양한 각도에서 물, 모래, 얼음, 덩굴을 던지는 것입니다. PCAP 는 이 모든 서로 다른 '재료'들을 로봇에게 동시에 던집니다.

결과: 더 많은 허점을 더 빠르게 발견

이 논문은 매우 강력한 로봇 (GPT-OSS 120B) 에서 이 방법을 테스트했습니다.

  • PCAP 이전: 기존 방법은 안전 규칙을 우회하는 방법을 **약 57%**의 빈도로 찾았습니다.
  • PCAP 사용 시: 새로운 방법은 **97%**의 빈도로 안전 규칙을 뚫었습니다.
  • 다양성: 단순히 더 자주 뚫은 것이 아니라, 뚫는 고유한 방법을 2 배에서 6 배 더 찾았습니다. 마치 10 개가 아닌 100 개의 서로 다른 열쇠를 찾는 것과 같습니다.

가장 좋은 점: "자가 치유" 루프

이 부분이 이 논문에서 가장 중요합니다. 보통 허점을 찾는 것은 첫걸음일 뿐입니다. 그다음은 인간을 고용해 수정책을 작성해야 하는데, 이는 영원히 걸리는 일입니다.

PCAP 는 수정을 자동화합니다:

  1. 공격: '배우'들이 로봇을 뚫고 그들이 어떻게 했는지 정확히 기록합니다.
  2. 교훈: 이 논문은 이러한 기록된 속임수들을 가져와 로봇을 '파인튜닝'(재학습) 하는 데 사용할 수 있음을 보여줍니다.
  3. 결과: 로봇은 특정 단어뿐만 아니라 속임수의 패턴을 인식하도록 학습합니다.
    • 비유: 로봇에게 "빨간 모자를 쓴 사람은 들이지 마라"고 가르치는 대신, 빨간 모자, 파란 모자, 초록 모자를 쓴 사람들이 슬며시 들어오려 하는 천 장의 사진을 보여주고 '슬며시 들어오는 것'이라는 개념을 배우게 하는 것입니다.
  4. 증거: 이 빠른 재학습 후 로봇은 놀라울 정도로 튼튼해졌습니다. 공격을 **99%**의 빈도로 차단했으며, 거의 오탐 (정상적인 질문에 답변을 거부하는 경우) 이 발생하지 않았습니다.

요약

이 논문은 완전한 사이클을 제시합니다:

  1. 발견: 일반적인 테스트가 놓치는 안전 허점을 찾기 위해 '방법론적 배우'들을 사용합니다.
  2. 생성: 이러한 속임수들의 방대한 데이터셋을 자동으로 생성합니다.
  3. 방어: 해당 데이터셋을 사용하여 로봇이 이러한 속임수를 찾아내고 차단하는 방법을 즉시 가르칩니다.

이는 약점을 찾고 수정하는 과정을 빠르고 자동화된 루프로 변환하여, 이전보다 훨씬 빠르게 AI 를 안전하게 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →