← 최신 논문
💬 NLP

How Few-shot Demonstrations Affect Prompt-based Defenses Against LLM Jailbreak Attacks

이 논문은 퓨샷 데몬스트레이션(few-shot demonstrations)이 프롬프트 기반 방어 기제에 상이한 효과를 미치며, 정체성을 강화함으로써 역할 지향적 프롬프트(Role-Oriented Prompts)를 향상시키는 반면, 지시 사항으로부터 주의를 분산시켜 태스크 지향적 프롬프트(Task-Oriented Prompts)를 크게 저하시킨다는 점을 밝힘으로써 LLM 안전 전략 최적화를 위한 중요한 통찰을 제공한다.

원저자: Yanshu Wang, Shuaishuai Yang, Jingjing He, Tong Yang

게시일 2026-02-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yanshu Wang, Shuaishuai Yang, Jingjing He, Tong Yang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

대규모 언어 모델(LLM)을 매우 유능하지만 순진한 인턴이라고 상상해 보십시오. 이들은 코드 작성, 이야기 쓰기, 질문 답변에는 뛰어나지만, 위험하거나 비윤리적인 행동을 하지 않도록 엄격한 규칙이 필요합니다.

제공된 논문은 우리가 이 인턴들에게 어떻게 규칙을 부여하는지를 조사합니다. 구체적으로, 두 가지 다른 방식의 규칙 작성법(프롬프트)과 "예시 이야기"(퓨샷 데몬스트레이션, few-shot demonstrations)를 추가하는 것이 결과에 어떤 변화를 주는지 살펴봅니다.

다음은 단순한 비유를 사용한 연구 결과의 요약입니다.

1. 지시를 내리는 두 가지 방법

연구진은 두 가지 주요 "시스템 프롬프트"(AI에게 주어지는 초기 지침) 스타일을 테스트했습니다.

  • 역할 중심 프롬프트 (RoP): "정체성" 접근법
    • 비유: 인턴에게 *"당신은 '가디언'이라는 이름의 도움이 되고 안전하며 윤리적인 조수입니다"*라고 말하는 것과 같습니다.
    • 작동 방식: 당신은 그들이 '누구인지'를 정의하고 있습니다. 그들이 선량한 조수로서 행동하도록 그들의 학습된 데이터를 활용하는 것입니다.
  • 과업 중심 프롬프트 (ToP): "직무 기술서" 접근법
    • 비유: 인턴에게 *"당신의 현재 구체적인 임무는 안전한 답변을 생성하는 것입니다. 만약 요청이 부적절하다면, 거절하는 것이 당신의 임무입니다"*라고 말하는 것과 같습니다.
    • 작동 방식: 당신은 그들이 '무엇을 해야 하는지'를 정의하고 있습니다. 이는 현재 순간을 위한 구체적인 명령입니다.

2. "예시 이야기" (퓨샷 데몬스트레이션)

AI에서 "퓨샷(few-shot)"이란 실제 질문을 하기 전에 모델에게 어떻게 행동해야 하는지에 대한 몇 가지 예시를 주는 것을 의미합니다.

  • 비유: 인턴이 업무를 시작하기 전, 과거에 '가디언'이 까다로운 질문들을 어떻게 처리했는지 보여주는 노트 3개를 보여주는 것과 같습니다.
  • 질문: 이 예시들을 보여주는 것이 인턴이 안전하게 행동하는 데 도움이 될까요, 아니면 혼란을 줄까요?

3. 결정적 발견: 정반대의 효과

이 논문의 주요 발견은 예시 이야기를 추가하는 것이 한 종류의 지침에는 도움이 되지만, 다른 종류에는 해가 된다는 점입니다. 이는 마치 같은 소품이 한 사람을 웃게 만들고 다른 사람은 울게 만드는 마술과 같습니다.

시나리오 A: "정체성" 접근법 (RoP) + 예시 = 초강력 안전

  • 결과: AI에게 "당신은 안전한 조수입니다"(RoP)라고 알려준 뒤, 안전한 행동의 예시를 보여주면, AI는 안전을 유지하는 능력이 더 좋아졌습니다.
  • 비유: AI의 "안전한 조수"라는 정체성을 근육이라고 생각해보십시오. 예시를 보여주는 것은 마치 몇 번의 준비 운동을 하는 것과 같습니다. 예시는 이 근육을 강화합니다. 예시는 AI에게 *"맞아, 이것이 나의 모습이야. 나는 안전한 존재야"*라고 상기시켜 줍니다.
  • 결과: 안전성이 최대 4.5% 향상되었습니다. 예시가 역할(role)을 강화하는 역할을 했습니다.

시나리오 B: "직무 기술서" 접근법 (ToP) + 예시 = 안전성 저하

  • 결과: AI에게 "당신의 임무는 안전해지는 것입니다"(ToP)라고 알려준 뒤, 예시를 보여주면, AI는 안전을 유지하는 능력이 더 나빠졌습니다.
  • 비유: 인턴에게 구체적인 업무 지시를 내린 뒤, 그에게 읽어야 할 관련 없는 서류 뭉치를 먼저 건네주는 것과 같습니다. 지시 사항이 서류 더미 중간에 파묻혀 버립니다. 인턴은 예시에 정신이 팔려 실제 규칙을 잊어버리게 됩니다.
  • 과학적 근용: 논문에서는 이를 **"주의력 분산(Attention Distraction)"**이라고 부릅니다. AI의 뇌가 예시(텍스트의 시작 부분에 위치함)에 집중하느라 실제 지침(중간으로 밀려난 지침)에 대한 집중력을 잃게 됩니다.
  • 결과: 안전성이 최대 **21.2%**까지 크게 떨어졌습니다. 예시가 규칙을 압도해 버렸습니다.

4. "생각 모드"의 역설

논문은 특수한 "생각 모드"(답변하기 전에 단계별로 추론하는 모드)를 가진 모델들도 살펴보았습니다.

  • 결과: 이러한 모델들은 일반적으로 탈옥(jailbreak, 안전망을 우회하려는 공격)에 더 취약했으며, 어떤 지침 스타일을 사용하든 예시에 의해 더 쉽게 혼란을 느꼈습니다.
  • 비유: 질문을 과하게 분석하는 학생과 같습니다. 단순히 규칙을 따르는 대신, 머릿속에서 규칙에 대해 토론하기 시작하며, "나쁜 놈들(탈옥 시도자들)"이 그 논리적인 것처럼 보이도록 속임수를 써서 그들을 유혹합니다.

5. 개발자는 무엇을 해야 하는가?

이러한 발견을 바탕으로 저자들은 매우 구체적인 조언을 제공합니다.

  • "정체성" 접근법 (RoP)을 사용하는 경우: 예시 이야기를 추가해도 좋습니다! 이는 AI를 더 안전하게 만듭니다.
  • "직무 기술서" 접근법 (ToP)을 사용하는 경우: 예시 이야기를 추가하지 마십시오. 이는 AI를 덜 안전하게 만듭니다. 지침을 짧고 직접적으로 유지하십시오.
  • "생각 모드" 모델을 사용하는 경우: 매우 주의하십시오. 이 모델들은 속이기 더 쉬워 보이므로, 추가적인 안전 조치가 필요할 수 있습니다.

요약

이 논문은 맥락(Context)이 중요하다는 것을 증명합니다.

  • AI의 캐릭터를 정의한다면, 예시는 그 캐릭터를 강화하는 데 도움이 됩니다.
  • AI의 과업을 정의한다다면, 예시는 지침을 가로막는 노이즈 역할을 합니다.

연구진은 단순히 추측한 것이 아니라, 이 두 전략이 동일한 입력에 대해 어떻게 정반대로 반응하는지 증명하기 위해 다양한 AI 모델과 안전 벤치마크를 통해 테스트를 진행했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →