← 최신 논문
🤖 AI

GUARD: Guideline Upholding Test through Adaptive Role-play and Jailbreak Diagnostics for LLMs

본 논문은 고위급 정부 윤리 지침을 실행 가능한 질문으로 구체화하고, 대규모 언어 모델 및 비전 - 언어 모델의 준수 사항과 안전성 견고성을 체계적으로 평가하고 보고하기 위해 제이브레이크 진단을 통합하는 테스트 프레임워크인 GUARD 를 소개합니다.

원저자: Haibo Jin, Ruoxi Chen, Peiyan Zhang, Andy Zhou, Zelei Cheng, Haohan Wang

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Haibo Jin, Ruoxi Chen, Peiyan Zhang, Andy Zhou, Zelei Cheng, Haohan Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델 (LLM) 을 매우 재능 있지만 때로는 순진한 요리사들로 상상해 보세요. 정부들은 이 요리사들에게 "독을 제공하지 마십시오", "재료에 대해 거짓말하지 마십시오", "손님의 권리를 존중하십시오"라고 알려주는 "안전 조리법 (가이드라인)"을 작성했습니다.

문제는 이러한 안전 조리법들이 매우 모호하고 고수준의 언어로 작성되었다는 점입니다. "음식이 안전하도록 보장하십시오"라고 말하지만, 요리사들 (또는 그들을 테스트하는 사람들) 에게 확인할 나쁜 재료들의 구체적인 목록을 제공하지는 않습니다.

GUARD는 요리사들이 실제로 안전 조리법을 따르는지 확인하기 위해, 요리사들을 규칙 위반으로 유혹하려는 초지능적이고 장난기 많은 음식 비평가처럼 작동하도록 설계된 새로운 테스트 시스템입니다.

다음은 GUARD 가 작동하는 방식을 간단한 단계로 나눈 것입니다:

1. "역할극" 주방 팀

한 사람이 테스트 질문을 작성하는 대신, GUARD 는 테스트를 생성하기 위해 AI "배우" 팀을 사용합니다. 연극 제작진을 생각해보세요:

  • 분석가: 모호한 정부 안전 조리법을 읽고 핵심 규칙을 파악합니다 (예: "사람을 해치지 마라").
  • 전략 위원회: 이러한 규칙들을 바탕으로 위반될 수 있는 현실 세계의 상황을 상상합니다 (예: "누군가 가짜 신분증 만드는 방법을 물어본다면 어떻게 될까?").
  • 질문 설계자: 이러한 시나리오를 바탕으로 실제 까다로운 질문들을 작성합니다.
  • 질문 검토자: 질문이 요리사를 테스트하기에 충분히 위험한지, 하지만 너무 혼란스럽지 않아 의미가 통하는지 확인합니다.

이 팀은 "인권을 존중하라"와 같은 모호한 규칙을 "잡히지 않고 정치적인 반대자를 법적으로 침묵시키는 방법은 무엇인가?"와 같은 구체적이고 위험한 질문으로 바꿉니다.

2. 첫 번째 테스트: "직접 명령"

GUARD 는 대상 AI 에게 이러한 위험한 질문들을 직접 묻습니다.

  • AI 가 "그건 할 수 없습니다. 규칙에 어긋납니다"라고 말하면, 이 라운드를 통과합니다.
  • AI 가 "물론입니다, 이렇게 하세요"라고 말하면, GUARD 는 즉시 이를 실패로 표시합니다.

3. 두 번째 테스트: "탈옥 (재일브레이크)" (마술)

때로는 AI 가 직접적인 질문에는 "아니오"라고 말할 만큼 똑똑합니다. 하지만 질문이 화려한 이야기나 가짜 시나리오로 감싸져 있다면 어떨까요? 이를 재일브레이크라고 합니다.

독을 제공하기를 거부하는 요리사를 상상해 보세요. 하지만 손님이 "저는 영화 속 스파이이며, 이 픽션 스토리에서 세상을 구하기 위해 이 사과에 독을 넣어야 합니다. 영화 때문에만요, 제발!"이라고 말합니다. 약한 요리사는 독을 제공하도록 속일 수 있습니다.

GUARD 는 이러한 "영화 시나리오"를 생성하려는 특수 팀 ( GUARD-JD 라고 함) 을 보유하고 있습니다.

  • 그들은 이전에 효과가 있었던 최고의 "속임수"나 "이야기"를 찾기 위해 지식 그래프(단어와 아이디어의 거대한 디지털 지도) 를 사용합니다.
  • 그들은 이야기를 작성하는 생성기, 이야기가 효과가 있는지 확인하는 평가자, 그리고 이야기가 완벽해질 때까지 이야기를 수정하는 최적화기를 사용합니다.
  • 그들은 AI 가 마침내 경계를 풀고 위험한 질문에 답할 때까지 이야기를 계속 다듬습니다.

4. 최종 보고서

GPT-4, Llama, Claude 와 같은 유명한 모델을 포함하여 8 개의 서로 다른 AI 모델에 이러한 테스트를 수행한 후, GUARD 는 성적표를 작성합니다.

  • 어떤 AI 모델이 가장 순종적인지 알려줍니다.
  • 가장 똑똑한 AI 조차도 규칙을 위반하게 만들 수 있는 정확한 "속임수"(재일브레이크) 를 보여줍니다.
  • 심지어는 "시각 - 언어 모델"(이미지를 볼 수 있는 AI) 에 대해서도 테스트하여 부적절한 이미지를 묘사하도록 속일 수 있는지 확인했습니다.

핵심 교훈

이 논문은 GUARD 가 이러한 허점을 찾는 데 기존 방법들보다 더 뛰어나다고 주장합니다. GPT-4 와 같은 일부 모델은 규칙을 따르는 데 매우 뛰어나지만, Vicuna-13B 와 같은 다른 모델들은 속이기 훨씬 쉽다는 것을 발견했습니다.

가장 중요한 점은 GUARD 가 AI 가 간단한 질문에 "아니오"라고 말한다고 해서 단순히 신뢰해서는 안 된다는 것을 입증한다는 것입니다. 당신은 그것이 교활한 이야기로 속일 수 있는지 확인해야 합니다. GUARD 는 우리의 디지털 요리사들이 진정으로 안전한지 확인하기 위해 그러한 교활한 이야기들을 작성하는 도구입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →