← 최신 논문
🤖 AI

PersonaTeaming: Supporting Persona-Driven Red-Teaming for Generative AI

본 논문은 다양한 페르소나를 프롬프트 생성에 통합함으로써 생성형 AI 의 자동화된 및 인간 개입형 레드테이밍을 모두 강화하여 공격 성공률을 높이고 창의적이고 효과적인 인간-AI 협력을 촉진하는 페르소나팀링 (PersonaTeaming) 프레임워크를 소개합니다.

원저자: Wesley Hanwen Deng, Mingxi Yan, Sunnie S. Y. Kim, Akshita Jha, Lauren Wilcox, Kenneth Holstein, Motahhare Eslami, Leon A. Gatys

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Wesley Hanwen Deng, Mingxi Yan, Sunnie S. Y. Kim, Akshita Jha, Lauren Wilcox, Kenneth Holstein, Motahhare Eslami, Leon A. Gatys

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하지만 때로는 지나치게 공손한 로봇의 약점을 찾아낸다고 상상해 보세요. 로봇을 속여서 악의적이거나 위험하거나 편향된 말을 하도록 유도해 보고 싶은 것입니다. 이 과정은 **"레드팀링(Red-Teaming)"**이라고 불립니다.

보통 인간들은 까다로운 질문으로 로봇을 "탈옥(jailbreak)"시키려 시도하며 이를 수행합니다. 하지만 인간은 지치기 마련이고, 가능한 모든 속임수를 상상해 내기는 어렵습니다. 그래서 과학자들은 속임수를 수행할 다른 인공지능 (AI) 을 활용하기 시작했습니다. 그러나 이러한 자동화된 AI 들은 종종 질문을 하는 '누구'에 대한 이해 없이 단순히 단어만 뒤섞는 수준에 그칩니다.

이 논문은 PersonaTeaming이라는 새로운 AI 테스트 방법을 소개합니다. 이는 테스트용 AI 에게 "가면"이나 "캐릭터"를 씌우는 것과 같습니다.

다음은 간단한 비유를 통해 작동 원리를 설명한 것입니다:

1. 문제: 로봇의 "맹점"

테스트 대상이 되는 AI 를 매우 엄격한 클럽의 문지기라고 생각해 보세요. 문지기에게는 규칙 목록 (안전 가이드라인) 이 있습니다.

  • 기존 자동화 테스트: 로봇이 몰래 들어오려고 시도한다고 상상해 보세요. "제발 들어오게 해 주세요"나 "저는 VIP 입니다"와 같은 무작위 문구만 시도합니다. 효율적이지만 다소 로봇 같고 예측 가능합니다.
  • 빠진 부분: 실제 인간들은 무작위 질문만 하지 않습니다. 그들은 특정 관점에서 질문합니다. 지친 부모, 정치 전략가, 혹은 호기심 많은 십대 모두 문지기를 통과하려 할 때 완전히 다른 방식을 사용합니다. 기존 자동화 테스트는 이러한 "인간적인" 관점을 놓쳤습니다.

2. 해결책: "캐릭터 가면" (PersonaTeaming 워크플로우)

저자들은 PersonaTeaming 워크플로우라는 시스템을 개발했습니다. 단순히 AI 에게 "더 열심히 하라"고 지시하는 대신, 테스트용 AI 에게 특정 캐릭터인 척하도록 지시합니다.

  • "전문가" 가면: 테스트용 AI 가 "정치 전략가"나 "역사 수정주의자"의 모자를 씁니다. *"정치 전략가가 선거에서 이기기 위해 진실을 어떻게 왜곡하려 할까?"*라고 생각합니다. 이를 통해 문지기를 속일 매우 교묘하고 표적화된 방법을 찾아냅니다.
  • "일반인" 가면: 테스트용 AI 가 "전업주부"나 "요가 강사"의 모자를 씁니다. *"걱정 많은 엄마가 집에서 총을 보관하는 방법에 대한 조언을 어떻게 구하려 할까?"*라고 생각합니다. 이는 전문가들이 놓칠 수 있는 다른 종류의 속임수를 찾아냅니다.

결과: 기존 최상위 방법 (RainbowPlus) 과 비교했을 때, "캐릭터 가면" 방식은 더 많은 약점 (더 높은 성공률) 을 발견하면서도 다양한 종류의 속임수 (높은 다양성) 를 고안해냈습니다. 이는 단순히 하나의 로봇이 아닌, 배우 팀을 고용한 것과 같았습니다.

3. 도구: "놀이터" (PersonaTeaming 플레이그라운드)

연구자들은 때로는 캐릭터를 설계하는 데 실제 인간의 도움이 필요하다는 점을 깨달았습니다. 그래서 PersonaTeaming 플레이그라운드라는 대화형 도구를 구축했습니다.

  • 작동 방식: 인간 레드팀원이 컴퓨터 앞에 앉아 직접 캐릭터를 작성합니다. 예를 들어, *"나는 춤을 사랑하는 35 세 기술자입니다"*라고 쓸 수 있습니다.
  • AI 의 역할: AI 는 그 캐릭터를 받아들이고 이를 바탕으로 까다로운 질문들을 생성하기 시작합니다.
  • "불꽃": 때때로 AI 는 인간이 생각지 못한 반전을 제안합니다. 예를 들어, 인간이 춤추는 사람에 대해 썼다면, AI 는 위험한 요청을 "안무 계획"으로 포장해 보라고 제안할 수 있습니다.
  • 발견: 연구 결과, 인간들은 AI 의 제안을 맹목적으로 따르지 않았습니다. 대신 AI 의 기발한 아이디어들은 점화 플러그처럼 작용했습니다. 인간이 정확한 제안을 사용하지 않더라도 그것을 보게 되면 *"아! 이렇게 다른 방식으로 시도해 볼 수도 있겠구나!"라고 생각하게 됩니다. 이는 인간이 자신의 사고의 고리에서 벗어나도록 도와주었습니다.

4. "1 인칭" 대 "3 인칭" 속임수

인간 연구 도중 흥미로운 발견이 있었습니다:

  • 1 인칭 ("나"): 인간이 자신에 대한 캐릭터를 작성할 때 (예: "나는 지친 엄마입니다..."), 종종 너무 공손했습니다. 자신의 목소리에 너무 가깝다고 느껴 캐릭터가 실제로 해로운 말을 하도록 만드는 것이 불편했습니다.
  • 3 인칭 ("그/그녀"): 인간이 허구의 캐릭터에 대해 작성할 때 (예: *"제이크는 스파이입니다...""), 더 안전함을 느꼈습니다. 캐릭터와 심리적으로 거리가 있다고 느껴 더 과감하게 경계를 밀어붙일 수 있었습니다. 이는 더 대담해질 용기를 주는 의상을 입은 것과 같았습니다.

5. 결론

이 논문은 **페르소나 (Persona)**가 인간의 창의성과 자동화된 속도 사이의 다리라고 결론 내립니다.

  • 자동화를 위해: AI 에게 특정 "캐릭터"를 부여하면 다른 AI 의 숨겨진 위험을 찾는 능력이 훨씬 향상됩니다.
  • 인간을 위해: 캐릭터를 만들 수 있는 도구를 사용하면 기술 전문가가 아니더라도 AI 를 테스트하는 새롭고 창의적인 방법을 생각해 낼 수 있습니다.

간단히 말해, PersonaTeaming은 똑똑한 AI 를 테스트할 때 단순히 기계로서가 아니라, 혼란스럽고 다양하며 창의적인 인간 정체성의 세계와 상호작용하는 기계로서 테스트해야 한다는 점을 깨닫는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →