← 최신 논문
💬 NLP

SEMA: Simple yet Effective Learning for Multi-Turn Jailbreak Attacks

SEMA는 외부 데이터 없이 멀티턴 탈옥 공격자를 훈련하기 위해 사전 채워진 미세 조정(prefilled fine-tuning)과 의도 드리프트 인식 강화 학습(intent-drift-aware reinforcement learning)을 사용하는 단순하고 자기 튜닝이 가능한 프레임워크로, 최첨단의 공격 성공률을 달면서 LLM 안전성에 대한 강력하고 재현 가능한 스트레스 테스트를 제공한다.

원저자: Mingqian Feng, Xiaodong Liu, Weiwei Yang, Jialin Song, Xuekai Zhu, Chenliang Xu, Jianfeng Gao

게시일 2026-08-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mingqian Feng, Xiaodong Liu, Weiwei Yang, Jialin Song, Xuekai Zhu, Chenliang Xu, Jianfeng Gao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하고 매우 예의 바른 로봇 친구와 대화하고 있다고 상상해 보세요. 당신은 이 로봇에게 "절대로 누군가가 위험하거나 못된 일을 하는 것을 돕지 마라"라는 엄격한 규칙을 가르쳤습니다. 보통, 만약 당신이 자동차를 훔치는 방법에 대한 가이드를 써달라고 요청한다면, 로봇은 정중하게 "그것은 할 수 없습니다"라고 말할 것입니다. 하지만 만약 한 번에 다 묻지 않는다면 어떨까요? 만약 당신이 길고 구불구불한 대화의 게임을 펼친다면 어떨까요? 당신은 자동차의 역사에 대해 묻는 것으로 시작해서, 엔진이 어떻게 작동하는지로 넘어가고, 보안 시스템에 대해 묻는 식으로, 아주 많은 차례에 걸쳐 서서히 로봇이 규칙을 잊어버리고 자동차 절도 가이드를 내놓도록 속일 수도 있습니다. 이것이 바로 "멀티턴 탈옥(multi-turn jailbreaks)"의 세계입니다. 이것은 우리의 AI 안전 가드들이 단순히 하나의 무례한 질문뿐만 아니라, 영리하고 끈기 있는 대화를 처리할 수 있을 만큼 충분히 강한지를 테스트하는 방법입니다. 과학자들이 이 분야에 관심을 갖는 이유는 실제 세상의 챗봇들은 질문 하나에 답하고 멈추는 것이 아니라, 우리와 몇 시간 동안 대화를 나누기 때문입니다. 만약 로봇이 긴 대화 중에 속을 수 있다면, 그것은 빠른 테스트에서는 안전해 보일지라도 실제 세상에서는 안전하지 않을 수 있습니다.

여기에 변장의 명수이자 인내심의 달인처럼 행동하는 새로운 방법인 SEMA가 등장합니다. 이 논문의 연구자들은 사람이 직접 스크립트를 쓰거나 미리 만들어진 기술 라이브러리를 필요로 하지 않으면서도, 길고 까다로운 대화를 나누는 법을 배울 수 있는 AI 공격자를 구축하고자 했습니다. 그들은 기존의 많은 방법이 마치 딱딱한 대본을 읽는 배우와 같아서, 만약 로봇 친구가 주제를 약간만 바꿔도 배우가 혼란에 빠지거나 지루하고 안전한 대화로 흘러가 버린다는 것을 발견했습니다. 그러나 SEMA는 다릅니다. SEMA는 "단순하면서도 효과적인" 학습기로서, 백 가지의 무해해 보이는 방식으로 같은 질문을 던지면서도 대화가 위험한 목표에 집중되도록 유지하는 법을 알아냅니다.

SEMA의 비결은 두 단계의 훈련 과정에 있습니다. 첫째, 그들은 **"프리필링 셀프 튜닝(prefilling self-tuning)"**이라는 기술을 사용합니다. 이는 마치 수줍음 많은 학생에게 목소리를 높이라고 가르치려는데, 학생이 입을 열 때마다 "할 수 없습니다"라고 말하는 상황과 같습니다. 연구자들은 문장 맨 처음에 아주 작고 무섭지 않은 신호(예를 들어 목록에 "1."이라고 적는 것)를 줌으로써 이 문제를 해결했습니다. 이 작은 넛지는 AI가 단지 목록을 이어 쓰는 중이라고 착각하게 만들어, 거절을 멈추고 일련의 질문들을 생성하기 시작하게 합니다. 이를 통해 AI는 "아니오"라고 말하는 루프에 빠지지 않고, 긴 멀티턴 계획을 만드는 법을 "안전하게" 연습할 수 있습니다.

AI가 대화에 익숙해지면, 두 번째 단계인 "의도 드리프트 인식(Intent-Drift-Aware)" 보상을 활용한 강화 학습이 시작됩니다. 이것은 AI의 긴 대화를 지켜보는 엄격한 코치와 같습니다. 만약 AI가 원래의 위험한 목표(예: 해킹) 대신 안전하고 지루한 것(예: 날씨)에 대해 이야기하기 시작하면, 코치는 낮은 점수를 줍니다. 하지만 만약 AI가 길고 구불구불한 질문의 경로를 통해 위험한 요청을 몰래 집어넣고, 결국 로봇이 원래의 해로운 질문에 답하게 만든다면, 코치는 높은 점수를 줍니다. AI는 단순히 계속 대화를 이어가는 것이 목표가 아니라, 몇 번의 턴이 걸리더라도 올바른 것에 대해 계속 대화를 이어가는 것이 목표임을 배우게 됩니다.

결과는 꽤 인상적입니다. 연구진이 다양한 AI 모델(오픈 소스 모델과 GPT-4와 같은 거대 폐쇄형 모델 모두)을 대상으로 SEMA를 테스트했을 때, SEMA는 거의 모든 다른 방법들을 능가했습니다. 표준 테스트인 AdvBench에서 SEMA는 평균 **80.1%의 공격 성공률(ASR)**을 달eli 성과를 냈는데, 이는 이전의 최고 방법들보다 약 33.9% 더 높은 수치입니다. SEMA는 단 한 종류의 로봇에서만 작동한 것이 아니라 다양한 로봇에서 작동하며 그 전략의 유연성과 강력함을 보여주었습니다. 더욱 중요한 점은, SEMA가 다음 수를 계획하기 위해 피해 로봇의 답변에 의존할 필요 없이 이 일을 해냈다는 것입니다. SEMA는 단계별로 반응하는 것이 아니라, 마치 열 수 앞을 내다보는 체스 선수처럼 전체 대화를 한 번에 계획했습니다.

이 논문은 이러한 접근 방식이 AI 안전성을 스트레스 테스트하는 훨씬 더 나은 방법임을 시사합니다. 단순히 로봇이 하나의 나쁜 질문을 거절하는지 확인하는 대신, S一名은 로봇이 길고 영리한 대화 후에 어떻게 실패할 수 있는지를 보여줍니다. 저자들은 이것이 로봇에게 나쁜 것을 가르치려는 것이 아니라, 그 결함들을 찾아내어 고칠 수 있도록 갑옷의 틈을 찾는 과정임을 강조합니다. 거대한 데이터셋이나 인간의 스크립트에 의존하지 않고 재현 가능한 단순한 방법을 사용함으로써, SEMA는 우리의 AI 안전성이 어디에서 실패하고 있는지에 대한 더 명확하고 현실적인 그림을 제공합니다. 이는 AI의 세계에서 가장 위험한 공격은 가장 큰 소리를 내는 공격이 아니라, 답이 바뀔 때까지 "한 번만 더요?"라고 조용히, 끈기 있게 계속 묻는 공격일 수 있음을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →