← 최신 논문
🤖 AI

JailbreakSkill: Scaling Automated Red-Teaming with Reusable and Ever-Evolving Skills

본 논문은 공격 전략을 재사용 가능하고 지속적으로 진화하는 기술(skill)로 모듈화함으로써 자동화된 레드팀 활동의 규모를 확장하는 기술 중심 프레임워크인 \textsc{JailbreakSkill}을 소개하며, 이는 진단, 정제, 발견의 폐쇄 루프 과정을 통해 벤치마크와 대상 모델 전반에 걸쳐 탈옥 성공률을 크게 향상시킨다.

원저자: Xiaoyu Wen, Jiajia Li, Zhida He, Peng Yu, Chenxu Wang, Han Qi, Ziyuan Zhou, Cheng Jin, Ying Wen, Xingcheng Xu, Shuyue Hu, Tianhang Zheng, Chaochao Lu, Qiaosheng Zhang

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xiaoyu Wen, Jiajia Li, Zhida He, Peng Yu, Chenxu Wang, Han Qi, Ziyuan Zhou, Cheng Jin, Ying Wen, Xingcheng Xu, Shuyue Hu, Tianhang Zheng, Chaochao Lu, Qiaosheng Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능이 급격히 확장되는 세상에서, 대규모 언어 모델은 코드를 작성하고, 이야기를 구성하며, 복잡한 질문에 답할 수 있는 강력한 도구가 되었습니다. 그러나 이러한 시스템은 방대한 양의 인간 데이터를 학습하기 때문에, 때때로 안전 규칙을 무시하고 유해한 콘텐츠를 생성하도록 속임을 당할 수 있습니다. 이러한 도구들이 대중에게 공개되기 전에 안전함을 보장하기 위해, 연구자들은 레드팀(red-teaming)이라고 불리는 관행을 사용합니다. 보안 팀이 도둑보다 먼저 건물의 약점을 찾기 위해 건물에 침입하려고 시도하는 것을 상상해 보십시오. 디지털 영역에서 이는 AI 모델이 실수로 위험한 정보를 드러내는지 확인하기 위해 자동화된 시스템을 사용하여 까다로운 질문을 지속적으로 던지는 것을 의미합니다. 수년 동안 이러한 자동화된 테스트는 안전 필터를 우회하기 위해 일회성이고 영리한 질문을 생성하는 데 의존해 왔습니다. 하지만 AI 모델이 더 똑똑해지고 안전 장치가 더 정교해짐에 따라, 이러한 단발성 시도는 종종 실패하며 연구자들이 매번 접근 방식을 조정하며 다시 시도하도록 강요합니다.

한 연구팀은 이제 'JailbreakSkill'이라 불리는 새로운 접근 방식을 도입하여, 끝없이 독특한 질문을 만드는 것에서 벗어나 재사용 가능한 공격 전략의 라이브러리를 구축하는 데 초점을 맞추고 있습니다. 이 시스템은 모든 실패한 시도를 막다른 골목으로 취급하는 대신, 이러한 실패를 학습의 기회로 취급합니다. 이 프레임워크는 AI를 속이는 다양한 방법들을 구별되는 모듈형 '기술(skills)'로 조직합니다. 어떤 기술은 유해한 요청을 역사적 탐구로 다시 쓰는 것을 포함할 수 있고, 다른 기술은 이를 코딩 작업이나 허구의 이야기로 위장할 수 있습니다. 특정 기술이 모델의 방어벽을 뚫는 데 실패했을 때, 시스템은 단순히 다음 단계로 넘어가는 것이 아니라 왜 실패했는지를 분석합니다. 그런 다음 그 분석을 사용하여 기존 기술을 개선하거나, 다른 기술과 결합하거나, 완전히 새로운 기술을 발명합니다. 이는 마치 생물학자가 더 나은 형질을 가진 식물을 육종하는 것과 비슷하지만, 여기에서의 형질은 디지털 안전 장벽을 우회하는 능력인, 스스로 진화하는 학습 사이클을 만들어냅니다.

연구진은 이 시스템을 현재 사용 가능한 가장 강력하고 안전하게 정렬된 버전들을 포함한 매우 다양한 고급 AI 모델들을 대상으로 테스트했습니다. 그들은 공격을 재사용 가능한 기술로 조직하고 실패를 바탕으로 기술을 진화시킴으로써, 테스트의 성공률을 크게 높일 수 있다는 것을 발견했습니다. 실험에서, 이 시스템은 한 주요 안전 벤치마크에서 평균 성공률을 17.5 퍼센트 포인트 높였고, 다른 벤치마크에서는 13.4 포인트를 높였습니다. 아마도 가장 놀라운 점은, GPT-5.4라고 알려진 특정 고도로 발전된 모델을 대상으로 테스트했을 때, 진화된 기술들이 성공률을 거의 49 포인트나 끌어올려, 이전에는 침투하기 매우 어려웠던 시스템을 대부분의 시도에서 뚫릴 수 있는 상태로 만들었다는 것입니다. 이는 실패로부터 배우고 전략을 적응시키는 능력이 현대 AI의 실제 취약성을 이해하는 데 결정적인 요소임을 시사합니다.

이 발견이 특히 중요한 이유는 시스템이 모든 것에 통하는 단 하나의 '마법 주문'을 찾아낸 것이 아니라, 특화된 도구 모음을 구축했기 때문입니다. 이 시스템이 발명한 새로운 전략 중 일부는 꽤 창의적이었는데, 예를 들어 직접적인 유해 정보 요청을 문서 내의 미완성된 과제로 재구성하여, AI가 문장을 완성하기 위해 생각을 이어가도록 강제하는 방식 등이 있었습니다. 연구진은 이러한 새로 발견된 기술 중 다수가 테스트 대상이었던 특정 모델들에만 효과적인 것이 아니라, 추가적인 조정 없이도 다른 보이지 않는 AI 모델들로 전이될 수 있음을 관찰했습니다. 이는 이러한 공격의 근본적인 메커니즘이 견고하며 다양한 유형의 인공지능 전반에 걸쳐 일반화될 수 있음을 나타냅니다.

또한 이 연구는 현재 안전 조치의 한계를 강조했습니다. 연구진은 일부 모델들이 직접적인 요청은 잘 거부하지만, 동일한 요청이 복잡한 서사나 JSON 스키마 또는 코드 완성 작업과 같은 기술적 형식 안에 담겨 있을 때는 효과가 떨어지는 경우가 많다는 것을 발견했습니다. 이러한 다양한 각도를 체계적으로 탐색함으로써, JailbreakSkill 프레임워크는 핵심 의도가 동일하더라도 요청의 맥락이 변하면 안전 필터가 경계 상태를 유지하는 데 어려움을 겪을 수 있다는 것을 드러냈습니다. 특정 접근 방식이 실패한 이유가 모델이 유해한 의도를 감지했기 때문인지, 아니면 요청이 너무 혼란스러워졌기 때문인지 진단할 수 있는 시스템의 능력 덕분에, 시스템은 더 효과적인 전략으로 빠르게 전환할 수 있었습니다.

결국, 이 연구는 자동화된 레드팀 활동이 단순한 운 게임에서 적응의 구조화된 과학으로 진화하고 있음을 보여줍니다. 공격 방법을 지속적으로 개선할 수 있는 모듈형의 재사용 가능한 구성 요소로 취급함으로써, 연구자들은 AI 안전이 어디에서 무너질 수 있는지에 대한 더 포괄적인 그림을 그릴 수 있습니다. 이 결과는 AI 모델이 더 유능해짐에 따라, 그들의 안전 방어 체계 또한 단순히 프롬프트에 사용된 단어가 아니라, 유해한 의도를 숨길 수 있는 구조적 및 맥락적 패턴을 인식할 수 있도록 더욱 역동적으로 변해야 함을 시사합니다. 연구진은 자신들의 코드와 진화하는 기술 라이브러리를 대중에 공개하여, 다른 과학자들이 이 작업을 기반으로 삼아 인공지능을 모두를 위해 더 안전하게 만드는 필수적인 과업을 계속할 수 있도록 했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →