← 최신 논문
💻 computer science

Steering Beyond the Support: Adversarial Training on Unsupervised Jailbroken Activation Simulation

본 논문은 비지도 잠재 방향 발견을 활용하여 다양한 적대적 활성화를 시뮬레이션하고, 잠재적으로 유도된 조향 장을 훈련시켜 미지의 제일브레이크를 거부 방향으로 효과적으로 유도하면서도 정상적인 유용성을 유지하는 제로샷 Jailbreak 방어 프레임워크를 제안합니다.

원저자: Luoyu Chen, Weiqi Wang, Zhiyi Tian, Chenhan Zhang, Feng Wu, Jianhuan Huang, Ahmed Asiri, Shui Yu

게시일 2026-05-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Luoyu Chen, Weiqi Wang, Zhiyi Tian, Chenhan Zhang, Feng Wu, Jianhuan Huang, Ahmed Asiri, Shui Yu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"Steering Beyond the Support" 논문에 대한 설명을 쉬운 언어와 창의적인 비유로 풀어보겠습니다.

큰 문제: "학습 데이터" 함정

상상해 보세요. 매우 똑똑한 경비원 (AI) 을 박물관에 고용하여 보호하게 했습니다. 경비원에게 100 가지 특정 유형의 도둑 사진이 담긴 앨범을 보여가며 훈련시켰습니다. 빨간 모자를 쓴 도둑, 가짜 수염을 한 도둑, 그리고 쇠지레를 든 도둑이 그들입니다.

경비원은 이 100 가지 특정 도둑들을 완벽하게 찾아내는 법을 배웠습니다. 하지만 파란 모자를 쓰고 레이저 커터를 들고 온 새로운 도둑이 나타났습니다. 경비원은 '빨간 모자'와 '쇠지레' 사진만으로 훈련받았기 때문에 새로운 위협을 알아차리지 못하고 그들을 들여보냅니다.

AI 세계에서는 이를 자일브레이크 (jailbreak) 문제라고 부릅니다.

  • 경비원: 도움이 되지만 안전하도록 훈련된 대규모 언어 모델 (AI).
  • 도둑들: AI 를 속여 해로운 말을 하도록 만드는 '자일브레이크' 프롬프트.
  • 함정: 이전의 안전 장치는 우리 경비원과 같았습니다. 알려진 자일브레이크 목록이라는 정적이고 제한된 리스트로 훈련되었습니다. 해커가 훈련 목록에 없는 새로운 방식으로 AI 를 속이게 되면, 구식 안전 장치는 실패합니다.

구식 해결책 vs 새로운 아이디어

구식 방법 (지도 학습 기반 조종):
이전 연구자들은 AI 에게 단일한 '거부 벡터'를 가르쳐 이를 해결하려 했습니다. 이는 경비원에게 '해로운' 구역으로부터 모든 것을 밀어내는 거대한 자석을 주는 것과 같습니다.

  • 결함: 너무 거칠다는 점입니다. 모든 것을 밀어내면 수프 레시피를 요청하는 것과 같은 도움이 되는 요청까지 실수로 밀어낼 수 있습니다. 또한, 훈련된 특정 도둑들에게만 잘 작동합니다.

새로운 방법 (이 논문의 해결책):
저자들은 비지도 학습 자일브레이크 활성화 시뮬레이션에 대한 적대적 학습이라는 더 지능적이고 유연한 접근법을 제안합니다. 입에 붙기 힘든 용어이므로 비유를 통해 풀어보겠습니다.

비유: "꿈 시뮬레이터"와 "유연한 힘의 장"

새로운 도둑들이 나타나기를 기다리는 대신, 저자들은 AI 의 뇌 안에 꿈 시뮬레이터를 구축했습니다.

  1. 꿈 시뮬레이터 (비지도 잠재 방향 발견):
    AI 는 '거부'가 무엇인지 ( "그건 할 수 없습니다"라고 말하는 것) 알고 있습니다. 연구자들은 그 거부 상태를 수학적으로 '늘리는' 방법을 찾았습니다. '거부'를 나타내는 고무줄을 임의의 방향으로 늘려본다고 상상해 보세요.

    • 놀랍게도, 이를 충분히 멀리 늘리면 '자일브레이크' 상태 (AI 가 나쁜 일을 하기로 동의하는 상태) 로 변합니다.
    • AI 는 실제 나쁜 자일브레이크 예시가 전혀 필요 없이 이를 수행합니다. AI 는 자신의 내부 논리를 비틀기만 해도 수천 개의 새로운 가짜 자일브레이크 시나리오를 꿈꾸어 만들어냅니다.
  2. 유연한 힘의 장 (잠재 함수):
    단일한 자석 대신, 연구자들은 AI 에게 동적인 힘의 장을 가르칩니다.

    • 좋은 요청의 경우: 힘의 장은 보이지 않습니다. 시를 요청하거나 수학 도움을 구하면 AI 는 아무런 저항 없이 이 장을 통과합니다. (이는 AI 의 유용성을 유지합니다.)
    • 나쁜 요청의 경우: 힘의 장은 두껍고 끈적한 진흙이 됩니다. AI 가 해로운 답변을 생각하기 시작하자마자, 이 장은 AI 를 강력하게 '거부' 구역으로 밀어냅니다.

훈련 방법: "내부와 외부" 루프

훈련 과정은 동시에 진행되는 두 단계가 있는 비디오 게임과 같습니다.

  • 레벨 1 (내부 단계 - 공격자):
    AI 는 자신의 안전 규칙을 깨려고 시도합니다. '꿈 시뮬레이터'를 사용하여 생각할 수 있는 가장 어려운 가짜 자일브레이크를 생성합니다. 마치 벽에 구멍을 찾으려는 해커와 같습니다.
  • 레벨 2 (외부 단계 - 수비수):
    AI 는 그런 특정 구멍을 막기 위해 '힘의 장'을 업데이트합니다. 가짜 자일브레이크들을 '거부'로 밀어내면서도, 벽이 '좋은' 요청들을 막지 않도록 학습합니다.

이 루프를 수천 번 반복합니다. '공격자'는 새로운 구멍을 찾는 법을 더 똑똑하게 배우고, '수비수'는 그 구멍을 막는 법을 더 잘하게 됩니다. 공격자가 즉석에서 새로운 시나리오를 만들어내기 때문에, 수비수는 원래 훈련 목록에 있던 것뿐만 아니라 모든 유형의 자일브레이크를 처리하는 법을 배우게 됩니다.

결과: 더 강하고 똑똑한 경비원

이 논문은 세 가지 다른 AI 모델과 여섯 가지 다른 자일브레이크 공격 계열에서 이를 테스트했습니다.

  • 점수: 새로운 방법은 95% 이상의 공격을 차단했습니다 ('공격 성공률'을 5% 미만으로 유지).
  • 보너스: 구식인 '거대한 자석' 방법과 달리, 이 새로운 힘의 장은 AI 가 정상적인 질문에 답하는 것을 거부하게 만들지 않았습니다. AI 를 유용하고 똑똑하게 유지했습니다.
  • 증거: 연구자들은 훈련이 진행됨에 따라 '꿈 시뮬레이터'가 점점 더 많은 '자일브레이크 영역'을 커버하여, 아직 존재하지 않던 위협들까지 포함한 잠재적 위협의 전체 지형을 효과적으로 매핑해냈음을 보여주었습니다.

요약

간단히 말해, 이 논문은 AI 가 최악의 시나리오를 스스로 상상하도록 가르치고, 이를 막기 위한 맞춤형 유연한 방패를 구축함으로써 AI 안전 문제를 해결합니다. 나쁜 사람 목록을 외우는 대신, AI 는 나쁜 행동의 형태를 학습하여 새롭고 보이지 않는 속임수들을 즉시 인식하고 차단할 수 있게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →