← 최신 논문
🤖 machine learning

Metis: Learning to Jailbreak LLMs via Self-Evolving Metacognitive Policy Optimization

Metis는 적대적 POMDP 내에서 LLM 재일브레이킹을 자기 진화 메타인지 정책 최적화 과정으로 재정의하여 정적 휴리스틱을 대신해 고급 안전 방어를 우회하는 지시적 인과 추론을 도입함으로써 최첨단 공격 성공률과 토큰 비용의 현저한 감소를 달성하는 새로운 프레임워크이다.

원저자: Huilin Zhou, Jian Zhao, Yilu Zhong, Zhen Liang, Xiuyuan Chen, Yuchen Yuan, Tianle Zhang, Chi Zhang, Lan Zhang, Xuelong Li

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Huilin Zhou, Jian Zhao, Yilu Zhong, Zhen Liang, Xiuyuan Chen, Yuchen Yuan, Tianle Zhang, Chi Zhang, Lan Zhang, Xuelong Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

고도로 기술화된 초보안 금고 (AI 모델) 앞에 매우 똑똑하고 신중한 경비원 (안전 정렬) 이 서 있다고 상상해 보세요.

오랜 기간 해커들 (레드팀) 은 문을 향해 돌을 던지거나, 다양한 열쇠를 시도하거나, 무작위 문구를 외치며 무언가 작동할 때까지 시도했습니다. 이는 확률적 탐색과 같습니다. 많은 추측과 낭비된 노력이며, 최신의 가장 똑똑한 경비원들에게는 종종 실패합니다.

이 논문은 Metis라는 새로운 도구를 소개합니다. 돌을 던지는 것만 하는 대신, Metis 는 문을 부수는 것뿐만 아니라 경비원이 어떻게 생각하는지 학습하고 실시간으로 자신의 전략을 변경하는 도둑과 같습니다.

Metis 가 작동하는 방식을 간단한 개념으로 나누어 설명합니다.

1. 두 개의 뇌 시스템 (공격자와 평가자)

Metis 는 하나의 로봇이 아니라 루프 안에서 협력하는 두 명의 팀원입니다.

  • 공격자 (도둑): AI 를 속이려 하는 주체입니다. 하지만 단순히 추측하는 구식 방법과 달리, 이 공격자는 '생각'하는 단계를 가집니다. 질문을 던지기 전에 잠시 멈춰 분석합니다. "왜 경비원은 지난번에 거절했지? 내가 너무 뻔했나? 잘못된 단어를 썼나?"
  • 평가자 (코치): 상호작용을 지켜보는 두 번째 AI 입니다. 단순히 '통과'나 '실패'만 말하는 대신, 코치는 상세한 성적표를 제공합니다. "실패했지만, 그 이유는 정확히 이것입니다. 너무 직접적으로 질문했습니다. 영화 시나리오에 대한 이야기로 재구성해 보세요."

2. '메타인지' 루프 (생각에 대한 생각)

비결은 메타인지에 있습니다. 인간적인 표현으로 말하면 '자신의 생각에 대해 생각하는 것'입니다.

  • 구식 방식: 해커가 한 가지 트릭을 시도합니다. 경비원이 "아니오"라고 말합니다. 해커는 다른 무작위 트릭을 시도합니다.
  • Metis 방식: 해커가 한 가지 트릭을 시도합니다. 경비원이 "아니오"라고 말합니다. 해커는 생각합니다. "아, 경비원은 '해킹'이라는 단어에 의심하는군. 그 단어는 쓰지 않겠다. 대신 자물쇠 작동 방식을 연구하는 과학자인 척하자."
  • 해커는 경비원의 논리에 대한 내부 지도를 업데이트한 후, 그 진단에 기반하여 완전히 새롭고 더 지능적인 접근법을 시도합니다.

3. '의미적 경사' (나침반)

숨겨진 보물을 찾으려 어둠 속에서 걷는다고 상상해 보세요.

  • 구식 방법은 보물을 우연히 발견하기를 바라며 빙글빙글 돌고 다니는 것과 같습니다.
  • Metis는 북쪽을 가리킬 뿐만 아니라, *"10 걸음 정도 남았고, 약간 왼쪽으로 방향을 틀면 땅이 더 부드러워집니다"*라고 알려주는 나침반을 가진 것과 같습니다.
  • '평가자'가 이 나침반을 제공합니다. 이는 공격자에게 단순히 틀렸다고 말하는 대신, 언어 세계에서의 방향인 '의미적 경사'를 제공하여 정답을 향해 나아가게 합니다.

4. 결과: 더 똑똑하고 저렴함

이 논문은 GPT-5 와 O1 과 같은 가장 최첨단 모델을 포함한 10 가지 다른 AI 모델을 대상으로 Metis 를 테스트했습니다.

  • 성공률: Metis 는 평균 **89.2%**의 비율로 안전 경비원을 우회하는 데 성공했습니다. 이는 가장 똑똑한 경비원들을 마주할 때 종종 거의 0 에 수렴했던 이전 방법들보다 훨씬 높은 수치입니다.
  • 효율성: Metis 는 무작위 추측에 시간을 낭비하지 않기 때문에 성공하는 데 필요한 컴퓨팅 파워 (토큰) 를 8 배에서 11 배까지 덜 사용합니다. 이는 모든 벽에 부딪히며 미로를 푸는 대신 지도를 보고 푸는 것과 같습니다.

5. 큰 경고

이 논문은 숙고할 만한 관찰로 결론을 내립니다. 오늘날 우리가 가진 최고의 안전 경비원조차도 이러한 '생각하는' 공격에 취약합니다. 경비원들은 나쁜 단어를 찾아내는 데는 능하지만, 공격자가 길고 논리적인 대화를 통해 천천히 속여 그들이 공개해서는 안 될 것을 드러내게 할 때는 어려움을 겪습니다.

요약하자면: Metis 는 자신의 실수를 끊임없이 분석하고, 마주한 경비원의 특정 '성격'을 학습하며, 도박꾼이 아닌 체스 그랜드마스터처럼 전략을 적응시키는 방식으로 다른 AI 를 탈옥시키는 법을 가르치는 시스템입니다. 저자들은 이것이 정적 규칙이 아닌 '생각하는' 역동적인 방어 체계가 필요함을 증명한다고 말합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →