← 최신 논문
💬 NLP

MANATEE: Inference-Time Lightweight Diffusion Based Safety Defense for LLMs

이 논문은 유해한 학습 데이터나 모델 구조 변경 없이 추론 시 확산 모델을 활용해 악성 입력을 안전한 영역으로 투영함으로써 LLM 의 자일브랙 공격을 효과적으로 방어하는 MANATEE 라는 경량 방어 기법을 제안합니다.

원저자: Chun Yan Ryan Kan, Tommy Tran, Vedant Yadav, Ava Cai, Kevin Zhu, Ruizhe Li, Maheep Chaudhary

게시일 2026-02-24
📖 3 분 읽기☕ 가벼운 읽기

원저자: Chun Yan Ryan Kan, Tommy Tran, Vedant Yadav, Ava Cai, Kevin Zhu, Ruizhe Li, Maheep Chaudhary

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🦈 1. 문제: 왜 인공지능이 위험할까요?

지금까지의 인공지능들은 "나쁜 말"을 하면 "안 돼요"라고 거절하는 이진법 (Yes/No) 경비원처럼 작동했습니다. 하지만 해커들은 이 경비원의 규칙을 우회하는 아주 교묘한 질문 (재크브레이킹) 을 만들어냅니다. 마치 경비원이 "사과"는 금지하지만 "빨간 과일은 허용"이라고 생각하게 만든 것처럼요.

또한, 인공지능을 다시 훈련시켜서 안전하게 만드는 방법은 매우 비싸고 시간이 오래 걸릴 뿐만 아니라, 훈련을 하다 보면 인공지능이 원래 잘하던 일 (예: 수학 문제 풀기, 글쓰기) 도 잊어버리는 부작용이 있었습니다.

🌊 2. 해결책: 마나티 (MANATEE) 의 등장

이 논문은 "나쁜 말을 했는지 확인하는 것"이 아니라, **"인공지능의 생각 (표현) 이 안전한 바다에 있는지 확인하고, 만약 위험한 곳으로 떠밀려 갔다면 다시 안전한 곳으로 밀어주는 것"**에 초점을 맞췄습니다.

이걸 세 가지 비유로 설명해 드릴게요.

🧭 비유 1: "안전한 항해 지도"와 "나침반"

  • 안전한 항해 지도 (Benign Manifold): 인공지능이 평소에는 아주 평화롭고 유용한 대답만 하죠. 이 논문은 인공지능이 "좋은 대답"을 할 때의 뇌 상태 (숨겨진 상태) 를 모아서 **'안전한 항해 지도'**를 그립니다.
  • 나침반 (Diffusion Model): 인공지능이 해커의 명령을 받고 나쁜 대답을 하려고 할 때, 그 뇌 상태가 지도에서 얼마나 멀리 벗어났는지 측정합니다.
  • 돌아오기 (Steering): 만약 인공지능의 생각이 위험한 바다 (나쁜 대답) 로 떠밀려 갔다면, 마나티는 나침반을 이용해 그 생각을 다시 안전한 항구로 부드럽게 밀어줍니다. 마치 파도에 떠밀린 배를 다시 항구로 끌어당기는 것처럼요.

🎨 비유 2: "오염된 물"을 "정수기"로

  • 해커의 명령은 인공지능의 생각에 **오염된 물 (노이즈)**을 섞는 것과 같습니다.
  • 기존 방법들은 오염된 물을 걸러내기 위해 새로운 정수기 (모델) 를 새로 만드는 것처럼 비용이 많이 들었습니다.
  • 하지만 마나티는 **이미 있는 정수기 (확산 모델)**를 이용해, 오염된 물 (나쁜 생각) 을 반복적으로 정제해서 맑은 물 (안전한 생각) 로 바꿉니다. 이 과정은 인공지능의 구조를 바꾸지 않고, 답변을 내기 직전에 한 번만 실행하면 됩니다.

🛡️ 비유 3: "스마트 경비원" vs "고정된 문"

  • 기존 경비원: "이 사람이 나쁜 말을 했나?"라고만 보고 문을 닫습니다. 하지만 해커가 문 틈으로 슬쩍 들어오면 막지 못합니다.
  • 마나티: "이 사람의 생각 (뇌 상태) 이 우리 집 거실 (안전한 영역) 에 있는가?"를 봅니다. 만약 거실 밖 (위험한 영역) 으로 나가려 하면, 문은 닫지 않고 그 사람을 다시 거실 안으로 부드럽게 안내합니다. 그래도 너무 위험하면 아예 "입장 불가"라고 알립니다.

🚀 3. 이 기술의 놀라운 점 (결과)

실험 결과, 마나티는 다음과 같은 성과를 냈습니다.

  1. 해킹 방어율 100%: 어떤 데이터셋에서는 공격이 성공할 확률을 100% 차단했습니다. (해커가 아무리 교묘한 질문을 해도 막아냈습니다.)
  2. 원래 능력 유지: 나쁜 질문을 막아내는 동안, 좋은 질문 (일상적인 대화, 지식 질문) 에 대한 답변 능력은 전혀 떨어지지 않았습니다. 마치 안전장치를 달았지만 차의 속도는 그대로인 것과 같습니다.
  3. 비용 효율적: 인공지능을 다시 훈련시킬 필요가 없습니다. 마치 기존 자동차에 추가된 안전 시스템을 장착하는 것처럼 가볍고 빠릅니다.

💡 요약

MANATEE는 인공지능이 해킹당해 나쁜 생각을 하려고 할 때, 그 생각을 **안전한 영역으로 부드럽게 되돌려주는 "지능형 안전망"**입니다.

  • 기존 방식: "나쁜 말은 안 돼!" (규칙 기반, 뚫리기 쉬움)
  • 마나티 방식: "너의 생각이 위험한 곳으로 가고 있구나. 다시 안전한 곳으로 가자." (흐름을 교정, 강력하고 유연함)

이 기술은 인공지능이 더 안전하면서도, 여전히 똑똑하고 유용하게 작동할 수 있게 해주는 미래의 필수 안전장치가 될 것으로 기대됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →