← 최신 논문
💬 NLP

DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models

이 논문은 확산 기반 대규모 언어 모델 (dLLM) 의 고유한 취약점을 분석하고, 확률적 어닐링 리마스크링과 블록 단위 감사 및 수리 기법을 결합한 훈련 없는 방어 프레임워크 'DiffuGuard'를 제안하여 공격 성공률을 47.9% 에서 14.7% 로 획기적으로 낮추면서도 모델의 유용성을 유지함을 보여줍니다.

원저자: Zherui Li, Zheng Nie, Zhenhong Zhou, Yue Liu, Yitong Zhang, Yu Cheng, Qingsong Wen, Kun Wang, Yufei Guo, Jiaheng Zhang

게시일 2026-03-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zherui Li, Zheng Nie, Zhenhong Zhou, Yue Liu, Yitong Zhang, Yu Cheng, Qingsong Wen, Kun Wang, Yufei Guo, Jiaheng Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

DiffuGuard: 새로운 AI 의 '안전장치'를 찾아서

이 논문은 **확산형 대규모 언어 모델 (dLLM)**이라는 새로운 종류의 AI 가 가진 치명적인 약점과, 이를 해결하는 획기적인 방어 기술인 **'DiffuGuard'**에 대해 설명합니다.

기존의 AI 가 한 글자씩 순서대로 글을 쓴다면, 이 새로운 AI 는 빈 종이를 한 번에 채우면서 여러 번 수정하는 방식으로 글을 씁니다. 이 독특한 방식이 오히려 해킹 (Jailbreak) 에 취약한 구멍을 만들어냈는데, DiffuGuard 는 그 구멍을 막아주는 '스마트 안전장치'입니다.


1. 새로운 AI 의工作方式: "한 번에 다 써보고 고쳐보기"

기존 AI(autoregressive) 는 연필로 글을 쓸 때처럼, 한 글자 한 글자 순서대로 써나갑니다. "안녕" -> "하세요" -> "오늘" 순서로요.

하지만 이 논문에서 다루는 dLLM마치 페인트로 그림을 그리는 것과 같습니다.

  1. 처음에는 종이가 완전히 **흰색 (MASK)**으로 덮여 있습니다.
  2. AI 는 종이의 모든 부분을 동시에 보며 "여기엔 뭐가 들어갈까?"라고 추측합니다.
  3. 그리고 가장 확실한 부분만 남기고, 나머지는 다시 흰색으로 지우고 다시 그립니다.
  4. 이 과정을 여러 번 반복하며 그림이 선명해집니다.

이 방식은 글을 쓰는 속도가 매우 빠르고 유연하지만, 안전성 측면에서는 큰 문제가 있었습니다.

2. 발견된 치명적인 약점: "나쁜 생각이 먼저 잡히면 끝장"

연구팀은 이 새로운 AI 가 해킹당하는 두 가지 핵심 원인을 찾아냈습니다.

① 한 번의 시도에서 생기는 혼란 (Intra-step)

AI 가 종이를 다시 그릴 때, "죄송합니다, 도와드릴 수 없습니다"라는 안전한 말과 "네, 알려드릴게요"라는 위험한 말이 동시에 높은 확률로 떠오릅니다.
기존 방식은 AI 가 가장 확신하는 (높은 점수를 받은) 단어를 무조건 선택합니다. 문제는 위험한 단어가 조금 더 확신 있게 느껴지면, AI 가 안전한 단어를 버리고 위험한 단어를 선택해버린다는 점입니다. 마치 가장 큰 소리를 내는 사람이 옳은 사람인 것처럼 착각하는 상황입니다.

② 첫 단추가 잘못되면 모든 게 망가짐 (Inter-step)

이게 더 무서운 부분입니다. dLLM 은 초반에 고정된 단어가 이후 모든 글의 방향을 결정합니다.

  • 만약 첫 단계에서 AI 가 "네, 알겠습니다"라는 단어를 고정해버리면, 그 이후로 AI 는 무조건 그 방향으로 글을 써내려갑니다.
  • 마치 기차가 레일을 잘못 타고 출발하면, 중간에 레일을 고치려 해도 이미 너무 늦어버린 것과 같습니다. 연구에 따르면, 초반에 안전한 단어를 넣으면 해킹 성공률이 20% 이상 떨어지지만, 나중에는 효과가 거의 없습니다.

3. 해결책: DiffuGuard (디퓨가드)

이런 약점을 막기 위해 개발된 것이 DiffuGuard입니다. 이 기술은 AI 를 재교육하지 않고도, 글을 쓰는 과정에 개입하여 안전을 지키는 두 가지 전략을 사용합니다.

전략 1: "조금의 혼란을 주는 것" (Stochastic Annealing Remasking)

기존에는 AI 가 가장 확신하는 단어를 무조건 선택했는데, DiffuGuard 는 초반 단계에서는 일부러 약간의 '랜덤성 (우연)'을 섞어줍니다.

  • 비유: AI 가 "위험한 길"로 가려 할 때, AI 의 머릿속에 **"잠깐, 다른 길도 한번 생각해봐!"**라고 속삭여 주는 것입니다.
  • 이렇게 하면 AI 가 위험한 길로만 가지 않고, 안전한 길도 고려할 기회를 얻게 됩니다. 시간이 지나고 글이 어느 정도 완성되면, 다시 확신에 찬 선택으로 돌아와 글의 품질을 유지합니다.

전략 2: "초반의 실수를 바로잡는 감시관" (Block-level Audit and Repair)

글을 쓸 때, AI 가 **첫 번째 문단 (블록)**을 작성하면, DiffuGuard 는 그 내용을 즉시 감시합니다.

  • 감시 (Audit): "이 문단이 원래 의도했던 안전한 답변과 너무 다르게 쓰였나?"라고 내부 신호를 분석합니다.
  • 수리 (Repair): 만약 위험한 방향으로 쓰였다면, 그 문단을 다시 지우고 (Remask) 안전한 방향으로 다시 쓰게 합니다. 이때 AI 가 다시 같은 실수를 하지 못하도록, 위험한 단어는 아예 선택 목록에서 삭제해버립니다.
  • 비유: 건축가가 건물의 1 층 기초를 잘못 쌓으면, 2 층부터는 다 무너집니다. DiffuGuard 는 1 층이 지어지는 순간 감시하며, 기초가 흔들리면 즉시 다시 쌓게 합니다.

4. 결과는 어떨까요?

실험 결과, DiffuGuard 는 놀라운 성과를 보였습니다.

  • 해킹 방어율: 다양한 해킹 시도 중 성공률을 약 48% 에서 15% 로 대폭 낮췄습니다. (약 3 배 이상 개선)
  • 품질 유지: 안전만 지키는 게 아니라, AI 가 평소 하던 수학 문제 풀이나 글쓰기 능력은 그대로 유지되었습니다.
  • 속도: 안전 장치를 달았다고 해서 글쓰기 속도가 느려지지 않았습니다.

요약

이 논문은 **"새로운 방식의 AI 는 기존 방식과 다른 새로운 약점이 있다"**고 경고하며, **"그 약점을 정확히 찌르는 두 가지 방어 기술 (혼란 주기 + 초반 감시)"**을 제안합니다.

DiffuGuard 는 마치 **AI 가 글을 쓸 때 옆에서 지켜보는 '현명한 편집자'**와 같습니다. AI 가 위험한 방향으로 글을 쓰려 하면, 초반에 **"잠깐, 다시 생각해보자"**라고 말려주거나, **"이 부분은 다시 써야 해"**라고 지우게 함으로써, AI 가 본래 가진 안전성을 되찾아주는 혁신적인 기술입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →