← 최신 논문
💬 NLP

Adaptive Steering and Remasking for Safe Generation in Diffusion Language Models

본 논문은 반복적 탈잡음 과정 중 안전 취약점을 효과적으로 완화하면서 생성 품질을 유지하기 위해 대비 안전 방향 기반 탐지, 적응형 조향, 토큰 재마스크를 결합한 Diffusion 언어 모델을 위한 플러그 앤 플레이 추론 시간 방어 프레임워크를 제안한다.

원저자: Yejin Lee, Yo-Sub Han

게시일 2026-05-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yejin Lee, Yo-Sub Han

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

확산 언어 모델 (DLM) 을 프롬프트에 기반한 그림을 그리는 팀으로 상상해 보세요. 한 번에 한 붓질씩 직선으로 그려나가는 전통적인 작가와 달리, 이 팀은 정적 (노이즈) 으로 완전히 덮인 캔버스에서 시작합니다. 그들은 라운드별로 정적을 점차 제거하며 이미지를 드러냅니다.

논문에 따르면 문제는, 정적을 제거하는 초기 라운드 동안 "나쁜" 아이디어 (예: 해로운 지시) 가 그림에 슬쩍 끼어들면 그것이 고정된다는 점입니다. 예술가들이 자신이 보는 것에 기반하여 이미지를 계속 정제하기 때문에, 그 초기의 나쁜 아이디어가 퍼져 결국 나중에 고치려 해도 전체 그림을 망쳐버립니다.

다음은 저자들의 새로운 방법인 적응형 조향과 재마스크 (Adaptive Steering and Remasking) 가 어떻게 작동하는지를 간단한 비유로 설명한 것입니다:

1. 문제: 정원의 "나쁜 씨앗"

전통적인 AI 에서는 위험한 질문을 하면 AI 가 즉시 거절할 수 있습니다. 하지만 이러한 "확산" 모델에서는 AI 가 빈 캔버스에서 시작해 천천히 채워나갑니다.

  • 취약점: 해로운 단어 (예: "폭탄") 가 과정 초기에 나타나면, 모델은 이를 사실로 간주하고 나머지 문장을 그 주변에 구성합니다. 모델이 무언가 잘못되고 있음을 깨닫는 시점에는 이미 "나쁜 씨앗"이 온전한 나무로 자라났고, 모델은 이를 쉽게 베어낼 수 없습니다.
  • 과거의 해결책: 이전 방법들은 어떤 잡초라도 발견하자마자 전체 정원에 물을 주는 것을 중단하는 엄격한 정원사처럼 행동했습니다. 이는 잡초를 막았지만 꽃까지 죽여 빈 문장이나 깨진 문장을 만들어냈습니다.

2. 해결책: 스마트 가이드와 정밀 가지치기 도구

저자들은 그림이 완성된 후가 아니라, 그림이 만들어지는 동안 작동하는 스마트 가이드와 정밀 도구 역할을 하는 2 단계 안전 시스템을 제안합니다.

1 단계: "나침반" (적응형 조향)

팀은 먼저 대조적 안전 방향 (Contrastive Safety Direction, CSD) 을 생성합니다. 이는 "안전" 쪽을 가리키고 "위험" 쪽에서는 멀어지게 하는 나침반이라고 생각하세요.

  • 작동 원리: 안전한 답변과 해로운 답변의 예시를 모델에 보여줍니다. 그리고 이들 간의 수학적 차이를 계산하여 이 "나침반"을 만듭니다.
  • 행동: 그림 과정의 초기 라운드(이미지가 여전히 대부분 정적일 때) 동안 시스템은 모델의 방향을 점검합니다. 모델이 나침반의 "위험" 쪽으로 기울기 시작하면, 시스템은 이를 부드럽게 "안전" 쪽으로 밀어냅니다.
  • 비유: 안개가 자욱한 숲을 걷고 있다고 상상해 보세요. 절벽 (위험) 쪽으로 향하기 시작하면, 가이드가 어깨를 살짝 밀어 가장자리로 너무 가까이 가지 않도록 길 (안전) 쪽으로 되돌려줍니다. 이는 길을 잃기 전에 일찍 일어나는 일입니다.

2 단계: "정밀 가지치기 도구" (재마스크)

나침반이 있더라도 때로는 나쁜 단어가 스며들 수 있습니다. 이때 두 번째 단계가 작동합니다.

  • 작동 원리: 시스템은 지금까지 드러난 단어들을 스캔합니다. "위험" 방향과 강하게 일치하는 단어를 발견하면, 전체 문장을 삭제하지 않습니다. 대신 그 특정 나쁜 단어 위에만 "마스크"(빈 덮개) 를 씌웁니다.
  • 행동: 그런 다음 모델에게 그 특정 부분만 다시 그리도록 요청하여, 더 안전한 단어로 대체할 수 있는지 찾게 합니다.
  • 비유: 조각상이 상을 조각하고 있다고 상상해 보세요. 실수로 날카롭고 추한 돌 조각을 조각했다면, 전체 상을 부수는 것이 아니라 그 특정 추한 부분만 조각해 내고 신선한 점토로 매끄럽게 다듬습니다. 이렇게 하면 나머지 아름다운 상은 온전하게 유지됩니다.

3. 이것이 더 나은 이유

  • 무거운 작업 불필요: 저자들은 모델을 다시 훈련시킬 필요 (처음부터 새로운 교훈을 가르칠 필요) 가 없었습니다. 그들은 모델이 사고하는 동안 작동하는 플러그인 도구로 이 "나침반"과 "가지치기 도구"만 추가했습니다.
  • 품질 대 안전: 과거의 방법들은 파리를 잡기 위해 망치질을 하는 것과 같았습니다. 위험은 막았지만 가구 (텍스트의 품질) 를 망가뜨렸습니다. 이 새로운 방법은 파리채를 사용하는 것과 같습니다. 위험은 막되 가구 (이야기나 코드) 는 완벽하게 온전하게 둡니다.
  • 결과: 테스트에서 이 방법은 "탈옥 (jailbreak)" 공격 (AI 를 unsafe 하게 속이려는 시도) 이 거의 완전히 실패하도록 막았습니다 (어떤 경우 성공률이 1% 미만으로 하락). 동시에 AI 가 좋은 이야기를 쓰거나 수학 문제를 해결하는 능력은 이전과 거의 동일하게 유지되었습니다.

요약

이 논문은 이러한 "반복적" AI 모델을 안전하게 유지하려면, 끝까지 기다려서 실수를 확인해서는 안 된다고 주장합니다. 대신 과정의 아주 초기에 부드럽게 안내 (Steering) 하고, 나쁜 부분이 나타나는 대로 특정 부분을 수정 (Remasking) 해야 합니다. 이렇게 하면 AI 를 처음부터 다시 구축할 필요 없이 최종 산출물이 안전하면서도 고품질임을 보장할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →