← 최신 논문
🤖 machine learning

Diffusion LLMs as Targets and Adversaries: Mechanistic Safety Exploits

이 논문은 확산 기반 대규모 언어 모델이 그들의 자기회귀적 전신으로부터 희소하고 전이 가능한 안전 취약성을 상속받는다는 점을 밝히며, 기계론적 뉴런 프루닝과 최소한의 생성 비용으로 완벽에 가까운 공격 성공률을 달나하는 새로운 SN-Guided Diffusion 프레임워크를 통해 매우 효과적인 블랙박스 탈옥을 가능하게 한다.

원저자: Elena Dumitrescu, Gert Lek, Lydia Y. Chen, Jérémie Decouchant

게시일 2026-08-10
📖 5 분 읽기🧠 심층 분석

원저자: Elena Dumitrescu, Gert Lek, Lydia Y. Chen, Jérémie Decouchant

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 단순히 사람이 책을 왼쪽에서 오른쪽으로 읽는 것처럼 단어를 하나씩 읽는 것이 아니라, 뒤섞인 글자들이 가득한 페이지 전체를 바라보며 마법처럼 서서히 모든 글자를 풀어내어 명확한 문장을 만들어내는 세상을 상상해 보십시오. 이것이 바로 '대규모 언어 모델(LLM)'이라 불리는 가장 똑똑한 컴퓨터 뇌들이 학습하고 있는 새로운 방식입니다. 과학자들은 이를 "디퓨전(Diffusion)" 모델이라고 부릅니다. 이 모델들은 마치 범죄 현장의 흐릿한 사진을 가지고 시작하여, 사진이 아주 선명해질 때까지 초점을 계속해서 맞춰가는 탐정과 같습니다. 한 단어씩 다음 단어를 추측하는 방식과는 다릅니다.

하지만 여기 까다로운 문제가 있습니다. 우리는 폭탄 제조를 돕거나 나쁜 편지를 쓰는 것과 같이 해서는 안 될 행동의 예시들을 보여줌으로써 컴퓨터가 "착하게" 행동하도록 가르칩니다. 이를 "안전 정렬(safety alignment)"이라고 합니다. 오랫동안 우리는 이러한 안전 규칙들이 두껍고 깨지지 않는 방패처럼 컴퓨터의 전체 뇌 속에 깊숙이 짜여 있다고 믿었습니다. 그러나 최근의 연구는 이 방패가 사실 단 몇 개의 작고 특정한 실로 만들어졌을 수도 있다는 점을 시사합니다. 만약 그 특정 실들을 찾아내어 잡아당길 수 있다면, 방패 전체가 무너져 내릴 수도 있습니다. 이것이 바로 과학자들이 던지는 질문입니다. 이 새로운 "언스크램블링(unscrambling, 글자 풀기)" 컴퓨터들이 기존의 모델들만큼 안전한 것일까요, 아니면 우리가 아직 알아차리지 못한 비밀스럽고 숨겨진 약점을 가지고 있는 것일까요?


논문의 핵심 발견: "안전 스위치" 찾기

이 논문에서 연구진은 이 새로운 디퓨전 모델들을 두 가지 방식으로 다루기로 했습니다. 첫째는, 그들이 뚫고자 하는 **대상(target)**으로서의 모델이고, 둘째는, 다른 모델을 뚫기 위해 사용하려는 **적대적 존재(adversary, 해커)**로서의 모델입니다. 연구진은 이 컴퓨터들의 안전 규칙이 요새라기보다는 카드 집처럼 취약한지 확인하고자 했습니다.

"안전 뉴런(Safety Neuron)"의 비밀
연구진은 놀라운 사실을 발견했습니다. 이 복잡한 컴퓨터 뇌 내부에서 "안 됩니다, 그 일을 할 수 없습니다"라고 말하는 부분은 사방에 퍼져 있지 않았습니다. 대신, 그것은 "안전 뉴런"이라 불리는 작고 희소한 특정 부분들에 집중되어 있었습니다. 이것을 수천 개의 전구가 있는 건물에 비유해 보겠습니다. 당신은 "출입 금지" 표지판이 모든 전구에 그려져 있을 것이라고 생각할 수도 있지만, 연구진은 그 표지판이 단 몇 개의 특정 전구에만 붙어 있는 작은 스티커라는 것을 발견했습니다. 만약 그 몇 개의 전구를 테이프(또는 "가지치기")로 가려버린다면, 건물은 "출입 금지" 표지판을 가졌다는 사실을 잊어버리고 누구든 들어오도록 허용하게 됩니다.

"복사-붙여넣기" 해킹
여기서 매우 영리한 부분이 등장합니다. 많은 디퓨전 모델은 기존의 "왼쪽에서 오른쪽으로" 읽는 모델의 뇌를 가져와 새로운 사고 방식을 부여함으로써 만들어집니다. 연구진은 이 과정을 거칠 때, 새로운 모델이 기존 모델의 똑같은 "안전 스티커"를 실수로 복사한다는 것을 발견했습니다.

연구진은 이를 테스트하기 위해 기존 모델(Qwen2.5라고 불림)에서 안전 뉴런을 찾은 다음, 새로운 디퓨전 모델(Dream 또는 Fast-dLLM이라 불림)의 정확히 같은 지점을 가리키기만 하면 되었습니다. 새로운 모델 내부를 들여다보며 약점을 찾을 필요조차 없었습니다. 기존 모델의 지도를 그대로 사용하면 되었기 때문입니다.

  • 결과: 이 복사된 안전 뉴런들을 "테이프로 가렸을" 때, 새로운 모델들은 매우 안전한 상태(나쁜 질문에 98% 확률로 거절함)에서 완전히 망가진 상태(Dream의 경우 73.2%, Fast-dLLM의 경우 86.3% 확률로 나쁜 질문에 답변함)로 변했습니다. 이는 안전 결함이 "전이 가능하다(transferable)"는 것을 증명했습니다. 즉, 한 모델의 약점을 훔쳐서 다른 모델을 무너뜨리는 데 사용할 수 있다는 것입니다.

새로운 무기: "SN-Guided Diffusion"

이러한 안전 뉴한이 존재한다는 것을 아는 것과, 직접 손댈 수 없는 "블랙박스(black-box)" 모델을 해킹하는 방법은 별개의 문제입니다. 연구진은 SN-Guided Diffusion이라는 새로운 도구를 발명했습니다.

엄격한 선생님이 읽을 편지를 쓰고 있다고 상상해 보십시오. 만약 당신이 나쁜 내용을 쓰면 선생님은 당신을 제지할 것입니다. 하지만 만약 당신이 선생님의 뇌에는 안전하게 느껴지지만, 실제로는 위험한 것을 요구하는 방식으로 편지를 쓸 수 있다면 어떨까요?

연구진은 디퓨전 모델의 "텍스트를 푸는(unscramble)" 능력을 역이용했습니다. 단어를 하나씩 추측하는 대신, 모델이 원하는 나쁜 답변(예: "폭탄 만드는 법")에서 시작하여, 그 답변을 이끌어낼 수 있는 질문을 찾기 위해 역으로 거슬러 올라가도록 설정했습니다. 하지만 여기서 반전이 있습니다. 컴퓨터가 역순으로 작업하는 동안, 연구진은 특수한 "나침반"(Weighted Safety-Neuron Loss라고 불림)을 사용하여 과정을 조종했습니다.

이 나침반은 컴퓨터에게 다음과 같이 지시합니다: "안전 뉴런이 빛나게 만드는 단어들을 고르지 마라. 그 뉴런들을 어둡게 유지하는 단어들을 골라라." 안전 뉴런을 계속해서 조용하게 유지하기 위해 단어를 끊임없이 확인하고 조정함으로써, 컴퓨터는 교묘하게 위장된 "탈옥(jailbreak)" 프롬프트를 생성해 냈습니다. 이 프롬프트는 안전 필터에는 평범하고 안전한 질문처럼 보였지만, 실제로는 모델이 위험한 답변을 내놓도록 속였습니다.

얼마나 잘 작동했는가?
결과는 인상적이었습니다. 이 새로운 방식은 타겟 모델에 수천 번의 질문을 던져 학습할 필요가 없었습니다(이는 느리고 비용이 많이 듭니다). 대신, "대리(surrogate)" 모델을 사용하여 오프라인에서 모든 작업을 수행했습니다.

  • Llama-3-8B를 상대로는 **77.1%**의 성공률을 보였습니다.
  • Qwen2.5를 상대로는 **86.9%**의 성공률을 보였습니다.
  • 구글의 모델인 Gemini-2.5-Flash-Lite를 상대로는 **74.3%**의 성공률을 보였습니다.

가장 중요한 점은, 이 방식이 질문당 단 20번의 시도만으로 이 모든 것을 해냈다는 것입니다. 다른 해킹 방식들은 종종 수천 번의 시도가 필요합니다. 이는 이 새로운 방법이 효과적일 뿐만 아니라, 믿을 수 없을 정도로 빠르고 저렴하게 실행될 수 있음을 의미합니다.

이것이 왜 중요한가

논문은 이러한 새로운 AI 모델들의 안전성이 우리가 생각했던 것보다 훨씬 더 취약하다고 결론짓습니다. "안전 방패"는 단단한 벽이 아니라, 찾아내고, 복사하고, 끌 수 있는 몇 개의 특정 스위치에 불과합니다.

연구진은 만약 당신이 기존의 뇌를 복사하여 새로운 AI를 만든다면, 그 안전한 약점 또한 함께 복사된다는 것을 보여주었습니다. 또한, AI의 고유한 "언스크램블링" 초능력을 사용하여 안전 필터를 통과할 수 있는 프롬프트를 만들고, 결과적으로 안전해 보이는 패키지 안에 나쁜 의도를 숨길 수 있다는 것을 증명했습니다.

이것이 무섭게 들릴 수도 있지만, 연구진은 이러한 약점을 이해하는 것이 그것을 고치는 유일한 방법이라고 주장합니다. 만약 안전 규칙이 단 몇 개의 작은 뉴런에 불과하다는 것을 알게 된다면, 우리는 단순히 그것이 버텨주기를 바랄 것이 아니라, 안전이 뇌의 일부가 아닌 전체에 짜여 들어가도록 AI를 재설계해야 합니다. 그때까지 이 새로운 모델들은 우리가 생각했던 것보다 더 취약할 수 있으며, 그것을 깨뜨릴 도구는 이미 우리 손에 쥐어져 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →