← 최신 논문
🤖 machine learning

Layer Collapse in Diffusion Language Models

본 논문은 확산 언어 모델이 과도한 학습으로 인해 유발되는 독특한 '층 붕괴' 현상을 보인다는 것을 밝혀냈는데, 이는 초기 층이 중요한 초-이상치와 중복 표현을 발달시켜 autoregressive 모델에 비해 훨씬 더 나은 압축과 구별되는 희소성 할당 전략을 가능하게 한다는 것이다.

원저자: Alexander Conzelmann, Albert Catalan-Tatjer, Shiwei Liu

게시일 2026-05-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Alexander Conzelmann, Albert Catalan-Tatjer, Shiwei Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

두 가지 다른 유형의 셰프가 이야기를 쓰는 상황을 상상해 보세요.

**전통적인 셰프 (자기회귀 모델)**는 왼쪽에서 오른쪽으로 한 단어씩 씁니다. 만약 초반에 실수를 하면, 그 실수를 수정하기 위해 뒤로 돌아갈 수 없습니다. 이것이 현재 대부분의 AI 모델 (예: Llama) 이 작동하는 방식입니다.

**확산 셰프 (확산 언어 모델)**는 일관성 없는 소음으로 가득 찬 지저분하고 뒤죽박죽인 페이지로 시작합니다. 그들은 전체 페이지를 여러 번에 걸쳐 한 번에 처리하며, 소음이 사라질 때까지 서서히 정리해 나갑니다. 이것이 새로운 '확산 (Diffusion)' 접근법 (예: LLaDA) 입니다.

이 논문은 이 두 셰프가 작업하는 동안 그들의 '뇌' 내부에서 어떤 일이 일어나는지 조사합니다. 연구자들은 확산 셰프가 전통적인 셰프와 거의 정반대 방식으로 작동한다는 사실을 발견했으며, 이는 모델을 축소하거나 가속화하는 방식에 대한 우리의 접근법을 바꿔야 함을 시사합니다.

다음은 세 가지 주요 발견 사항을 쉽게 설명한 것입니다:

1. '슈퍼 채널' 대 '팀 노력'

전통적인 셰프의 뇌 (Llama) 에서는 서로 다른 부분이 서로 다른 단어를 위해 점등됩니다. 실수로 특정 전구 하나를 꺼버리면, 셰프는 약간 혼란스러워하지만 여전히 이야기를 끝낼 수 있습니다.

반면 확산 셰프의 뇌 (LLaDA) 에서는 연구자들이 이상한 사실을 발견했습니다: 하나의 전구가 너무 밝게 빛나서 눈이 부실 정도입니다.

  • 이 '슈퍼 채널'은 이야기의 시작부터 중간까지 거의 모든 단어를 위해 활성화되어 있습니다.
  • 이 채널은 매우 중요해서, 이 전선 하나만 뽑아도 셰프는 단순히 혼란을 겪는 것이 아니라 완전히 무너져 내리며 같은 단어를 반복하기 시작합니다 ("사 사 사 사...").
  • 비유: 건설 현장을 상상해 보세요. 전통적인 팀은 각기 다른 일을 하는 많은 근로자들이 있습니다. 한 명이 떠나면 건물이 조금 더 느리게 올라갑니다. 반면 확산 팀은 한 명의 '슈퍼 근로자'가 전체 건물을 지탱하고 있고, 나머지 사람들은 그저 서서 구경만 하고 있습니다. 슈퍼 근로자가 떠나면 건물은 즉시 무너집니다.

2. '중복된 초기 레이어' (일반적인 것의 역전)

일반적으로 AI 모델에서 초기 레이어는 '스케치' 단계 (매우 독특하고 창의적) 와 같고, 깊은 레이어는 모델이 필요한 모든 것을 이미 학습했기 때문에 반복적이 되는 곳입니다 (이를 '깊이의 저주'라고 합니다).

연구자들은 확산 모델이 이 스크립트를 뒤집고 있음을 발견했습니다:

  • 초기 레이어는 지루합니다: 그 '슈퍼 근로자'가 모든 중압을 지고 있기 때문에, 확산 모델의 초기 레이어들은 모두 정확히 같은 일을 합니다. 그들은 서로의 중복된 복사본일 뿐입니다.
  • 깊은 레이어는 독특합니다: 후기 레이어는 실제로 더 많은 다양성을 가집니다.
  • 비유: 일반적인 공장에서 처음 몇 개의 공정은 고유한 조립 단계이고, 마지막 몇 개는 광택을 내는 단계 (지루함/반복) 입니다. 반면 확산 공장에서는 처음 몇 개의 공정이 모두 '슈퍼 근로자'의 동일한 지시를 복사하는 것뿐이며, 실제 고유한 작업은 최종 공정에서 이루어집니다.

3. 모델 '축소'에 이것이 중요한 이유

이러한 차이들 때문에, 이러한 모델을 더 작게 만드는 (압축) 규칙은 완전히 반대가 됩니다.

  • 전통적인 모델의 경우: 초기 레이어는 독특하므로 주의 깊게 다뤄야 합니다. 깊은 레이어를 더 공격적으로 가지치기 (prune) 합니다.
  • 확산 모델의 경우: 실제로 초기 레이어를 훨씬 더 공격적으로 잘라낼 수 있습니다! 그들은 단지 '슈퍼 근로자'의 중복된 복사본일 뿐이므로, 이를 제거해도 큰 타격이 없습니다. 실제로 연구자들은 확산 모델을 전통적인 모델처럼 취급했다가 (먼저 깊은 레이어를 잘라내는 경우) 모델의 성능이 떨어질 수 있음을 발견했습니다.
  • 결과: 확산 모델은 놀라울 정도로 견고합니다. 심지어 3 비트 양자화를 사용하여 모델을 크게 축소하더라도, 전통적인 모델보다 훨씬 잘 견딥니다. 전통적인 모델은 축소 시 지능의 65% 를 잃을 수 있는 반면, 확산 모델은 약 2% 만 잃습니다.

그 이면의 '이유'

연구자들은 전통적인 방법과 확산 방법을 각각 사용하여 두 개의 작은 모델을 처음부터 훈련시키는 특수 실험을 수행했습니다. 그들은 이상한 '슈퍼 근로자'와 '중복된 초기 레이어'가 모델의 설계 때문이 아니라 훈련 방법 자체 때문에 발생했음을 발견했습니다.

확산 방법은 초기 레이어를 '과도하게 훈련'시켜, 그들을 한 가지 지배적인 채널에 의존하도록 만드는 반면, 전통적인 방법은 초기 레이어를 더 다양하게 남기는 것으로 보입니다.

요약

  • 확산 모델은 초기 단계에서 모든 일을 처리하는 하나의 '슈퍼 채널'을 가지고 있습니다.
  • 이 채널을 제거하면 모델이 파괴되지만, 다른 초기 레이어를 제거하는 것은 그들이 단지 중복된 복사본이므로 안전합니다.
  • 이러한 모델을 축소하려면: 초기 레이어를 과감하게 잘라내고 깊은 레이어를 보호하세요. 이는 표준 AI 모델에서 하는 것과 정반대입니다.
  • 교훈: 확산 모델은 다르게 구축되었으므로, 이를 효율적으로 만들기 위해서는 다른 규칙이 필요합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →