← 최신 논문
💬 NLP

Autoregressive vs. Masked Diffusion Language Models: A Controlled Comparison

이 논문은 동일한 데이터와 컴퓨팅 예산 하에서 autoregressive 모델과 masked diffusion 언어 모델을 비교하여, 전자가 더 빠른 수렴과 유창성을 보이지만 후자가 더 나은 생성 다양성을 제공한다는 구조적 트레이드오프를 규명했습니다.

원저자: Caio Vicentino

게시일 2026-03-24
📖 3 분 읽기☕ 가벼운 읽기

원저자: Caio Vicentino

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🍳 두 명의 요리사: "순서대로 만드는 사람" vs "완성도를 다듬는 사람"

연구진은 두 명의 요리사 (모델) 에게 **똑같은 재료 (5 천만 개의 단어)**와 똑같은 시간 (2 만 단계), **똑같은 주방 (고성능 GPU)**을 제공했습니다. 오직 요리하는 방식만 다르게 했습니다.

1. 첫 번째 요리사: AR (자기회귀 모델)

  • 방식: "한 번에 한 숟가락씩, 왼쪽에서 오른쪽으로 순서대로"
  • 비유: 이 요리사는 레시피를 따라가며 요리를 합니다. 첫 번째 재료를 넣고, 그다음 재료를 넣고... 이렇게 한 줄로 이어가며 요리를 완성합니다.
  • 장점: 매우 빠르고, 만든 요리의 맛 (문법) 이 아주 깔끔합니다.
  • 단점: 반복되는 맛이 납니다. 첫 재료를 넣을 때 가장 흔한 재료 (예: "옛날에...") 를 고르면, 그다음도 그다음도 그 패턴을 따라가게 됩니다. 마치 모든 요리가 "옛날에..."로 시작하는 것처럼요.

2. 두 번째 요리사: MDLM (마스킹 확산 모델)

  • 방식: "다 까먹은 접시를 보고, 빈칸을 채워 넣기"
  • 비유: 이 요리사는 **완전히 빈 접시 (모든 단어가 가려진 상태)**를 받습니다. 그리고 "이곳은 뭐가 들어갈까?", "저곳은 뭐가 어울릴까?"를 생각하며 빈칸을 하나씩 채워나갑니다. 처음부터 끝까지 순서대로가 아니라, 중간중간을 먼저 채우고 나중에 연결합니다.
  • 장점: 매우 다양한 요리를 만듭니다. "옛날에..."로 시작하지 않고, "어제 비가 왔어..."나 "내일 파티가 있어..."처럼 전혀 다른 이야기로 시작할 수 있습니다.
  • 단점: 가끔 문법 실수가 나옵니다. (예: "그녀는... 달렸다" 대신 "그녀는... 달렸다"처럼 어색한 연결이 생길 수 있음).

🔍 실험 결과: 어떤 차이가 있었을까요?

연구진은 이 두 요리사를 비교하며 놀라운 세 가지 사실을 발견했습니다.

1. 요리 속도: 거의 똑같았다! 🏎️

많은 사람이 "확산 모델 (MDLM) 은 계산이 복잡해서 훨씬 느릴 거야"라고 생각했습니다. 하지만 결과는 놀라웠습니다.

  • AR: 107 분 50 초
  • MDLM: 113 분 00 초
  • 결과: MDLM 이 AR 보다 약 5 분 정도만 더 걸렸습니다. (약 4.7% 차이)
  • 의미: 확산 방식이 생각보다 훨씬 저렴하고 빠르다는 것이 증명되었습니다.

2. 학습 패턴: "빨리 배우고 지치기" vs "천천히 배우고 성장하기" 📈

  • AR (순서대로): 14,000 단계까지 아주 빠르게 실력이 늘다가, 그 이후로는 이미 배운 것을 너무 많이 외워서 (과적합) 오히려 실력이 떨어지기 시작했습니다.
  • MDLM (빈칸 채우기): 20,000 단계까지 꾸준히 실력이 늘었습니다. 아직 정점에 도달하지 않았고, 더 많이 배우면 더 좋아질 수 있는 상태였습니다.
  • 의미: AR 은 "빨리 배우고 멈추는" 스타일이고, MDLM 은 "천천히 배우고 계속 성장하는" 스타일입니다.

3. 결과물의 다양성: "진짜 같은 이야기" vs "다채로운 이야기" 🎭

가장 극명한 차이는 생성된 이야기의 시작에서 나타났습니다.

  • AR: 1,000 개의 이야기를 만들었을 때, 99.8% 가 "Once upon a time (옛날에...)"로 시작했습니다. 거의 모든 이야기가 똑같은 패턴을 따랐습니다.
  • MDLM: 1,000 개 중 93.4% 가 서로 다른 5 단어로 시작했습니다. "어제", "내일", "그녀는" 등 전혀 다른 상황으로 시작했습니다.
  • 의미: AR 은 매끄럽지만 지루한 이야기를, MDLM 은 약간 어색할 수 있지만 신선하고 다양한 이야기를 만들어냈습니다.

💡 결론: 누가 이겼을까?

이 논문은 "누가 더 낫다"라고 선언하는 것이 아니라, **"서로 다른 목적에 맞는 도구"**라고 말합니다.

  • 번역, 요약, 코드 작성처럼 문법과 정확성이 가장 중요한 작업에는 **AR (순서대로 만드는 사람)**이 좋습니다.
  • 창작 소설, 아이디어 브레인스토밍, 다양한 시나리오처럼 새로움과 다양성이 중요한 작업에는 **MDLM (빈칸 채우는 사람)**이 더 적합합니다.

한 줄 요약:

"AR 은 매끄러운 정통 요리를, MDLM 은 다채로운 퓨전 요리를 만듭니다. 둘 다 빠르고 훌륭하지만, 우리가 원하는 '맛'에 따라 선택해야 합니다."

이 연구는 두 방식이 서로 경쟁하는 것이 아니라, 서로 보완해 줄 수 있는 친구임을 보여주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →