← 최신 논문
💬 NLP

Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed

본 논문은 블록 단위 어텐션 패턴과 위치 의존적 토큰 마스킹을 활용하여 사전 학습된 자기회귀 모델을 고효율 확산 언어 모델로 변환하는 Efficient-DLM 프레임워크를 소개하며, 이를 통해 최첨단 모델 대비 뛰어난 정확도와 처리량을 달성함을 보여줍니다.

원저자: Yonggan Fu, Lexington Whalen, Zhifan Ye, Xin Dong, Shizhe Diao, Jingyu Liu, Chengyue Wu, Hao Zhang, Enze Xie, Song Han, Maksim Khadkevich, Jan Kautz, Yingyan Celine Lin, Pavlo Molchanov

게시일 2026-05-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yonggan Fu, Lexington Whalen, Zhifan Ye, Xin Dong, Shizhe Diao, Jingyu Liu, Chengyue Wu, Hao Zhang, Enze Xie, Song Han, Maksim Khadkevich, Jan Kautz, Yingyan Celine Lin, Pavlo Molchanov

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 "Efficient-DLM: Autoregressive 에서 Diffusion 언어 모델로, 그리고 속도 그 이상으로"라는 논문에 대한 설명을 쉬운 언어와 일상적인 비유로 풀어낸 것입니다.

큰 그림: 교통 체증 vs 고속도로

이야기를 쓰는 두 가지 방식을 상상해 보세요.

  1. 오래된 방식 (자기회귀/AR): 이는 일차로와 같습니다. 한 단어를 쓴 다음, 그다음 단어를 쓰고, 또 그다음 단어를 씁니다. 첫 번째 단어가 완성되기 전에는 두 번째 단어를 쓸 수 없습니다. 매우 정확하지만, 모든 단어를 기다리며 줄을 서야 하므로 속도가 느립니다.
  2. 새로운 방식 (Diffusion/DLM): 이는 다차로 고속도로와 같습니다. 많은 단어를 동시에 (병렬로) 쓸 수 있습니다. 이론적으로는 훨씬 빨라야 합니다. 하지만 과거에는 이러한 "고속도로"가 울퉁불퉁하고 혼란스러웠으며, 일차로 방식보다 품질이 낮은 이야기를 자주 만들어냈습니다. 또한 건설 (학습) 비용도 매우 비쌌습니다.

문제: 과학자들은 일차로의 품질을 유지하면서 고속도로의 속도를 원했지만, 처음부터 다시 시작하지 않고 (이는 천문학적인 비용이 듭니다) 이를 구축하는 방법을 찾지 못했습니다.

해결책: 이 논문의 저자들은 기존에 존재하는 고품질 "일차로" 모델을 가져와서 빠르고 정확한 "고속도로" 모델로 변환하는 방법을 찾아냈습니다. 그들은 이 새로운 모델 군을 Efficient-DLM이라고 부릅니다.


어떻게 했는가: 세 가지 핵심 비법

이 논문은 이러한 변환을 성공시키기 위해 지켜야 할 세 가지 주요 "규칙"을 제시합니다.

1. "깨끗한 문맥" 규칙 (블록 방식)

  • 과거의 실수: 이전 시도들은 모델이 아직 messy 하거나 누락된 부분까지 포함한 전체 문장을 한 번에 보게 하려 했습니다. 반이나 빈 조각이 있는 퍼즐을 풀면서, 빈 공간이 채워진 것처럼 보게 하는 것과 같습니다. 이는 모델을 혼란스럽게 하여 이전에 배운 것을 잊게 만들었습니다.
  • 해결책: 저자들은 문장을 작은 블록 (책의 장과 같은) 으로 나누기로 결정했습니다.
    • 모델은 이미 완성되고 깨끗한 이전 장들을 봅니다.
    • messy 한 현재 장만 고치려고 노력합니다.
    • 비유: 건설 팀을 생각해 보세요. 그들은 건물을 한 번에 모두 고치려 하지 않습니다. 기초와 1 층 (깨끗한 문맥) 을 완성한 후 2 층 (messy 한 블록) 을 고치러 올라갑니다. 이렇게 하면 구조가 안정적으로 유지되며, 이미 지은 것을 기억하기 위한 "단축키"(KV 캐싱) 를 사용할 수 있어 과정이 훨씬 빨라집니다.

2. "토큰 이동 금지" 규칙 (다음 단계 추측 중단)

  • 과거의 실수: 기존 모델을 변환할 때, 연구자들은 오래된 일차로 모델처럼 모델이 다음 단어를 추측하게 만들었습니다.
  • 해결책: 저자들은 모델이 "다음" 단어를 추측할 필요가 없다는 것을 발견했습니다. 모델은 바로 앞의 누락된 단어를 고치기만 하면 됩니다.
  • 비유: 문서를 편집한다고 상상해 보세요.
    • 오래된 방식: 문장을 읽은 후, 현재 문장을 편집하기도 전에 바로 다음 문장을 예측해 봅니다.
    • 새로운 방식: 현재 단락의 빈칸을 채우는 데만 집중합니다. 미래를 예측하는 것보다 빈칸을 채우는 것이 더 쉽고 정확하다는 것이 밝혀졌습니다.

3. "위치 의존적 마스킹" 규칙 (왼쪽에서 오른쪽으로의 편향)

  • 문제: 모델을 훈련시킬 때, 과거에는 단어를 무작위로 가렸습니다 (복권 번호 뽑기처럼). 하지만 모델을 실제로 사용할 때 (추론 시), 인간이 읽는 것처럼 자연스럽게 왼쪽에서 오른쪽으로 단어를 완성하는 경향이 있습니다. 이는 훈련과 실제 테스트 간의 불일치를 초래했습니다.
  • 해결책: 저자들은 훈련 방식을 변경하여 모델이 블록의 시작 부분보다 부분의 단어를 가릴 확률이 더 높도록 했습니다.
  • 비유: 선생님이 시험을 채점한다고 상상해 보세요.
    • 과거 훈련: 선생님이 페이지의 무작위 질문들을 가립니다.
    • 새로운 훈련: 선생님은 학생들이 보통 섹션의 마지막 몇 문제에서 막힌다는 것을 깨닫습니다. 따라서 선생님은 섹션의 끝부분을 가리는 연습을 특별히 합니다. 이는 모델이 왼쪽에서 오른쪽으로 문장을 완성해야 하는 현실 세계에 대비하게 합니다.

결과: 속도와 지능

이 규칙들을 따름으로써, 저자들은 Efficient-DLM 계열 (1.5B, 4B, 8B 크기) 을 만들었습니다.

  • 속도: 기존 최고의 모델들보다 훨씬 빠릅니다. 예를 들어, 그들의 8B 모델은 "Dream"이라는 경쟁 모델보다 4.5 배 빠르고, "Qwen3 4B"보다 2.7 배 빠릅니다.
  • 정확도: 더 빠르지만, 수학, 코딩, 추론 작업에서 그들이 이긴 모델들보다 실제로 더 정확합니다.
  • 유연성: 여러 단어를 한 번에 생성할 수 있기 때문에 튜닝이 가능합니다. 속도가 필요하면 한 번에 많은 단어를 생성하고, 극도의 정밀도가 필요하면 한 번에 적은 단어를 생성합니다. 이는 "레이싱 모드"와 "크루징 모드"를 즉시 전환할 수 있는 차와 같습니다.

요약

논문의 결론은 다음과 같습니다: "우리는 느리지만 정확한 모델을 가져와 고속도로에서 달릴 수 있도록 가르쳤습니다. 이를 위해 작업을 깨끗한 블록으로 조직화하고, 미래를 추측하는 것을 멈추게 하며, 문장의 끝부분에 집중하도록 훈련시켰습니다. 그 결과, 현재 최첨단 모델들보다 더 빠르고 더 똑똑한 모델 군을 만들었습니다."

또한, 이러한 모델들은 양방향으로 텍스트를 볼 수 있기 때문에 검색 및 임베딩 작업에서 텍스트의 "의미"를 이해하는 데 놀라울 정도로 뛰어나며, 기존 단방향 모델들을 능가한다고 지적했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →