← 최신 논문
🤖 machine learning

Multi-Block Diffusion Language Models

이 논문은 새로운 멀티 블록 교사 강요(Multi-block Teacher Forcing) 전략과 최적화된 블록 버퍼(Block Buffer) 디코딩 알고리즘을 통해 확산 기반 텍스트 생성의 훈련-추론 간극을 메움으로써 생성 속도(포워드 패스당 토큰 수)와 정확도 모두에서 상당한 이득을 달성하는 멀티 블록 확산 언어 모델(Multi-Block Diffusion Language Models, MBD-LMs)을 소개한다.

원저자: Yijie Jin, Jiajun Xu, Yuxuan Liu, Chenkai Xu, Yi Tu, Jiajun Li, Dandan Tu, Xiaohui Yan, Kai Yu, Pengfei Liu, Zhijie Deng

게시일 2026-06-30
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yijie Jin, Jiajun Xu, Yuxuan Liu, Chenkai Xu, Yi Tu, Jiajun Li, Dandan Tu, Xiaohui Yan, Kai Yu, Pengfei Liu, Zhijie Deng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

개요: "조립 라인" 병목 현상 해결하기

자동차(텍스트)를 만드는 공장을 상상해 보세요.

  • 기존 방식 (자기회귀 방식, Autoregressive): 공장이 자동차를 한 대씩 만듭니다. 엔진을 완성하고, 그다음 바퀴를 달고, 페인트칠을 끝낸 후에야 비로소 다음 자동차를 만들기 시작합니다. 신뢰할 수는 있지만, 느립니다.
  • 디퓨전 방식 (새로운 공장): 처음부터 무에서 유를 창조하는 대신, 이 공장은 고철 더미(무작위 노이즈)에서 시작하여 점진적으로 완벽한 자동차로 정교하게 다듬어 나갑니다. 이를 통해 자동차의 여러 부품을 동시에 작업할 수 있어(병렬 처리) 훨씬 빠릅니다.

문제점:
현재의 "디퓨전 공장"(블록 디퓨전, Block Diffusion이라 불림)은 영리한 기술을 사용합니다. 자동차를 묶음(블록) 단위로 만듭니다. 하지만 여로 여전히 병목 현상이 존재합니다. 한 묶음을 완성한 뒤, 그것을 저장소(캐싱)에 넣고 나서야 다음 묶음을 시작합니다. 이는 마치 주자가 바통을 넘겨주기 위해 완전히 멈춰 서야만 다음 주자가 출발할 수 있는 계주와 같습니다. 이 과정에서 공장이 아무것도 하지 않고 쉬게 되는 "대기 버블(waiting bubbles)"이 발생합니다.

해결책: "멀티 블록" 계주

저자들은 **멀티 블록 디퓨전(Multi-Block Diffusion, MBD)**이라는 새로운 방법을 제안합니다.

비유: 겹쳐지는 계주
주자들이 이전 주자가 결승선을 통과할 때까지 기다리지 않고 달리는 계주를 상상해 보세요.

  • 주자 A는 자신의 바퀴를 마무리하고 있습니다.
  • 주자 B는 이미 다음 바퀴를 향해 질주하고 있습니다.
  • 주자 C는 다음 레인에서 준비 중입니다.

그들은 모두 동시에 달리고 있습니다! 이것이 바로 멀리 블록 디퓨전입니다. 텍스트 한 블록을 완전히 끝내고 다음 블록을 시작하는 대신, 모델은 여러 블록의 텍스트를 동시에 정교하게 다듬습니다. 이는 작업이 끊임없이 일어나는 "파이프라인"을 만들어내어 프로세스 속도를 획기적으로 높여줍니다.

난관: 훈련과 현실의 괴리

이 작업을 시도하는 데에는 큰 문제가 있었습니다.

  • 훈련 단계: 모델들은 엄격한 선생님(교사 강요, Teacher Forcing)처럼 훈련되었습니다. 선생님은 학생에게 이렇게 말합니다: "여기 완벽한 문단이 있다, 이제 이 지저분한 문장 하나만 고쳐봐." 학생은 한 번에 여러 개의 지저분한 문장을 고치는 연습을 해본 적이 없습니다.
  • 현실 단계: 모델이 실제로 "멀티 블록" 경주를 하려고 할 때(2개 또는 3개의 블록을 동시에 고칠 때), 모델은 갈팡질팡하며 넘어집니다. 왜냐하면 그런 특정 시나리오를 연습해 본 적이 없기 때문입니다. 이는 마치 단일 수학 문제만 연습했던 학생에게 갑자기 세 개의 변수가 포함된 복잡한 방정식을 풀라고 요구하는 것과 같습니다.

해결책: "멀티 블록 교사 강요" (MultiTF)

이를 해결하기 위해 저자들은 **멀티 블록 교사 강요(Multi-block Teacher Forcing, MultiTF)**라는 새로운 훈련 방법을 만들었습니다.

비유: 시뮬레이션 드릴(훈련)
선생님이 단순히 지저분한 문장 하나만 보여주는 대신, 이제는 지저운 문장 한 줄 전체(노이즈 그룹)를 보여주며 말합니다. "이것들을 한꺼번에 다 고쳐봐."

  • 문장들을 단순히 예측 가능한 순서로 지저분하게 만드는 것이 아니라, 실제 경주에서 일어날 법한 혼란스럽고 현실적인 방식으로 지저분하게 만듭니다.
  • 이 "드릴(반복 훈련)"은 모델이 혼란을 겪지 않고 여러 블록의 텍스트를 동시에 처리하는 법을 가르칩니다.

핵심 엔진: "블록 버퍼"

모델을 잘 훈련시켰더라도, 이를 컴퓨터에서 실행하는 것은 까다롭습니다. 컴퓨터는 고정된 크기(예: 정확히 4개의 슬롯이 있는 쟁반)로 작업하는 것을 선호합니다. 만약 동적으로 새로운 블록을 추가하려고 하면, 컴퓨터는 모든 것을 재배치해야 하므로 속도가 느려집니다.

비유: 고정된 쟁반
저자들은 특수한 "블록 버퍼(Block Buffer)" 메커니즘을 구축했습니다.

  • 4개의 고정된 슬롯이 있는 컨베이어 벨트를 상상해 보세요.
  • 필요할 때마다 새 슬롯을 추가하는 대신, 이미 존재하는 빈 슬롯을 활성화하기만 하면 됩니다.
  • 블록이 완료되면 벨트에서 미끄러져 내려가 "저장소(캐시)"로 들어가고, 뒤쪽에서는 새로운 빈 슬롯이 밀려 들어옵니다.
  • 이를 통해 컨베이어 벨트의 크기를 항상 일정하게 유지하여, 컴퓨터가 벨트를 재배치하기 위해 멈추지 않고 최대 속도로 계속 달릴 수 있게 합니다.

결과: 더 빠르고 더 똑똑하게

이 논문은 수학 및 코딩 작업에 대해 이 방식을 테스트했습니다. 결과는 다음과 같습니다.

  1. 속도: 새로운 방식(MBD)은 기존 방식보다 훨씬 더 많은 "토큰"(단어/아이디어)을 초당 처리합니다.
    • 비유: 옛날 공장이 한 시간에 자동차 3대를 만든다면, 새 공장은 6대를 만듭니다.
  2. 품질: 보통 속도를 높이려고 하면 실수가 늘어나기 마련입니다. 하지만 (MultiTF를 사용하여) 이 "멀티 블록" 스타일에 맞춰 특별히 훈련되었기 때문에, 새로운 공장은 단순히 빨라지기만 한 것이 아니라 기존 공장보다 실수도 더 적게 했습니다.
  3. 호환성: 이 새로운 방식은 이미 사용되고 있던 속도 향상 기술(DMax 등)과도 잘 작동하며, 이들이 결합되어 시스템을 더욱 빠르게 만듭니다.

요약

이 논문은 AI가 텍스트 덩어리(chunk) 여러 개를 동시에 작업하게 함으로써 텍스트 생성기를 더 빠르게 만드는 방법을 소개합니다. 그들은 다음 두 가지 방법으로 문제를 해결했습니다:

  1. AI가 여러 덩어리를 동시에 처리하도록 훈련시킴 (MultiTF).
  2. 업무량을 일정하고 효율적으로 유지하는 컴퓨터 시스템을 구축함 (Block Buffer).

결과적으로, 이 텍스트 생성기는 이전 버전들보다 더 빠르고 더 정확합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →