← 최신 논문
💬 NLP

Plan for Speed: Dilated Scheduling for Masked Diffusion Language Models

본 논문은 비인접 그룹으로 시퀀스 위치를 분할하여 병렬 언마스크를 수행함으로써 결합 엔트로피 증가를 최소화하고, 이로써 품질을 저하시키지 않거나 근본적인 디노이저를 수정하지 않으면서 마스킹 확산 언어 모델에서 최대 5.8 배 빠른 텍스트 생성을 달성하는 추론 전용 방법인 확장형 언마스크 스케줄러 (DUS) 를 소개한다.

원저자: Omer Luxembourg, Haim Permuter, Eliya Nachmani

게시일 2026-05-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Omer Luxembourg, Haim Permuter, Eliya Nachmani

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 퍼즐을 풀고 있다고 상상해 보세요. 하지만 그림을 보는 대신, 모든 조각이 검은 스티커로 덮인 상자로 시작합니다. 당신의 목표는 스티커를 제거하고 그림을 드러내는 것입니다.

AI 텍스트 생성 세계에서는 **마스크드 디퓨전 언어 모델 (MDLMs)**이 이렇게 작동합니다. 모든 단어가 숨겨진 (마스크된) 문장으로 시작하여, 답변을 재구성하기 위해 하나씩 "마스크 해제"를 시도합니다.

문제: "확신" 기반 접근법은 느립니다

전통적으로 이러한 AI 모델은 매우 신중하고 확신에 찬 사람처럼 행동합니다. 퍼즐을 보고, 가장 정확할 것으로 예상되는 조각을 추측한 다음, 그 한 곳의 스티커만 제거합니다. 그다음 다시 보고, 다음으로 가장 확신 있는 위치를 추측하여 또 다른 스티커를 제거합니다.

이 방식은 정확하지만, 놀라울 정도로 느립니다. 100 단어를 드러내야 한다면 "추측 기계"(AI 모델) 를 100 번이나 따로 방문해야 합니다. 이는 페인트 통에 작은 붓을 담갔다가 1 평방 인치만 칠하고, 다시 붓을 담그고 반복하는 방식으로 벽을 칠하려는 것과 같습니다.

일부 연구자들은 속도를 높이기 위해 "좋아, 가장 확신 있는 상위 10 개 위치를 골라 한 번에 모두 마스크를 해제하자!"라고 제안했습니다. 하지만 이는 종종 역효과를 낳습니다. 그 10 개 위치는 확신도에 기반해 선택되었기 때문에, 보통 서로 인접해 있습니다. 이웃을 동시에 마스크 해제하는 것은 어떻게 연결되는지 알지 못한 채 10 개의 인접한 사각형을 칠하려는 것과 같습니다. AI 는 종종 혼란을 겪고 실수를 저지르며, 되돌아가거나 nonsensical한 결과를 만들어냅니다.

해결책: "확장" 전략

이 논문의 저자들은 **확장 마스크 해제 스케줄러 (Dilated Unmasking Scheduler, DUS)**라는 새로운 게임 방식을 제안합니다.

DUS 를 최상의 위치를 추측하는 사람이 아니라, 고정된 계획을 가진 현명한 건설 현장 감독관으로 생각하세요. AI 에게 "어떤 단어가 맞다고 생각하나요?"라고 묻는 대신, 감독관은 "우리는 1, 5, 9, 13 번 위치에 있는 단어들을 마스크 해제할 것입니다"라고 말합니다.

다음은 비유입니다:
긴 어두운 복도를 전구로 채우고 있다고 상상해 보세요.

  • 구식 방법 (토큰 단위): 전구 하나를 켜고, 방이 적응할 때까지 기다린 다음, 다음 전구를 켜고 기다리는 식입니다. 이는 영원히 걸립니다.
  • "확신" 기반 병렬 방식: 복도를 보고 처음 5 개의 전구가 추측하기 쉽다고 판단하여, 모두 한 번에 켭니다. 하지만 모두 뭉쳐 있기 때문에 빛이 고르지 않고, 더 먼 곳의 어두운 부분을 놓치게 됩니다.
  • DUS 방식: 확장 스케줄을 사용합니다.
    1. 1 라운드: 1, 5, 9, 13, 17 번 위치의 전구를 켭니다 (큰 간격을 두고).
    2. 2 라운드: 그 사이의 간격을 채웁니다: 3, 7, 11, 15 번...
    3. 3 라운드: 남은 작은 간격을 채웁니다.

왜 이것이 작동하는가

DUS 의 마법은 간격에 있습니다. 초기 라운드에서 서로 멀리 떨어진 단어들을 드러내도록 강제함으로써 "뭉침" 문제를 피할 수 있습니다.

  • 독립성: 멀리 떨어진 단어들은 서로에 크게 의존하지 않습니다. 문장의 첫 번째 단어와 마지막 단어를 독립적으로 추측하는 것이, 5 번째와 6 번째 단어를 함께 추측하는 것보다 쉽습니다.
  • 맥락 구축: 일단 이러한 널리 떨어진 단어들이 드러나면,它们是 문장의 "앵커" 역할을 합니다. AI 가 두 번째 라운드에서 간격을 채우러 돌아갈 때, 훨씬 더 풍부한 문장 "지도"를 가지고 있게 되어 추측이 훨씬 더 정확해집니다.

결과: 빠르고 정확합니다

이 논문은 수학 문제 해결 (GSM8K), 코드 작성 (HumanEval), 일반 상식 질문 답변과 같은 어려운 작업에서 이 방법을 테스트했습니다.

  • 속도: DUS 를 사용하면 AI 가 단어당 한 라운드가 아닌, 몇 라운드만으로 (로그 시간) 텍스트 블록 전체를 마스크 해제할 수 있습니다. 이로 인해 기존 느린 방법보다 최대 5.8 배 빠른 속도가 달성되었습니다.
  • 품질: 놀랍게도, 한 번에 마스크 해제하는 단어 수는 줄이지만 간격을 두는 방식으로, AI 는 "확신" 기반 병렬 방법보다 적은 실수를 했습니다. 단순히 빨라진 것이 아니라, 동시에 더 똑똑해졌습니다.
  • 재학습 불필요: 이는 "플러그 앤 플레이" 업그레이드입니다. AI 모델을 재학습시키거나 뇌를 변경할 필요가 없습니다. 게임 중 단어를 드러내는 방식에 대한 규칙집만 바꾸면 됩니다.

요약

이 논문은 간단한 스케줄링 트릭을 소개합니다: 가장 쉬운 단어를 먼저 추측하지 말고, 가장 펼쳐진 단어를 먼저 추측하세요.

텍스트 생성을 먼 기둥을 먼저 세우고 벽을 채우는 건설 프로젝트처럼 취급함으로써, AI 는 추론 능력, 수학 문제 해결 능력, 또는 코드 작성 능력을 잃지 않고 훨씬 더 빠르게 텍스트를 생성할 수 있습니다. 이는 새로운 하드웨어나 모델 학습 없이 느린 단계별 과정을 빠른 병렬 과정으로 바꿉니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →