← 최신 논문
💬 NLP

Efficient Diffusion LLMs via Temporal-Spatial Parallel Decoding and Confidence Extrapolation

본 논문은 수렴된 토큰을 동적으로 식별하고 미래의 추세를 예측하기 위해 시공간 병렬 디코딩(Temporal-Spatial Parallel Decoding)과 신뢰도 외삽(Confidence Extrapolation)을 결합한 트레이스 인식 디코딩 프레임워크를 제안하며, 이를 통해 출력 품질을 유지하면서 확산 기반 대규모 언어 모델(diffusion-based large language models)의 지연 시간을 크게 줄인다.

원저자: Zekai Li, Ji Liu, Yiqing Huang, Ziqiong Liu, Dong Li, Emad Barsoum

게시일 2026-06-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zekai Li, Ji Liu, Yiqing Huang, Ziqiong Liu, Dong Li, Emad Barsoum

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 복잡한 퍼즐, 예를 들어 크로스워드나 직소 퍼즐을 풀고 있다고 상상해 보세요. 하지만 아주 구체적이고 특이한 방식으로 풀어야 합니다. 왼쪽에서 오른쪽으로 한 조각씩 놓는 일반적인 AI 방식 대신, 당신은 빈 칸(마스크 처리된 사각형)으로 가득 찬 판에서 시작합니다. 당신의 목표는 이 칸들을 한꺼번에 채우는 것입니다.

하지만 함정이 있습니다. 당신은 최종 정답을 즉시 알 수 없습니다. 당신은 "추측"을 하고, 얼마나 확신하는지 확인해야 하며, 만약 확신이 없다면 추측을 지우고 다시 시도해야 합니다. 당신은 이 추측과 삭제의 전체 과정을 보드 전체에 대해 반복해서 수행하며, 모든 칸이 완벽해질 때까지 이 과정을 계속 반복합니다.

문제점: 이미 완료된 조각에 시간을 낭비함
이 논문은 이 과정의 주요 비효율성을 지적합니다. 당신이 양식을 작성하고 있다고 상상해 보세요. 당신은 이름을 적었고, 그것이 맞다고 100% 확신합니다. 하지만 시스템이 전체 양식을 50번 재확인하도록 요구하기 때문에, 이름이 바뀌지 않았음에도 불구하고 당신은 49번을 더 다시 써야 합니다. 이는 엄청난 시간과 에너지를 낭비합니다.

현재의 AI 모델들(Diffusion LLM이라 불리는)은 정확히 이 작업을 수행합니다. 그들은 이미 완성된 단어들을 (혹시 모르니) 계속해서 "디노이징(재확인)"합니다. 또한 그들은 "신뢰도 점수가 90% 이상이면 멈춰라"와 같은 단순한 규칙에 의존합니다. 하지만 이 논문은 이 규칙이 너무 경직되어 있다고 말합니다. 때때로 어떤 단어는 안정적이지만 점수가 아직 90%에 도상하지 못했을 수도 있고, 또 어떤 단어는 안정적으로 보이지만 실제로는 곧 바뀔 수도 있기 때문입니다.

해결책: 스마트한 교통 관제사
저자들은 이 낭비를 해결하기 위해 두 가지 주요 도구인 TSPDCE를 제안합니다.

1. TSPD: "교통 관제사" (시공간 병렬 디코딩, Temporal-Spatial Parallel Decoding)

AI의 생성 과정을 많은 자동차(단어)가 목적지를 향해 달리는 번잡한 고속도로라고 생각해보세요.

  • 기존 방식: 모든 출구마다 배치된 교통 경찰이 스톱워치를 들고 모든 자동차를 하나하나 개별적으로 체크합니다. 만약 차가 5초 동안 그 자리에 있었다면, 경찰은 "좋아, 이제 가도 좋다"라고 말합니다. 이는 느리며, 서로 다른 자동차들이 실제로 얼마나 빠르게 움직이는지는 고려하지 않습니다.
  • TSPD 방식: 이 새로운 컨트롤러는 모든 자동차의 *이력(history)*을 관찰하는 스마트한 교통 시스템과 같습니다. 단순히 현재의 자동차만 보는 것이 아니라, 그들의 "궤적(trajectory)"을 봅니다.
    • 시간적(Temporal) 측면: "이 단어가 한동안 안정적이었는가? 최종 정답을 향해 속도를 내고 있는가, 아니면 앞뒤로 흔들리고 있는가?"를 묻습니다.
    • 공간적(Spatial) 측면: 문장의 끝에 있는 단어들이 문장 시작 부분의 단어들보다 정착하는 데 더 오래 걸린다는 것을 알고 있습니다. 이 시스템은 단어의 위치에 따라 규칙을 조정합니다.
    • 결과: 컨트롤러는 이렇게 말할 수 있습니다. "이 단어는 3단계 동안 안정적이었고 직선으로 움직이고 있다. 비록 신뢰도 점수가 아직 완벽하지는 않지만, 나는 이것을 확정(lock in)하겠다." 이를 통해 AI가 이미 완료된 단어들을 재확인하는 데 시간을 낭비하는 것을 막습니다.

2. CE: "수정구슬" (신뢰도 외삽, Confidence Extrapolation)

때때로 어떤 단어는 올바른 경로 위에 있지만, 아직 "결승선"(높은 신뢰도 점수)에 도달하지 못할 때가 있습니다.

  • 기존 방식: AI는 수동적으로 기다립니다. 점수가 높아지기를 바라며 전체 과정을 단계별로 계속 실행합니다.
  • CE 방식: 이것은 "수정구슬" 모듈입니다. 단어의 최근 신뢰도 추세를 살펴봅니다. 만약 신뢰도가 꾸준하고 예측 가능하게 상승하고 있다면, 다음과 같이 말합니다. "나는 미래를 볼 수 있다. 두 단계만 더 지나면 이 단어는 분명히 95%의 신뢰도를 가질 것이다. 기다리는 과정을 건너뛰고 지금 바로 확정하자."
  • 안전 점검: 이것은 무모한 추측이 아닙니다. 이 모델은 자신의 예측에 대한 "불확실성"을 계산합니다. 만약 추세가 불안정하거나 이력이 너무 짧다면, 수정구슬은 침묵을 지키고 AI는 정상적으로 기다립니다. 이는 빠른 속도를 위해 실수를 저지르지 않도록 보장합니다.

결과: 더 똑똑해진 속도
저자들은 수학 문제나 코딩과 같은 작업에서 대규모 AI 모델(LLaDA-8B)을 사용하여 테스트를 진행했습니다.

  • 속도: 이 두 가지 도구를 사용함으로써, 텍스트 길이에 따라 AI가 5배에서 58배까지 빨라졌다는 것을 발견했습니다.
  • 품질: 훨씬 더 빨라졌음에도 불구하고, 답변의 품질(정확도)은 원래의 느린 버전과 거의 동일하게 유지되었습니다.
  • 호환성: 이 시스템은 플러그인처럼 작동합니다. 기존 AI를 망가뜨리지 않고, 그 위에 얹혀서 언제 멈춰야 할지를 알려주는 역할을 합니다. 심지어 KV 캐싱과 같은 다른 속도 향상 기술과 결합했을 때 더 효과적입니다.

요약하자면
이 논문은 "디퓨전(diffusion)" AI 모델(반복적인 추측을 통해 텍스트를 정교화하는 모델)을 훨씬 빠르게 만드는 방법을 소개합니다. 경직된 타이머가 끝날 때까지 모든 단어를 맹목적으로 재확인하는 대신, 각 단어의 이력을 관찰하는 스마트한 컨트롤러와 단어가 완료될 시점을 예측하는 "예측기"를 사용합니다. 이를 통해 AI는 정확도를 잃지 않으면서도 완료된 작업에 대한 작업을 조기에 중단하여 엄청난 양의 시간을 절약할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →