← 최신 논문
💬 NLP

Prefilling-dLLM: Predictive Prefilling for Long-Context Inference in Diffusion Language Models

이 논문은 관련 있는 접두사 청크(prefix chunks)를 캐싱하고 희소하게 선택함으로써 계산 복잡도를 전체 시퀀스 길이에 대한 이차 복잡도에서 디코드 길이에 대한 이차 복잡도로 줄여, 디퓨전 언어 모델의 긴 문맥 추론을 가속화하고 'lost-in-the-middle' 현상을 완화하는 학습이 필요 없는 프레임워크인 Prefilling-dLLM을 소개한다.

원저자: Jing Xiong, Qi Han, Shansan Gong, Yunta Hsieh, Chengyue Wu, Chaofan Tao, Chenyang Zhao, Ngai Wong

게시일 2026-06-10
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jing Xiong, Qi Han, Shansan Gong, Yunta Hsieh, Chengyue Wu, Chaofan Tao, Chenyang Zhao, Ngai Wong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대한 직소 퍼즐을 맞추려 한다고 상상해 보세요. 하지만 전체 그림을 한 번에 보는 대신, 조각을 단 하나 놓을 때마다 매번 퍼즐 상자 전체를 다시 확인해야 합니다.

이것이 현재 디퓨전 대규모 언어 모델(dLLM)이 긴 이야기나 문서를 처리할 때 작동하는 방식의 본질입니다. 모델이 새로운 단어를 생성하려고 할 시도할 때마다, 대화의 처음부터 끝까지 모든 히스토리를 다시 읽고 재처리합니다. 이야기가 길어질수록, 이 "다시 읽기" 과정은 너무 느리고 비용이 많이 들어서, 마치 발걸음을 옮딜 때마다 점점 더 무거워지는 배낭을 메고 마라톤을 하는 것과 같습니다.

이 논문은 이를 해결하기 위해 Prefilling-dLLM이라는 새로운 방법을 소개합니다. 일상적인 비유를 통해 그 작동 원리를 설명하겠습니다.

1. 문제점: "다시 읽기"의 함정

전통적인 AI 모델의 경우, 책의 한 페이지를 읽고 나면 그것을 기억하고 다음에 읽을 새 페이지에만 집중합니다. 하지만 이러한 디퓨전 모델에서는 컴퓨터가 책을 잊어버리고, 단 하나의 새로운 단어를 쓸 때마다 1페이지부터 1,000페이지까지 책 전체를 다시 읽습니다.

  • 결과: 책이 짧다면 괜찮습니다. 하지만 책이 32,000페이지라면, 컴퓨터는 새로운 글을 쓰는 데 1%의 시간만 쓰고 나머지 99%의 시간을 과거의 페이지들을 다시 읽는 데 소비하게 됩니다.

2. 해결책: "스마트한 사서" 시스템

저자들은 Prefilling-dLLM이라는, 매우 효율적인 사서처럼 작동하는 시스템을 제안합니다. 매번 도서관 전체를 다시 읽는 대신, 이 사서는 두 가지 일을 수행합니다.

단계 A: "프리필링(Prefilling)" (도서관 정리하기)

글쓰기가 시작되기 전, 사서는 방대한 입력 텍스트(접두사, prefix)를 가져와서 덩어리(chunk) 단위로 나눕니다(마치 책의 장(chapter)처럼).

  • 비법: 사서는 각 장을 단 한 번 읽고, 그에 대한 "요약 카드"(KV 캐시라고 불림)를 만들어 선반에 올려둡니다.
  • 혁신: 사서는 각 장의 모든 단어를 다 읽지 않습니다. 각 장에서 가장 중요한 문장들만 남기는 특별한 기술을 사용하여 불필요한 부분(fluff)을 버립니다. 이를 통해 요약 카드를 훨씬 작고 다루기 쉽게 만듭니다.

단계 B: "디코딩(Decoding)" (이야기 쓰기)

이제 모델이 다음 단어를 써야 할 때, 도서관 전체를 다시 읽지 않습니다.

  • 선택: 모델은 "지금 내가 쓰고 있는 내용과 실제로 관련이 있는 장(chapter)은 무엇인가?"라고 묻습니다. 모델은 스마트한 점수 산정 시스템을 사용하여 선반 위에 있는 상위 몇 개의 장(가장 관련성이 높은 덩어리들)만을 골라냅니다.
  • 효율성: 모델은 현재 문장에 필요하지 않은 나머지 90%의 도서관 내용은 무시합니다. 오직 이전에 만들어둔 관련 있는 "요약 카드"들만 살펴봅니다.

3. 이것이 왜 게임 체인저인가

이 논문은 이 접근 방식이 엄청난 속도 향상을 가져온다고 주장합니다. 그 이유는 다음과 같습니다:

  • 더 이상의 다시 읽기 없음: 긴 텍스트를 읽는 힘든 작업은 처음에 단 한 번 이루어집니다.
  • 스마트한 건너뛰기: 실제 글쓰기 단계에서 모델은 전체 텍스트가 아닌, 아주 적은 부분(상위 관련 덩어리들)만을 살펴봅니다.
  • 속도: 긴 문맥(8,000~32,000 단어)에서 이 방법은 기존 방식보다 9배에서 28배 더 빠르며, 정확도 또한 유지합니다.

4. "중간에서 길을 잃는(Lost in the Middle)" 미스터리 해결

긴 문맥을 가진 AI 모델에는 "Lost in the Middle"이라는 알려진 문제가 있습니다. 긴 사실 목록을 읽는 사람을 상상해 보세요. 처음 몇 개와 마지막 몇 개는 완벽하게 기억하지만, 중간에 있는 내용은 완전히 잊어버립니다.

  • 논문의 해결책: 저자들은 텍스트를 덩어리로 나누고 각 덩어리의 시작 부분에 특별한 "앵커(anchor)" 토큰(마치 책의 장 제목과 같은 역할)을 추가함으로써, 모델이 텍스트 어디에서든 정보를 찾을 수 있다는 것을 발견했습니다. 이는 완벽하게 작동하는 목차를 갖는 것과 같아서, 이야기가 아무리 길어져도 모델이 길을 잃지 않게 해줍니다.

5. "덩어리 크기(Chunk Size)"의 균형

논문은 또한 이 "장(chapter)"의 크기가 어느 정도여야 하는지도 테스트했습니다.

  • 너무 클 경우: 덩어리가 너무 크면 모델이 텍스트 중간의 중요한 세부 사항을 놓칠 수 있습니다.
  • 너무 작을 경우: 덩어리가 너무 작으면 컴퓨터가 덩어리 목록을 관리하는 데 너무 많은 시간을 소비하게 됩니다.
  • 최적의 지점: 저자들은 매우 긴 텍스트의 경우, 정확도를 높게 유지하기 위해 더 많은 작은 덩어리를 사용하는 것이 가장 효과적이라는 것을 발견했습니다.

요요약

Prefilling-dLLM은 퀴즈 문제 하나를 풀 때마다 500페이지짜리 교과서를 다시 읽는 학생에서, 처음에 스마트하고 압축된 학습 가이드를 한 번 만든 뒤, 답을 할 때 필요한 특정 페이지만 펼쳐보는 학생으로 변하는 것과 같습니다.

그 결과는 어떨까요? AI는 속도가 느려지지 않으면서도 훨씬 더 긴 대화와 문서를 처리할 수 있으며, 텍스트 중간에 숨겨진 중요한 세부 사항도 잊어버리지 않습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →