← 최신 논문
💬 NLP

K-Forcing: Joint Next-K-Token Decoding via Push-Forward Language Modeling

K-Forcing는 교사 모델을 단일 순전파 과정에서 여러 미래 토큰을 공동으로 디코딩할 수 있는 조건부 매핑으로 증류함으로써, 약간의 품질 저하만으로 고부하 배치 서빙 시 상당한 추론 속도 향상을 달성하며 자기회귀적 텍스트 생성을 가속화하는 새로운 푸시포워드(push-forward) 언어 모델링 패러다임이다.

원저자: Zhiwei Tang, Yuanyu He, Yizheng Han, Wangbo Zhao, Jiasheng Tang, Fan Wang, Bohan Zhuang

게시일 2026-06-10
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhiwei Tang, Yuanyu He, Yizheng Han, Wangbo Zhao, Jiasheng Tang, Fan Wang, Bohan Zhuang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 이야기를 쓰려고 노력 중이지만, 매우 엄격하고 천재적인 편집자(AI 모델)를 둔 상황을 상상해 보세요. 이 편집자는 오직 한 번에 한 단어씩만 쓰는 것을 허용합니다.

당신이 단어를 하나 쓸 때마다, 당신은 멈춰서 종이를 편집자에게 건네야 합니다. 편집자가 전체 내용을 읽고, 다음 단어를 생각하고, 다시 돌려줄 때까지 기다려야 합니다. 그러고 나서 당신은 다음 단어를 쓰고, 멈추고, 이 과정을 반복해야 합니다.

이것이 현재의 AI(이를 자기회귀(Autoregressive) 또는 "AR" 모델이라고 부릅니다)가 작동하는 방식입니다. 이들은 매우 똑똑하지만, "가다 서다"를 반복하는 리듬 때문에 매우 느립니다. 긴 이야기를 쓰고 싶다면, 편집자의 책상까지 수천 번을 왔다 갔다 해야 합니다.

문제점: "한 번에 한 단어씩"이라는 병목 현상

이 논문은 "한 번에 한 단어씩" 접근하는 방식이 마치 티스푼으로 수영장을 채우려는 것과 같다고 주장합니다. 설령 그 숟가락이 빠르더라도, 과정 자체가 얼마나 많은 왕복을 할 수 있느냐에 의해 제한되기 때문입니다. 컴퓨터 용어로 말하자면, AI는 다음 계산(숟가락)을 하기 전에 메모리(수영장)가 준비될 때까지 기다려야 합니다. 이는 특히 많은 사람이 동시에 텍스트를 생성하려고 할 때 매우 비효식적입니다.

기존의 해결책들: 왜 완벽하게 작동하지 않았는가

과학자들은 이를 해결하기 위해 두 가지 주요 아이디어를 시도했지만, 둘 다 결함이 있었습니다.

  1. "초안 작성 및 검토" 방식 (Speculative Decoding): 학생이 다음 몇 단어를 추측하면, 선생님이 이를 확인하는 상황을 상상해 보세요. 선생님이 동의하면 성공이지만, 그렇지 않으면 학생은 처음부터 다시 시작해야 합니다.
    • 결함: 때로는 학생이 5단어를 추측하기도 하고, 때로는 1단어만 추측하기도 합니다. 이는 일정을 엉망으로 만듭니다. 많은 사람이 이 작업을 수행할 때, 모두의 속도가 서로 맞지 않게 되어 시스템이 다시 느려집니다.
  2. "확산(Diffusion)" 방식: 빈 캔버스에서 시작하여 부분적으로 이미지를 드러내되, 여러 부분을 동시에 추측하며 그림을 그리는 것을 상상해 보세요.
    • 결함: 이 논문은 여러 부분을 독립적으로 추측하는 것(예를 들어 하늘과 풀밭을 각각 따로 추측하는 것)이 결국 하늘과 풀밭이 어울리지 않는 엉망인 그림을 만든다고 주장합니다. 완벽한 그림을 얻으려면 결국 이미지를 아주 작은 조각 단위로 하나씩 드러내야 하며, 이는 속도를 높이려는 목적 자체를 무색하게 만듭니다.

새로운 해결책: K-Forcing (The "Magic Blueprint")

저자들은 K-Forcing을 소개합니다. AI에게 한 단어씩 묻는 대신, **마법의 청사진(Magic Blueprint)**을 보고 한 번에 **여러 단어(예: 4단어)**를 동시에 쓰도록 가르치는 것입니다.

이들이 이를 수행하는 방법은 다음과 같은 간단한 비유를 통해 설명할 수 있습니다.

1. "순방향(Push-Forward)" 지도 (청사진)
무작위 숫자(예: 주사위 던지기)를 입력받아 즉시 특정 문장으로 변환하는 기계가 있다고 상상해 보세요.

  • 기존 방식: 주사위를 던져 "3"이 나오면 기계는 "The"라고 말합니다. 그다음 다시 던져 "5"가 나오면 기계는 "cat"이라고 말합니다.
  • K-Forcing 방식: 주사위 네 개를 동시에 던집니다. 기계는 청사판을 보고 이렇게 말합니다: "좋아, 이 네 개의 숫자는 'The cat sat down'이라는 구절에 해당해." 그리고는 네 단어를 즉시 출력합니다.

2. 청사진을 어떻게 얻는가? (Progressive Self-Forcing)
청사진을 그냥 추측해서는 안 되며, 반드시 완벽해야 합니다. 그래서 그들은 "교사-학생(Teacher-Student)" 게임을 사용합니다.

  • 1단계: 느리지만 완벽한 "교사" AI를 가져옵니다. 무작위 숫자를 주고 한 단어를 쓰게 합니다. 그리고 쌍을 기록합니다: "무작위 숫자 0.45" = "The".
  • 2단계: "학생" AI가 이 연결 고리를 학습하도록 훈련합니다.
  • 3단계 (마법의 기술): 학생이 1단어를 쓰는 데 능숙해지면, 학생을 이용해 2단어를 쓰는 법을 스스로 가르치게 합니다. 그다음 4단어를 쓰는 법을 가르치게 합니다.
  • 왜 중요한가: 복잡한 규칙 전체를 한꺼번에 배우려고 하는 대신, 자전거의 보조 바퀴를 달고 연습한 뒤에 떼는 것처럼 단계별로 구축해 나가는 것입니다.

3. 결과: "배칭(Batching)"의 초능력
K-Forcing은 항상 정해진 수의 단어(예: 정확히 4단어)를 생성하므로 컴퓨터가 혼란을 겪지 않습니다. 100명의 사람을 줄 세워 놓아도, 모두가 정확히 같은 순간에 각자의 4단어를 받을 수 있습니다.

  • 속도: 논문은 이 방식이 많은 요청을 처리할 때 2.4배에서 3.5배 더 빠르다는 것을 보여줍니다.
  • 품질: 텍스트가 느린 "교사"보다는 약간 덜 완벽할 수 있지만(약 5%의 품질 저하), 여전히 매우 훌륭하며 속도 향상 폭이 엄청납니다.

요약

K-Forcing을 한 번에 하나의 패키지만 배달하는 배달원이 아니라, 한 번의 정차에 팔레트 단위의 패키지 전체를 내려놓는 트럭으로 업그레이드하는 것이라고 생각하세요. 이것은 전달되는 내용물(단어)을 바꾸는 것이 아니라, 전달하는 방법을 바꾸어 바쁜 시간에도 시스템을 훨씬 빠르고 효율적으로 만드는 것입니다.

이 논문은 AI가 미래를 생각하는 방식(단어 하나가 아닌 단어 묶음을 예측하는 것)을 바꿈으로써, 새로운 하드웨어 없이도 엄청난 속도 향상을 얻을 수 있음을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →