← 최신 논문
💬 NLP

Just on Time: Token-Level Early Stopping for Diffusion Language Models

이 논문은 경량화된 예측 신호를 기반으로 안정적인 토큰을 동적으로 식별하고 확정함으로써, 다양한 작업에 걸쳐 생성 품질을 유지하면서도 계산 비용을 크게 줄이는 디퓨전 언어 모델을 위한 학습이 필요 없는 토큰 수준의 조기 종료 방법을 소개한다.

원저자: Zakhar Kohut, Severyn Shykula, Mykola Vysotskyi, Serhii Dmytryshyn, Dmytro Khamula, Michal Zakrzewski, Damian Rynczak, Jacek Małecki, Taras Rumezhak, Volodymyr Karpiv

게시일 2026-08-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zakhar Kohut, Severyn Shykula, Mykola Vysotskyi, Serhii Dmytryshyn, Dmytro Khamula, Michal Zakrzewski, Damian Rynczak, Jacek Małecki, Taras Rumezhak, Volodymyr Karpiv

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 직소 퍼즐을 맞추고 있다고 상상해 보세요. 하지만 상자에 그려진 그림을 보는 대신, 대신 빈 회색 사각형들로 가득 찬 상자에서 시작합니다. 이 퍼즐을 풀려면 각 사각형이 어떤 색이어야 하는지 추측한 다음, 전체 그림을 보고 어떤 추측이 틀렸는지 깨달아 다시 색칠해야 합니다. 여러분은 그림이 마침내 제대로 보일 때까지 이 "추측하고 수정하기" 과정을 수백 번 반복합니다. 이것이 바로 **디퓨전 언어 모델(Diffusion Language Model)**이라 불리는 새로운 종류의 AI가 글을 쓰는 방식입니다. 한 단어씩 타이피스트처럼 써 내려가는 기존의 AI와 달리, 이 모델들은 빈 페이지에서 시작하여 캔버스에 세부 사항을 천천히 더해가는 화가처럼 문장 전체를 한꺼번에 정교하게 다듬어 나갑니다.

문제는 이 채색 과정이 믿기 힘들 정도로 느리다는 점입니다. AI가 문장의 쉬운 부분(예: "The"나 "cat")을 단 몇 번의 붓질만으로도 파악하더라도, 만약을 위해 그 부분을 계속 덧칠하곤 합니다. 이는 마치 요리사가 수프 맛을 보고 완벽하다는 것을 깨달았음에도 불구하고, 손님에게 내놓기 전까지 한 시간 동안 계속 저으면서 맛을 보는 것과 같습니다. 이는 엄청난 양의 컴퓨터 연산 능력과 시간을 낭비합니다. 과학자들이 던지는 질문은 이것입니다. "어떻게 하면 AI에게 '이봐, 이 부분은 제대로 됐으니 그만 작업하고 어려운 부분에 집중해'라고 말할 수 있을까?"

여기서 **JoT(Just on Time)**라는 새로운 방법이 등장합니다. JoT를 AI 화가 옆에 서 있는 똑똑한 감독관이라고 생각해 보세요. 전체 팀에게 동시에 멈추라고 명령하는 대신, JoT는 캔버스 위의 개별 단어를 하나하나 관찰합니다. AI가 특정 단어(예를 들어 "cat"이라는 단어)에 대해 확신이 매우 높아지는 순간(예: 99% 확신할 때), JoT는 "그 단어는 고정해! 더 이상 건드리지 마!"라고 외치고, AI의 주의를 다음의 흐릿하고 불확실한 단어로 옮깁니다.

JoT를 개발한 연구진은 이러한 "토큰 수준의 조기 종료(token-level early stopping)"가 놀라운 효과를 낸다는 것을 발견했습니다. 그들은 Dream-7BLLaDA-8B라는 두 가지 강력한 AI 모델을 대상으로 수학 문제 풀이, 상식 퀴즈, 문장 완성, 그리고 코드 작성이라는 네 가지 과제를 테스트했습니다. 결과는 놀라웠습니다. GSM8K라는 수학 추론 테스트에서 JoT는 AI를 단 2.3점 정도의 미미한 점수 하락만으로 5.5배 더 빠르게 만들었습니다. 코딩 챌린지인 HumanEval에서의 속도 향상은 훨씬 더 극적이었는데, AI가 거의 모든 정답을 맞히면서도 속도가 무려 20배 가까이(19.6배) 빨라졌습니다.

이 논문은 모든 단어를 동시에 멈추게 하는 "일률적인(one-size-fits-all)" 방식에 반대합니다. 대신, JoT는 영리한 기술을 사용합니다. AI가 이미 완성한 단어 옆에 있는 단어들에 대해서는 확신의 기준치를 낮추는 것입니다. 만약 AI가 문장의 시작 부분을 이미 완벽하게 해냈다면, 그다음 단어는 조금 더 일찍 신뢰할 수 있습니다. 이를 통해 AI는 정말로 혼란스러운 부분에만 에너지를 집중하고, 불필요한 반복 작업을 건너뛸 수 있습니다.

이 방법은 매우 빠르지만, 저자들은 이것이 마법은 아니라는 점을 주의 깊게 언급합니다. 우리는 AI가 까다로운 수학 단계에서 막혀서 숫자를 너무 빨리 확정 지을 때 실수가 발생한다는 것을 측정했습니다. 하지만 이러한 오류는 드물며, 속도 측면에서의 이점이 압도적입니다. 논문은 각 단어가 자신만의 완벽한 순간에 "종료"되도록 허용함으로써, 이 강력하지만 느린 AI 모델들을 재학습하거나 핵심 설계를 변경하지 않고도 일상적인 용도로 훨씬 더 실용적으로 만들 수 있다고 제안합니다. 이는 AI가 더 열심히 일하는 것이 아니라, 더 똑똑하게 일하도록 만드는 단순하고도 훈련이 필요 없는 해결책입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →