← 최신 논문
🤖 machine learning

CForce: Boosting Parallel Decoding for dLLMs via Consistency Forcing

이 논문은 새로운 신뢰도 적응형 KL 발산 목적 함수를 통해 초기 단계의 마스크 예측을 후기 단계의 정교화 과정과 정렬함으로써 디퓨전 대규모 언어 모델의 속도-품질 트레이드오프를 개선하는 일관성 강제 증류 방법인 CForce를 소개한다.

원저자: Yuji Ren, Chenkai Xu, Zhuocheng Gong, Jianguo Li, Zhijie Deng

게시일 2026-08-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yuji Ren, Chenkai Xu, Zhuocheng Gong, Jianguo Li, Zhijie Deng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 단순히 책장을 넘기는 사람처럼 단어를 하나씩 읽는 것이 아니라, 문장 전체를 보고 빠진 부분을 한꺼번에 추측할 수 있는 세상을 상상해 보세요. 이것이 바로 **확산 대규모 언어 모델(Diffusion Large Language Models, dLLMs)**의 영역입니다. 이들을 마치 안개로 뒤덮인 범죄 현장에서 사건을 해결하려는 탐정이라고 생각해보세요. 탐정은 물음표(마스크)로 가득 찬 페이지에서 시작하여, 단계적으로 안개를 걷어내며 숨겨진 단어들을 드러냅니다. 탐정이 안개를 더 빨리 걷어낼수록, 이야기를 더 빨리 써 내려갈 수 있습니다.

하지만 여기에는 함정이 있습니다. 만약 탐정이 시간을 아끼기 위해 한꺼번에 너무 많은 안개를 걷어내려 한다면, 초기에 잘못된 단어를 추측할 수도 있습니다. 한 번 잘못된 추측이 내려지면 이를 수정하기 어렵고, 전체 이야기가 궤도를 벗어날 수 있습니다. 이 논문은 바로 이 구체적인 문제를 다룹니다. 어떻게 하면 이 "안개 걷기" 탐정들이 부주의해지지 않으면서도 매우 빠르게 움직이게 할 것인가에 대한 문제입니다. 저자들은 모델이 서두르는 와중에도 초기 추측을 더 신뢰할 수 있도록 돕는 **일관성 강제(Consistency Forcing, CForce)**라는 새로운 학습 기법을 소개합니다.


문제점: 러시아워의 실수

함께 벽화를 그리려는 화가 그룹을 상상해 보세요. 전통적인 방식에서는 작은 구역 하나를 칠하고, 그것이 마르기를 기다린 다음 다음 구역으로 넘어갑니다. 느리지만 안전합니다. 확산 모델(Diffusion models)은 열 개의 구역을 한꺼번에 칠하려고 시도하는 팀과 같습니다. 이는 속도 면에서 놀랍지만, 만약 화가들이 서두르느라 초반 몇 구역을 잘못된 색상으로 칠한다면, 나머지 벽화는 이상해 보일 수 있고 나중에 이를 수정하는 것은 악몽이 될 것입니다.

논문은 이러한 모델들이 매우 빨라지려고 노력할 때(즉, "공격적인 병렬성"을 사용할 때), 초기 단계에서 신뢰할 수 없는 추측을 하는 경우가 많다고 지적합니다. 이러한 초기 실수는 나쁜 소문처럼 퍼져나가 최종 결과물을 망쳐버립니다. 목표는 단순히 모델을 빠르게 만드는 것이 아니라, 그 속도를 감당할 수 있을 만큼 초기 추측을 신뢰할 수 있게 만드는 것이었습니다.

해결책: "시간 여행" 코치

**일관성 강제(Consistency Forcing, CForce)**가 등장합니다. 학생 선수가 연습하는 것을 지켜보는 코치를 상상해 보세요. 보통 코치는 "다시 해봐"라고 말할 뿐입니다. 하지만 CForce는 "시간 여행" 기법을 사용하는 특별한 종류의 코치입니다.

작동 방식은 다음과 같습니다:

  1. 자기 재생(Self-Play): 모델에게 스스로 이야기를 생성하도록 요청하여, 빈 페이지에서 완성된 문장에 이르는 전체 경로를 만듭니다. 이것이 모델의 "자기 롤아웃(self-rollout)"입니다.
  2. 단계(Stages): 모든 미세한 단계를 관찰하는 대신, 코치는 이 경로를 "단계"로 나눕니다. 이는 영화를 빨리 감기로 보되, 중요한 줄거리가 드러날 때만 일시 정지하는 것과 같습니다.
  3. 교훈: 코치는 초기 단계(이야기가 여전히 안개 속에 있고 불확실한 상태)를 가져와서 후기 단계(이야기가 더 명확하고 완성된 상태)와 비교합니다. 코치는 모델에게 이렇게 말합니다: "이봐, 이야기가 안개 속에 있을 때 네가 했던 추측은 이야기가 명확해졌을 때의 추측과 매우 비슷해야 해."

모델은 자신의 초기의 불안정한 예측이 후기의 확신에 찬 예측과 일치하도록 훈련받습니다. 이는 학생에게 "네 에세이의 첫 번째 초안은 이미 핵심 아이디어를 갖추고 있어야 해. 왜냐하면 네 최종본은 반드시 그것들을 갖추고 있을 것이기 때문이야"라고 말하는 것과 같습니다.

비법: 자신감과 닻(Anchors)

이 학습이 완벽하게 작동하도록 저자들은 두 가지 영리한 도구를 추가했습니다.

  • 신뢰도 적응형 KL 발산(Confidence Adaptive KL Divergence): 이것은 "확신이 들 때 더 귀를 기울이라"는 말을 멋지게 표현한 것입니다. 이야기의 후기 단계가 특정 단어에 대해 매우 확신한다면, 모델은 그 예측에 맞추도록 강하게 압박받습니다. 만약 후기 단계가 여전히 불확실하다면, 모델은 좀 더 유연하게 대처할 수 있습니다. 이는 언제 엄격하고 언제 관대해야 하는지를 아는 역동적인 선생님과 같습니다.
  • CE 앵커(CE Anchor): 이것은 안전망 역할을 합니다. 단어가 마침내 드러날 때(벽화에 색이 칠해질 때), 모델은 그것이 정확히 맞는지 확인하도록 추가적인 자극을 받습니다. 이는 결정적인 순간에 단어가 확정될 때 모델이 경로를 이탈하는 것을 방지합니다.

연구 결과: 충돌 없는 속도

연구팀은 이 방법을 두 가지 유형의 모델에 테스트했습니다: 단순히 새로운 텍스트를 쓰는 모델(비편집형)과 실수를 되돌려 수정할 수 있는 모델(편집 가능형)입니다.

  • "수정형(Fixer)" 모델의 경우: 결과는 인상적이었습니다. CForce를 사용했을 때, 모델은 한 번의 순방향 패스(forward pass)당 6.94개에서 9.08개의 토큰(단어 또는 단어의 일부)을 생성할 수 있었으며, 동시에 정확도도 실제로 높아졌습니다(85.57%에서 86.41%로 상승). 더 빠르면서도 더 똑똑해진 것입니다.
  • "작가(Writer)" 모델의 경우: 여기에는 트레이드오프(절충)가 있었지만, 좋은 방향이었습니다. 모델은 패스당 3.60개에서 6.42개의 토큰을 생성할 수 있었는데, 이는 엄청난 속도 향상입니다. 정확도는 느리고 신중한 버전과 비교했을 때 약간 떨어졌지만, 다른 빠른 방법들보다는 훨씬 뛰어났습니다.

이 논문은 이 방법이 모델이 스스로와 일관성을 유지하도록 가르치기 때문에 효과가 있다고 제안합니다. 맥락이 적은 초기 추측을 맥락이 풍부한 후기의 현실과 일치시키도록 강제함으로써, 모델은 처음부터 더 나은 결정을 내리는 법을 배웁니다.

결론

이 논문은 AI 속도의 모든 문제를 해결했다고 주장하는 것이 아니라, 텍-생성의 "러시아워"를 다루는 매우 유망한 새로운 방법을 제시합니다. 자신의 미래의 모습을 이용해 현재의 자신을 안내함으로써, **일관성 강제(Consistency Forcing)**는 확산 모델이 발이 꼬이지 않고 더 빠르게 달릴 수 있도록 돕습니다. 이는 때때로 앞으로 빠르게 나아가는 가장 좋은 방법은, 나중에 될 사람과 같은 방향을 바라보고 있는지 확인하는 것임을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →