← 최신 논문
💻 computer science

Draft-OPD: On-Policy Distillation for Speculative Draft Models

본 논문은 타겟 보조 롤아웃과 오류 위치에서의 초안 재생을 활용하여 사고 모델에 대해 5 배 이상의 손실 없는 가속을 달성함으로써 추측적 디코딩을 위한 지도 미세 조정의 한계를 극복하는 온-정책 증류 프레임워크인 Draft-OPD 를 소개합니다.

원저자: Haodi Lei, Yafy Li, Haoran Zhang, Shunkai Zhang, Qianjia Cheng, Xiaoye Qu, Ganqu Cui, Bowen Zhou, Ning Ding, Yun Luo, Yu Cheng

게시일 2026-05-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Haodi Lei, Yafy Li, Haoran Zhang, Shunkai Zhang, Qianjia Cheng, Xiaoye Qu, Ganqu Cui, Bowen Zhou, Ning Ding, Yun Luo, Yu Cheng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매우 유명하고 뛰어난 작가 (타겟 모델) 와 함께 길고 복잡한 이야기를 쓰려고 한다고 상상해 보세요. 이 작가는 매우 영리하며 완벽한 문장을 작성하지만, 매우 느립니다. 그들은 글을 쓰기 전에 모든 단어를 신중하게 고민하는 데 오랜 시간이 걸립니다.

속도를 높이기 위해 당신은 몇 단어를 미리 추측해 보게 하는 빠르고 에너지가 넘치는 인턴 (드래프트 모델) 을 고용합니다. 인턴은 몇 단어를 빠르게 작성한 후, 유명한 작가가 이를 확인합니다. 만약 인턴이 맞다면 작가는 "좋아, 계속 진행해!"라고 말하고 다음으로 넘어갑니다. 만약 인턴이 틀리면 작가는 실수를 지우고 올바른 단어를 쓴 뒤 다시 시작합니다.

이 과정은 Speculative Decoding(추론적 디코딩) 이라고 불립니다. 목표는 인턴이 너무 잘 추측하게 만들어 작가가 실수를 수정하기 위해 멈추는 일이 거의 없도록 하는 것이며, 이를 통해 전체 이야기가 훨씬 빠르게 쓰이게 하는 것입니다.

문제: "교과서" 대 "실전 게임"

오랫동안 이러한 인턴들을 훈련시키는 방식은 교과서를 주는 것과 같았습니다. 당신은 이미 유명한 작가가 쓴 이야기들을 보여주며 "이 패턴들을 암기하라"고 말했습니다. 이를 **지도 미세 조정 **(SFT) 이라고 합니다.

처음에는 이것이 매우 잘 작동합니다. 인턴은 교과서를 복사하는 데 점점 더 능숙해집니다. 하지만 결국 그들은 벽에 부딪힙니다. 교과서를 더 많이 공부해도 실시간으로 추측하는 속도가 빨라지지 않습니다.

왜일까요?
교과서는 정적이기 때문입니다. 교과서에는 유명한 작가가 취한 경로만 나와 있을 뿐입니다. 하지만 실전 게임에서는 인턴이 먼저 움직입니다. 때로는 인턴이 교과서에서 작가가 단 한 번도 쓰지 않은 이상한 단어를 추측하기도 합니다. 인턴이 실수를 하면 작가가 이를 수정합니다. 하지만 인턴은 교과서에 그 특정 "잘못된 추측" 시나리오가 포함되어 있지 않았기 때문에 그 실수로부터 배우지 못합니다. 인턴은 실제로 걸어본 적이 없는 도시의 지도를 공부하고 있는 것입니다.

해결책: "Draft-OPD"(실천을 통한 학습)

이 논문의 저자들은 Draft-OPD라는 새로운 훈련 방법을 제안합니다. 교과서만 읽는 대신, 인턴이 유명한 작가가 바로 옆에서 실시간으로 코칭해 주는 시뮬레이션 게임에서 연습하게 합니다.

다음은 간단한 비유를 통해 작동 방식을 설명한 것입니다:

  1. **안전한 연습 주행 **(타겟 지원 롤아웃)
    인턴이 한 단락을 쓰려고 한다고 상상해 보세요. 만약 막히거나 길을 잃으면, 유명한 작가가 즉시 개입하여 문제를 해결하고 이야기를 계속 진행시킵니다. 이는 인턴이 혼자 전체 이야기를 쓰려고 할 때 발생할 수 있는 무의미한 글쓰기 혼란을 방지하여 연습 세션이 엉망이 되는 것을 막아줍니다.

  2. **"오류 재생" **(비밀 무기)
    이것이 가장 중요한 부분입니다. 인턴이 추측을 하고 작가가 이를 수정해야 할 때, 시스템은 그냥 넘어가지 않습니다. "되감기"를 누릅니다.

    • 인턴이 잘못된 추측을 한 정확한 순간으로 돌아갑니다.
    • 인턴에게 그 특정 추측을 다시 해보라고 요청합니다.
    • 작가가 왜 그 추측이 틀렸는지 설명하도록 요청합니다.

    이는 코치가 "멈춰! 네가 공을 왼쪽으로 차려 했지만 골키퍼가 있었어. 다시 되감고 다시 시도해 봐서 오른쪽으로 차는 법을 배우자"라고 말하는 것과 같습니다. 이는 인턴이 작가의 완벽한 경로뿐만 아니라, 그들이 저지르는 실수에 대해 구체적으로 배우게 합니다.

  3. **스마트 점수 매기기 **(수용 인식 증류)
    시스템은 결과에 따라 인턴의 추측을 다르게 처리합니다:

    • 인턴이 맞았을 때: 시스템은 "잘했어, 정확히 네가 한 대로 계속해"라고 말합니다. (좋은 습관을 강화합니다.)
    • 인턴이 틀렸을 때: 시스템은 "네가 이 잘못된 답에 확신을 가졌지만 틀렸어. 이 특정 유형의 실수를 고치는 데 집중하자"라고 말합니다. (확신에 찬 실수를 처벌합니다.)

결과

이 논문은 이 새로운 방법을 매우 고급스러운 AI 모델들 (수학과 코딩에 능하기 때문에 "생각하는 모델"이라고 불리는) 에 대해 테스트했습니다.

  • **기존 방법 **(교과서 학습) 인턴은 작성 과정을 약 4.5 배 가속화할 수 있었습니다.
  • **새로운 방법 **(Draft-OPD) 인턴은 5 배 이상 속도를 높였습니다.

간단히 말해, 새로운 훈련 방법은 인턴이 추측하는 능력을 훨씬 더 향상시켜, 유명한 작가가 실수를 수정하기 위해 멈추는 일이 훨씬 줄어들었습니다. 이는 이야기의 품질을 잃지 않으면서 훨씬 빠르게 쓰일 수 있음을 의미합니다.

요약

이 논문은 AI 를 더 빠르게 만들기 위해서는 완벽한 예시를 복사하도록 가르치는 것만으로는 부족하다고 주장합니다. 우리는 그들이 연습하게 하고, 실수를 하게 한 뒤, 그 실수들을 어떻게 고칠지 구체적으로 가르쳐야 합니다. AI 가 잘못 추측했던 순간들을 재생함으로써, 미래를 예측하는 데 훨씬 더 뛰어난 "드래프트" AI 를 훈련시킬 수 있으며, 이로 인해 전체 시스템이 훨씬 더 빨라집니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →