← 최신 논문
🤖 machine learning

Unmasking On-Policy Distillation: Where It Helps, Where It Hurts, and Why

본 논문은 온-정책 증류가 올바른 추론 단계를 강화하기보다는 잘못된 추론 단계를 수정하는 데 가장 유익함을 드러내는 동시에 최적의 증류 구성이 학생 모델의 용량과 특정 작업에 따라 크게 달라짐을 보여주는 토큰별 진단 프레임워크를 훈련 없이 도입한다.

원저자: Mohammadreza Armandpour, Fatih Ilhan, David Harrison, Ajay Jaiswal, Duc N. M Hoang, Fartash Faghri, Yizhe Zhang, Minsik Cho, Mehrdad Farajtabar

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mohammadreza Armandpour, Fatih Ilhan, David Harrison, Ajay Jaiswal, Duc N. M Hoang, Fartash Faghri, Yizhe Zhang, Minsik Cho, Mehrdad Farajtabar

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

어린 견습생 (학생) 이 복잡한 퍼즐을 푸는 법을 가르친다고 상상해 보세요. 당신은 정답을 아는 현명한 스승 (교사) 을 두고 있습니다. 목표는 스승의 사고 과정을 보여줌으로써 견습생이 배우도록 돕는 것입니다. 이를 온-정책 증류 (On-Policy Distillation) 라고 합니다.

그러나 이 논문은 중요한 질문을 던집니다. 스승은 항상 도움이 될까요? 때로는 스승이 진정한 실수를 바로잡기도 하지만, 다른 때는 스타일에 대해 잡념을 부리거나 (예: "4" 대신 "four"를 사용한다거나) 견습생이 이미 올바른 길에 있을 때 혼란스러운 조언을 하기도 합니다.

연구자들은 스승의 조언이 실제로 견습생이 정답으로 나아가도록 돕는지, 아니면 시간을 낭비하는지 단어 하나하나를 확인하기 위한 특별한 "진단 도구"를 개발했습니다.

그들이 발견한 바를 간단히 설명해 드리겠습니다.

1. "완벽한 안내자" 대 "실제 교사"

스승이 도움이 되는지 알기 위해 연구자들은 먼저 견습생이 다음에 말해야 할 단어를 정확히 알고 정답을 보장하는 **"완벽한 안내자"**를 상상했습니다.

  • 도구: 그들은 실제 교사의 조언이 이 완벽한 안내자와 얼마나 일치하는지 측정하는 점수 (나침반과 같은) 를 만들었습니다.
  • 결과: 때로는 나침반이 북쪽 (도움됨) 을 가리키고, 때로는 동쪽 (중립) 을, 때로는 남쪽 (해로움) 을 가리킵니다.

2. 큰 놀라움: 실수가 학습이 일어나는 곳

가장 일관된 발견은 교사가 견습생이 실패할 때 가장 도움이 된다는 것입니다.

  • 견습생이 막히거나 잘못된 길로 가고 있을 때: 교사의 조언은 폭풍 속의 등대와 같습니다. 그것은 정답을 강력하게 가리킵니다. "나침반"은 강한 일치를 보여줍니다.
  • 견습생이 이미 잘하고 있을 때: 교사의 조언은 소음스럽고 혼란스러워집니다. 이는 이미 완벽하게 달리고 있는 운동선수에게 코치가 지시를 외치는 것과 같습니다. 추가적인 소음은 실제로 그들을 늦추거나 스스로를 의심하게 만들 수 있습니다.

3. 한 가지 크기가 모두에게 맞지 않는다 ("이해 가능성" 규칙)

가장 좋은 가르침 방식은 완전히 견습생의 지능 수준퍼즐의 난이도에 달려 있습니다.

  • 작은 견습생 (0.6B 모델):

    • 만약 그들에게 거인 (대규모 외부 모델) 이 쓴 해법을 보여주면 혼란을 겪습니다. 거인의 사고 방식은 너무 복잡하기 때문입니다.
    • 최고 전략: 그들 자신 (또는 유사한 작은 모델) 이 정답을 맞힌 해법을 보여주세요. 그것은 그들이 이해할 수 있는 언어로 쓰여 있습니다.
    • 요약 대 상세: 그들은 완전한 단계별 이야기를 필요로 합니다. 해법을 너무 많이 요약하면 논리를 놓치게 됩니다.
  • 중간 견습생 (1.7B 모델):

    • 그들은 거인에게서 배울 만큼 충분히 똑똑합니다. 실제로 그들은 자신보다 거인에게서 더 잘 배우는 경우가 많습니다.
    • 요약 대 상세: 그들은 실제로 요약을 선호합니다. 그들은 불필요한 부분을 건너뛰고 핵심 논리로 바로 갈 수 있습니다.
  • 어려운 수학 퍼즐 (AIME):

    • 매우 어려운 수학 문제에서는 견습생에게 틀린 예시 (올바른 예시와 함께) 를 보여주는 것이 실제로 도움이 됩니다. 마치 "이런 실수는 하지 마라; 대신 저것을 하라"라고 말하는 것과 같습니다.
    • 더 쉬운 퍼즐에서는 틀린 예시를 보여주는 것은 단순히 소음일 뿐이며 성능을 해칩니다.

4. "스타일 대 실체" 문제

논문은 교사들이 종종 중요하지 않은 것들에서 학생과 이견을 보인다고 지적합니다.

  • 예시: 학생이 "그래서, 따라서..."라고 쓰면 교사는 "따라서..."를 선호합니다.
  • 문제: 표준 훈련은 이러한 스타일 교정을 논리 교정과 동일하게 취급합니다. 이는 실제로 수학 실수를 저질렀을 때 교사가 문법을 교정하는 것과 같습니다. 새로운 도구는 이러한 "스타일 이견"은 종종 가치가 0 인 반면, "논리 이견"은 금과도 같음을 보여줍니다.

5. 마법 같은 레시피는 없다

모든 상황에 작동하는 단일한 "최고의 교사"나 "최고의 맥락"은 없습니다.

  • 작은 모델을 쉬운 질문에 가르치고 있다면, 스스로 생성한 올바른 예시를 사용하세요.
  • 더 큰 모델을 어려운 수학 문제에 가르치고 있다면, 요약된 외부 예시를 사용하거나 심지어 무엇을 하지 말아야 하는지 보여주기 위해 틀린 예시를 포함시키세요.

요약 비유

교사를 GPS 로 생각하세요.

  • 당신이 잘못된 방향으로 운전하고 있다면, GPS 는 매우 도움이 되고 시급합니다.
  • 당신이 이미 올바른 고속도로를 완벽하게 운전하고 있다면, GPS 는 불필요한 우회로를 제시하거나 차선 선택에 대해 불평하기 시작하여 당신을 산만하게 만들 수 있습니다.
  • 또한, F1 레이싱카 (거대 모델) 를 위해 설계된 GPS 는 자전거 타는 사람 (작은 모델) 에게는 너무 복잡할 수 있습니다. 자전거 타는 사람은 실제로 읽을 수 있는 간단한 지도가 필요하지, 고도의 기술 데이터 스트림이 필요한 것이 아닙니다.

이 논문은 AI 를 효과적으로 훈련시키기 위해서는 "한 가지 크기가 모두에게 맞는다"는 접근 방식을 멈춰야 한다고 결론 내립니다. 대신, 우리는 모든 단어마다 교사의 조언이 실제로 목표를 향해 가리키는지 확인하고, 학생의 능력과 작업의 난이도에 따라 가르침 전략을 조정해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →