← 최신 논문
💬 NLP

Hybrid Policy Distillation for LLMs

이 논문은 기존 지식 증류 방법들을 토큰 수준의 재가중 로그 가능도 목적함수로 통합하여 해석하고, 정방향 및 역방향 KL 발산을 결합하고 오프-정책 데이터와 경량 온-정책 샘플링을 융합한 '하이브리드 정책 증류 (HPD)'를 제안하여 다양한 LLM 작업에서 최적화 안정성과 성능을 향상시켰음을 보여줍니다.

원저자: Wenhong Zhu, Ruobing Xie, Rui Wang, Pengfei Liu

게시일 2026-04-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Wenhong Zhu, Ruobing Xie, Rui Wang, Pengfei Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎓 비유: 거장 요리사 (선생님) vs. 초보 요리사 (학생)

상상해 보세요. 세계 최고의 요리사 (거대 AI, Teacher) 가 있습니다. 이 분은 어떤 재료를 넣어도 완벽한 요리를 만들어내죠. 하지만 이 분은 너무 비싸고, 주방이 너무 커서 모든 식당에서 쓸 수 없습니다.

그래서 우리는 **초보 요리사 (작은 AI, Student)**를 키워서 그 분의 실력을 대신하게 하려고 합니다. 이때 중요한 건 **"어떻게 가르칠 것인가"**입니다.

기존의 방법들은 두 가지 극단으로 나뉩니다:

  1. 단순 암기 (SFT): "이 요리는 소금 1 스푼, 후추 1 스푼!"이라고 정답만 외우게 하는 방식입니다.
    • 문제: 학생은 정답만 외우지, 왜 그 양을 넣었는지 이해하지 못합니다. 만약 재료가 조금 부족하면 당황해서 요리를 망칩니다. (너무 딱딱함)
  2. 완전 모방 (KL Divergence): 거장 요리사가 만든 모든 레시피와 맛의 미세한 차이까지 다 분석하게 하는 방식입니다.
    • 문제: 학생이 감당할 수 없는 양의 정보를 받아서 머리가 터질 수도 있고 (계산 비용 과다), 혹은 모든 맛을 다 섞으려다 보니 요리의 맛이 뭉개져서 평범해집니다. (너무 흐릿함)

💡 새로운 방법: HPD (하이브리드 정책 증류)

이 논문에서 제안한 **HPD(Hybrid Policy Distillation)**는 이 두 가지의 장점을 섞은 '현명한 코치' 같은 방법입니다.

1. "맞는 답"과 "틀린 답"을 동시에 가르칩니다.

기존 방법들은 보통 '정답'만 보여주거나, '학생이 만든 답'만 교정했습니다. 하지만 HPD 코치는 이렇게 합니다:

  • 정답 (Expert Token): 거장 요리사의 레시피를 보여주며 "이건 이렇게 해야 해!"라고 가르칩니다. (Forward KL: 다양한 가능성을 열어둠)
  • 실수 (Student Sampling): 학생이 직접 요리를 해보게 한 뒤, "이건 너무 짜네!"라고 지적합니다. (Reverse KL: 잘못된 길을 막음)

2. "무엇을 강조할지"를 상황에 따라 바꿉니다.

이게 HPD 의 가장 멋진 부분입니다. 코치는 학생의 상태를 보고 **가중치 (중요도)**를 실시간으로 조절합니다.

  • 학생이 정답을 너무 낮게 평가할 때 (예: "소금 1 스푼이 아니라 2 스푼이겠지?"): "아니야, 소금 1 스푼이 정답이야!"라고 강하게 가르칩니다.
  • 학생이 잘못된 답을 너무 높게 평가할 때 (예: "소금 10 스푼이 좋겠어!"): "그건 너무 짜! 그 맛을 줄이고 정답인 소금 1 스푼 쪽으로 집중해!"라고 억제합니다.

즉, 정답을 더 잘 찾게 유도하면서도, 학생이 엉뚱한 길로 빠지지 않게 막는 두 마리 토끼를 다 잡는 방식입니다.

🚀 왜 이 방법이 특별한가요?

  1. 계산이 훨씬 가볍습니다: 거장 요리사의 모든 레시피를 다 분석할 필요 없이, 중요한 부분만 골라 가르쳐도 됩니다. (기존 방법보다 빠르고 저렴함)
  2. 안정적입니다: 학생이 혼란스러워하지 않고, 차근차근 실력을 키워갑니다.
  3. 다양한 분야에서 잘 작동합니다:
    • 수학 문제 풀이: 복잡한 논리도 잘 따라갑니다.
    • 대화: 자연스러운 말투를 유지합니다.
    • 코딩: 정확한 프로그램을 작성합니다.

📊 실제 결과 (시험 성적)

실험 결과, HPD 를 쓴 작은 모델들은 기존 방법들보다 훨씬 좋은 성적을 냈습니다.

  • 특히 **30 억 파라미터 (작은 모델)**가 기존 70 억~80 억 파라미터 (큰 모델) 못지않은 수학 실력을 보여주기도 했습니다.
  • 마치 초보 요리사가 코치의 현명한 지도를 받아, 거장 요리사의 맛을 거의 그대로 재현해낸 것과 같습니다.

🏁 결론

이 논문은 "AI 를 작게 만들 때, 단순히 정답만 외우게 하거나, 모든 것을 다 가르치려 하지 말고, 학생이 어디를 잘못 알고 있는지 파악해서 정답을 강조하고 오답을 억제하는 '하이브리드' 방식으로 가르쳐야 한다"는 것을 증명했습니다.

이 방법은 앞으로 우리가 더 작고 빠르면서도 똑똑한 AI 를 만드는 데 큰 도움이 될 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →