-OPSD: Deriving with Policy Optimization, Training with Self-Distillation
본 논문은 KL 페널티 가중치 를 조절 가능한 파라미터로 취급함으로써 온-폴리시 자기 증류(on-policy self-distillation)를 일반화하고, 로짓 믹싱(logit mixing)을 통해 참조 모델과 교사 모델 사이의 최적 정책 보간을 근사하여 효율적인 학습을 가능하게 함으로써 기존의 vanilla OPSD 대비 안정성과 추론 성능을 크게 향상시킨 원칙적인 프레임워크인 -OPSD를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 까다로운 수학 문제를 푸는 법을 가르치고 있다고 상상해 보세요. 당신에게는 로봇의 학습을 돕는 두 가지 방법이 있습니다. 첫 번째 방법은 로봇이 직접 시도하고, 실패한 뒤에, 당신이 완벽한 해답을 보여주며 모든 단계를 암기하도록 하는 것입니다. 이것은 학생이 선생님의 숙제를 베끼는 것과 같습니다. 두 번째 방법은 로봇이 시도하게 한 뒤, 정답지를 볼 수 있는 '슈퍼 선생님'을 사용하여 로봇이 쓰는 모든 단어 하나하나에 대해 즉각적인 피드백을 주는 것입니다. 이것은 '온-폴리시 셀프-디스틸레이션(on-policy self-distillation)'이라고 불립니다. 이 방법은 강력한데, 왜냐하면 선생님이 로봇의 구체적인 실수에 실시간으로 반응하기 때문입니다. 하지만 여기 함정이 있습니다. 이 방법은 종종 매우 취약합니다. 만약 당신이 로봇에게 슈퍼 선생님을 너무 강하게 따라 하라고 압박하면, 로봇은 혼란에 빠져 이미 알고 있던 것을 잊어버리고 터무니없는 추측을 하기 시작할 수 있습니다. 이는 마치 천재를 너무 완벽하게 흉내 내려고 하다가 자신의 목소리를 잃고 스스로 생각하는 법을 멈춰버린 학생과 같습니다. 과학자들은 질문합니다: 어떻게 하면 학생의 자신감을 꺾지 않으면서 슈퍼 선생님의 이점을 얻을 수 있을까?
새로운 논문은 β-OPSD라는 영리한 해결책을 소개합니다. 연구진은 표준적인 슈퍼 선생님 활용 방식이 사실 훨씬 더 큰 범주의 방법 중 하나의 극단적인 설정일 뿐이라는 점을 깨달았습니다. 그들은 로봇이 슈퍼 선생님의 말에 얼마나 귀를 기울일지, 아니면 자신의 현재 스타일을 얼마나 고수할지를 조절하는 '다이얼'(β라고 불림)을 발견했습니다. 로봇에게 선생님의 수준으로 바로 뛰어들라고 강요하는 대신, 그들은 로봇의 현재 모습과 슈퍼 선생님 사이의 부드러운 경로를 만드는 방법을 찾아냈습니다. 이 방법은 로봇이 자신의 현재 상태와 슈퍼 선생님 사이의 간극을 메우도록 유도합니다. 또한 그들은 두 번째 문제도 해결했습니다. 문장의 초반부에서 로봇이 실수를 하면, 그것이 뒤따르는 모든 단어에 영향을 미친다는 점입니다. 기존 방식은 즉각적인 실수만을 보았지만, 새로운 방식은 전체 여정을 바라보며 초기 단어가 최종 결과에 어떤 영향을 미쳤는지에 따라 공로(또는 책임)를 부여합니다. 부드러운 학습 경로와 '앞을 내다보는(look-ahead)' 크레딧 시스템을 결합함으로써, 로봇은 이전보다 더 안정적으로 학습하고 수학 문제를 더 잘 풀게 되었습니다.
문제점: "너무 어려운" 선생님
AI의 세계에서 모델을 더 똑똑하게 만드는 과정에는 온-폴리시 셀프-디스틸레이션이라는 과정이 포함되곤 합니다. 학생(AI 모델)이 이야기를 쓰거나 수학 문제를 풀고 있다고 상상해 보세요. 학생이 글을 써 내려가는 동안, '특권적인 선생님'(더 똑똑한 버전의 모델이거나 정답지에 접근할 수 있는 모델)이 지켜보며 "아니, 이 단어는 이 단어가 되어야 해"라고 말합니다. 그러면 학생은 선생님의 선택을 복제하려고 노력합니다.
문제는 이 선생님이 너무 뛰어나다는 것입니다. 만약 학생이 즉시 선생님의 완벽한 답을 복사하려고 한다면, 그것은 마치 걷기도 전에 마라톤을 뛰려는 것과 같습니다. 학생은 압도당하고, 학습은 불안정해지며, 로봇은 이상하고 무작위적인 실수를 하기 시작할 수 있습니다. 연구진은 표준적인 방식이 본질적으로 학생이 시작부터 선생님과 완벽하게 일치하도록 강요하는 것이며, 이는 매우 취약한 학습 방식이라는 것을 발견했습니다.
해결책: 부드러운 학습 곡선
논문의 저자인 자이웨이 쉬(Jiawei Xu), 밍후이 리우(Minghui Liu)와 메릴랜드 대학교 팀은 이에 대한 새로운 사고방식을 제안했습니다. 그들은 표준적인 방식이 더 넓은 학습 전략 가족의 한 가지 특정 설정일 뿐이라는 점을 깨달았습니다. 그들은 선생님의 지도력을 조절하는 볼륨 노브 역할을 하는 변수 β(베타)를 도입했습니다.
- β가 낮을 때 (또 또는 1일 때): 학생은 선생님을 정확하게 복제하려고 노력합니다. 이것이 기존의 취약한 방식입니다.
- β가 높을 때: 학생은 자신의 현재 스타일에 더 가깝게 머물 수 있으며, 선생님의 스타일을 향해 서서히 표류하도록 허용됩니다.
논문은 학습의 가장 완벽한 방법이 선생님에게 바로 뛰어드는 것이 아니라는 점을 보여줍니다. 대신 가장 좋은 경로는 **기하학적 보간(geometric interpolation)**입니다. 이것은 GPS 경로와 같습니다. 기존 방식은 학생을 선생님의 위치로 직접 순간 이동시키려 했습니다. 새로운 방식인 β-OPSD는 학생의 현재 위치와 선생님의 위치 사이에 부드러운 도로를 그립니다.
학습이 진행됨에 따라, 연구진은 β 값을 '스케줄링'합니다. 그들은 목표를 학생과 매우 가까운 곳(안전하고 쉬운 단계)에서 시작하여, 점차 선생님과 더 비슷하게(도전적이고 똑똑한 단계) 이동시킵니다. 이는 게임 플레이어를 첫날부터 가장 어려운 레벨에 던져 넣는 대신, '쉬움' 모드로 시작하여 서서히 '어려움' 모드로 난이도를 높이는 비디오 게임과 같습니다.
핵심 비결: 앞을 내다보기
퍼즐의 마지막 조각이 하나 더 있었습니다. 기존 방식에서는 학생이 문장의 첫 단어에서 실수를 하면, 시스템은 오직 그 특정 단어만을 탓했습니다. 하지만 언어에서는 첫 단어가 뒤따르는 모든 단어의 맥락을 바꿉니다. 만약 문장을 "그 고양이가(The cat)"로 시작한다면, 다음 단어는 "피자"가 아니라 "앉았다(sat)"나 "달렸다(ran)"가 될 가능성이 높습니다.
연구진은 기존 방식이 '근시안적(myopic)'이라는 점을 깨달았습니다. 즉, 초기 실수가 전체 문장을 망칠 수 있다는 점을 인지하지 못했다는 것입니다. 이를 해결하기 위해 그들은 리턴 투 고(return-to-go) 크레딧 할당 방식을 추가했습니다.
체스를 두고 있다고 상상해 보세요. 만약 3번째 차례에 나쁜 수를 둔다면, 당신이 게임에서 질 때까지는 20번째 차례가 될 수도 있습니다. 기존 방식은 20번째 차례만을 탓할 것입니다. 새로운 방식은 되돌아보며 이렇게 말합니다. "이봐, 3번째 수가 진짜 문제였어. 왜냐하면 그 수가 결국 이 참사를 초래했기 때문이야." 이처럼 초기 토큰이 최종 결과에 어떤 영향을 미쳤는지에 따라 공로(또는 책임)를 부여함으로써, 모델은 첫 단어부터 더 주의 깊게 행동하는 법을 배웁니다.
연구 결과
연구팀은 이 새로운 β-OPSD 방식을 AI의 수학 문제 올림픽이라 할 수 있는 수학적 추론 벤치마크에서 테스트했습니다. 그들은 17억 개(1.7B)에서 80억 개(8B) 파라미터에 이르는 다양한 규모의 모델을 사용했습니다.
결과는 유망했습니다. Qwen3-1.7B 모델의 경우, 이 새로운 방식은 기존 방식과 비교했을 때 AIME 2024 수학 경시 대회에서 평균 점수를 9.16 퍼센트 포인트 향상시켰습니다. 또한 AIME 2025 및 HMMT 2025와 같은 까다로운 테스트에서도 개선을 보였습니다. 더 큰 모델에서도 새로운 방식은 기존 방식을 지속적으로 능가했으며, 이는 부드러운 학습 경로와 '앞을 내다보는' 크레딧 시스템이 모델의 크기와 관계없이 잘 작동함을 보여주었습니다.
연구진은 이 접근 방식이 단순한 복제에서 복잡한 최적화로 가는 '원칙적인 경로'를 제공한다고 제안합니다. 이는 비용이 많이 들고 느린 강화 학습 기법을 필요로 하지 않습니다. 대신, 정책 최적화(policy optimization)의 스마트한 수학을 사용하여 AI 모델이 추론하는 법을 가르치는 더 좋고, 더 저렴하며, 더 안정적인 방법을 만들어냅로 합니다. 딱딱하고 취약한 과정을 부드럽고 안내된 여정으로 바꿈으로써, 그들은 로봇을 더 나은 학생으로 만들었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.