SR-OPSD: Self-Referenced On-Policy Self-Distillation
본 논문은 토큰 수준의 변분 특성화와 레니 엔트로피(Rényi divergence)를 통해 적응형 증류 대상(adaptive distillation target)을 투영 기하학(projection geometry)으로부터 분리함으로써 학습을 안정화하는 새로운 자기 참조 온-폴리시 자기 증류 프레임워크인 SR-OPSD를 제안하며, 이를 통해 다양한 LLM 태스크 전반에서 최첨단 성능을 달성한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 이야기를 쓰거나 수학 문제를 풀도록 가르치고 있다고 상상해 보세요. 당신은 단순히 로봇이 최종 정답을 맞히는 것만을 원하는 것이 아니라, 로봇이 단계별로 생각하는 방법을 배우기를 원합니다. 인공지능의 세계에서, 이는 종종 로봇이 시도하고, 실패하고, 그 후에 아주 작은 "보상"이나 "처벌"을 받는 방식으로 이루어집니다. 하지만 이것은 마치 학생이 시험을 치르고 나서, 어떤 특정 문장이나 계산이 실수를 유발했는지 전혀 모른 채 시험이 다 끝난 후에야 "B 학점"을 통보받는 것과 같습니다. 이를 해결하기 위해 연구자들은 "자기 증류(self-distillation)"라는 기술을 사용합니다. 이것은 로봇이 두 가지 역할을 동시에 수행하는 것과 같습니다. 바로 문제를 풀려고 노력하는 "학생"과, 학생의 작업을 지켜보며 매 단어마다 피드백을 주는 "선생님"(사실은 동일한 로봇이지만, 검증된 솔루션과 같은 추가적인 도움을 받는 상태)입니다. 그러면 학생은 선생님의 선택을 모방하려고 노력합니다.
문제는 이 선생님이 고정되어 있거나 완벽한 가이드가 아니라는 점입니다. 학생이 더 똑똑해짐에 따라, 선생님 또한 변하기 때문입니다. 왜냐하면 둘 다 동일하게 진화하는 뇌의 일부이기 때문입니다. 이것은 바람 때문에 목표물 자체가 움직이고 있는 상황에서 목표물을 맞히려는 것과 같습니다. 이 논문은 이 춤을 다루는 새로운 방법인 SR-OPSD를 소개합니다. 이 방법은 학생이 움직이는 목표물 때문에 혼란에 빠지지 않고 선생님으로부터 배울 수 있도록 돕는 특별한 수학적 "나침반"을 사용하여 학습을 안정적이고 효과적으로 만듭니다.
움직이는 목표물 문제
많은 AI 학습 방법에서 목표는 AI가 자신의 성공으로부터 배우게 함으로써 더 똑똑하게 만드는 것입니다. 이 논문은 "온폴리시 자기 증류(On-Policy Self-Distillation, OPSD)"라고 불리는 방법을 살펴보는 것으로 시작합니다. 학생이 시험을 치르는 상황을 상상해 보세요. OPSD에서 학생은 답안을 작성하고, 그러면 "자기-선생님"(정답의 힌트를 가진 상태로 답안을 바라보는 동일한 학생)이 "이 부분은 잘했지만, 저 단어는 조금 틀렸어"라고 말합니다. 그러면 학생은 미래의 답변을 선생님에게 맞추기 위해 조정합니다.
하지만 함정이 있습니다. 선생님은 고정된 책이 아닙니다. 선생님은 끊임없이 변화하는 학생의 버전입니다. 학생이 학습함에 따라 선생님도 변합니다. 만약 당신이 끊임없이 위치를 옮기는 선생님을 복제하려고 한다면, 결국 갈팡질팡하며 결코 좋은 답에 안착하지 못할 수도 있습니다. 이 논문은 단순히 표준적인 수학 도구로 이 움직이는 선생님을 맞추려 하는 것은 불안정성을 초-래할 수 있다고 제안합니다. 학생은 한 가지 사고방식에 너무 집중하여 창의성을 잃거나, 끊임없는 변화로 인해 혼란에 빠질 수 있습니다.
새로운 해결책: 고정된 닻과 유연한 나침반
저자들은 SR-OPSD(Self-Referenced On-Policy Self-Distillation)라는 새로운 방법을 제안합니다. 그들은 이 흔들림을 멈추기 위해서는 두 가지가 필요하다는 것을 깨달았습니다. 바로 붙잡을 수 있는 고정된 지점과 목표를 향해 움직일 수 있는 유연한 방법입니다.
- 고정된 닻 (참조 정책, Reference Policy): 학생은 움직이는 선생님만을 바라보는 대신, "참조(Reference)"에도 눈을 둡니다. 이것은 학생의 원래, 사전 학습된 자아—즉, 이 특정 학습을 시작하기 전의 모습—라고 생각하면 됩니다. 이 참조 모델은 등대 역할을 합니다. 선생님(움직이는 목표물)이 표류하더라도, 학생은 자신의 원래 견고한 토대로부터 너무 멀리 벗어나서는 안 된다는 것을 알게 됩니다. 이 새로운 방법은 선생님의 조언과 이 참조 모델을 혼합하여, 안정적이면서도 도움이 되는 "목표"를 만들어냅니다.
- 유연한 나침반 (레니 엔트로피 발산, Rényi Divergence): 일단 목표가 설정되면, 학생은 그곳을 향해 움직일 방법이 필요합니다. 이 논문은 **레니 발산(Rényi divergence)**이라는 수학적 도구를 사용합니다. 이것은 당신이 목표를 향해 얼마나 강하게 끌릴지를 조절하는 특별한 종류의 "자석" 또는 "나침반"이라고 생각할 수 있습니다.
- 만약 자석이 너무 강하면, 학생은 목표에 너무 빠르게 달라붙어 자신의 목소리를 잃을 수 있습니다.
- 만약 너무 약하면, 아무것도 배우지 못할 것입니다.
- 레니 도구의 묘미는 연구자들이 학생이 현재의 답변과 목표 사이의 차이에 어떻게 반응할지를 미세하게 조정할 수 있는 "노브(knob)"(차수 라고 불림)를 가지고 있다는 점입니다. 이를 통해 학생은 작업에 필요한 것에 따라 세부 사항에 민감하게 반응하거나 이를 무시할 수 있습니다.
연구 결과
연구진은 이 새로운 방법을 세 가지 매우 다른 유형의 작업에 대해 테스트했습니다:
- 과학 질문: 화학, 물리학, 생물학에 관한 까다로운 질문에 답하기.
- 수학적 추론: 정답만큼이나 단계가 중요한 어려운 수학 문제 풀기.
- 코딩: 실제로 작동하는 컴퓨터 프로그램 작성하기.
그들은 SR-OPSD를 매우 엄격한 선생님과 같은 표준 "역 KL(Reverse KL)" 및 보다 균형 잡혔지만 때때로 불안정한 선생님인 "젠슨-샤논 발산(Jensen-Shannon Divergence)"과 같은 기존 방법들과 비교했습니다.
결과:
- 안정성: 과학 및 수학 테스트에서 기존 방법들은 처음에 강세를 보이다가 시간이 지나면서 점점 악화되는 경-우가 많았습니다(마치 너무 빨리 질주하다가 쓰러지는 러너처럼). 그러나 SR-OPSD는 꾸준히 개선되었습니다. 예를 들어, 물리 벤치마크에서 새로운 방법은 특정 지표인 Avg@16을 기준으로 81.1의 정확도에 도달한 반면, 기존 방법들은 79.4 혹은 그 이하에 머물렀습니다.
- 수학 숙련도: 어려운 수학 경시 대회(AIME 및 HMT와 같은)에서 새로운 방법은 AI가 더 많은 문제를 정확하게 풀도록 도왔습니다. 예를 들어, AIME 2025 테스트에서 새로운 방법은 인기 있는 베이스라인 방법인 GRPO와 비교했을 때 "Pass" 비율(정답을 맞히는 비율)을 6.7 퍼센트 포인트 개선했습니다.
- 코딩: AI에게 코드를 작성하도록 가르칠 때, 새로운 방법은 AI 모델이 커질수록 더 잘 작동했습니다. 테스트된 가장 큰 모델인 Qwen3-8B의 경우, 새로운 방법은 이전 최고 점수인 48.8을 넘어 50.1을 달성했습니다.
이것이 중요한 이유
이 논문은 AI가 자신의 실수로부터 배우게 만드는 비결이 단순히 더 나은 선생님을 갖는 것이 아니라, 학생을 그 선생님과 어떻게 연결하느냐에 달려 있다는 점을 시사합니다. 학습 과정을 안정적인 "참조(Reference)"에 고정하고 유연한 "나침반"(레니 발산)을 사용함으로써, AI는 혼란을 겪거나 길을 잃지 않고 복잡한 기술을 배울 수 있습니다.
저자들은 단순히 참조점을 추가하는 것만으로는 충분하지 않으며, 잘못된 수학적 도구와 결합될 경우 오히려 상황을 악화시킨다는 것을 발견했습니다. 하지만 그들이 참조 모델을 새로운 유연한 나침반과 결합했을 때, 결과는 일관되게 더 좋았습니다. 이는 AI가 진정으로 복잡한 추론을 마스터하기 위해서는 새로운 피드백의 흥분과 원래 지식의 안정성 사이에서 균형을 잡는 학습 방법이 필요함을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.