← 최신 논문
💬 NLP

SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning

이 논문은 공유된 텍스트 스팬을 정렬하고 학생 참조 KL 손실(student reference KL loss)을 채택하여 강력한 교사 모델로부터 짧은 문맥의 학생 모델로 긴 문맥의 증명 추론 능력을 효과적으로 전이함으로써 수학 및 과학 벤치마크에서 상당한 성능 향상을 달나 성취하는 토크나이저 불가지론적 온폴리시 증류 프레임워크인 SimpleOPD를 소개한다.

원저자: Haonan He, Haodi Lei, Yun Luo, Haoran Zhang, Shunkai Zhang, Yizhuo Li, Shengji Tang, Zhilin Wang, Runzhe Zhan, Lei Bai, Ganqu Cui, Fangchen Yu, Yafu Li, Peng Ye, Ning Ding, Yu Cheng

게시일 2026-08-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Haonan He, Haodi Lei, Yun Luo, Haoran Zhang, Shunkai Zhang, Yizhuo Li, Shengji Tang, Zhilin Wang, Runzhe Zhan, Lei Bai, Ganqu Cui, Fangchen Yu, Yafu Li, Peng Ye, Ning Ding, Yu Cheng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑하지만 말이 너무 많은 교수님에게, 아주 작은 수첩 하나만을 가진 재치 있는 학생에게 복잡한 아이디어를 설명하는 법을 가르치고 있다고 상상해 보십시오. 이것이 바로 인공지능, 구체적으로는 "거대 언어 모델(LLM)"의 세계입니다. 이들은 인간의 언어를 이해하고 생성하도록 훈련된 컴퓨터 프로그램입니다. 때때로 우리는 수학 증명과 같은 어려운 문제를 푸는 데 매우 뛰어난 '교사(teacher)' 모델을 갖게 되는데, 이 모델은 거대하고 방대한 문장으로 생각합니다. 반면, 우리는 더 작고 빠르며 기억력이 짧은 '학생(student)' 모델을 가지고 있습니다. 목표는 교사의 영리함을 학생에게 전수하는 것입니다.

오랫동안 과학자들은 교사가 답안을 작성하면 학생이 그것을 단순히 베껴 쓰는 방식으로 이 일을 수행하려 노력했습니다. 하지만 이는 단어의 의미를 이해하지 못한 채 사전 전체를 암기하라고 요구하는 것과 같습니다. 이는 항상 생각하는 법을 가르쳐주지는 못합니다. "온-폴리시 디스틸레이션(On-Policy Distillation, OPD)"이라 불리는 더 새롭고 똑똑한 방법은 판도를 바꾸어 놓았습니다. 학생이 단순히 베끼는 대신, 학생이 문제를 풀려고 시도하면 교사가 실시간으로 학생의 사고 과정을 지켜보며 매 단계마다 교정과 지도를 제공하는 방식입니다. 이는 마치 코치가 완벽한 달리기 영상을 나중에 보여주는 것이 아니라, 선수가 달릴 때 옆에 서서 자세를 교정해 주는 것과 같습니다. 그러나 여기에는 함정이 있습니다. 만약 교사와 학생이 서로 다른 "언어"(단어를 조각내는 방식인 '토크나이저')를 사용하거나, 교사는 소설을 쓰는 데 익숙한데 학생은 트윗 한 줄 정도의 공간밖에 없다면, 코칭은 잘못될 수 있습니다. 학생은 혼란에 빠지거나, 끝없이 말을 늘어놓기 시작하거나, 명령어가 공간에 맞지 않아 충돌이 발생할 수 있습니다.

SimpleOPD라는 제목의 이 논문은 정확히 이 난감한 상황을 다룹니다. 연구진은 수학 증명에 탁월한 초거대 장문 맥락 교사 모델(SU-01)을 사용하여, 완전히 다른 내부 "언어"(토크나이저)를 사용하거나 훨씬 짧은 기억력 제한을 가진 다양한 작은 학생 모델들을 가르치고자 했습니다. 그들은 단순히 교사가 학생을 코칭하게 두는 것이 종종 역효과를 낸다는 것을 발견했습니다. 학생은 압도당하여 응답이 통제 불능으로 길어지는 현상("길이 폭발")을 보였고, 결국 공간이 부족해져 답변을 완성하기도 전에 스스로 끊어버리게 되었습니다.

이를 해결하기 위해 팀은 영리한 "토크나이저 불가지론적(tokenizer-agnostic)" 접근 방식을 발명했습니다. 교사와 학생이 정확히 어떤 단어 조각을 보고 있는지에 대해 합의하도록 강요하는 대신, 그들은 페이지 위의 실제 텍스트를 보기로 합의했습니다. 만약 교사가 "math"라고 말하고 학생이 "mat"과 "h"라고 말한다면, 이들이 동일한 소리를 쓰는 서로 다른 방식일 뿐이라는 점을 깨달은 것입니다. 그들은 기술적인 차이를 무시하고 공유된 텍스트를 기반으로 학습을 정렬했습니다. 하지만 여기서 멈추지 않았습니다. 학생들이 횡설수설하는 것을 막기 위해 두 가지 안전망을 도입했습니다. 첫째, 교사에게 언제 말을 멈출지에 대해 학생을 괴롭히지 말라고 지시했습니다(특정 "중단(stop)" 토큰을 무시함). 이를 통해 학생이 언제 끝내야 할지 혼란스러워하지 않도록 했습니다. 둘째, 학생이 원래의 합리적인 모습에서 너무 멀어지지 않도록 주의를 주는 부드러운 "현실 점검(KL loss)"을 추가하여, 학생이 제멋대로 끝없는 루프에 빠지는 것을 방지했습니다.

결과는 인상적이었습니다. 이 방법을 사용함으로써 학생 모델들은 단순히 베끼는 것을 넘어, 추론하는 법을 배웠습니다. 예를 들어, 한 학생 모델인 Intern-S2-Preview는 어려운 수학 증명 테스트(ProofBench)에서 점수가 21.70에서 44.50으로 22.8포인트 급등했습니다. Gemini-2.5-Pro를 심사위원으로 사용하는 특정 평가 설정에서, 이 모델은 34.0에서 55.2로 더욱 큰 상승을 보였습니다. 이 향상은 매우 유의미하여 Gemini-2.5-Pro와 같은 매우 강력한 폐쇄형 모델의 성능을 능가했습니다. 이 논문은 이 기술이 수학뿐만 아니라, 학생들이 보지 못한 과학 문제로 새로운 기술을 일반화하는 데에도 도움이 된다는 것을 시사합니다. 본질적으로, SimpleOPD는 공유된 텍스트 공간과 끝없이 말하는 것을 방지하기 위한 몇 가지 규칙만 있다면, 작은 짧은 기억력의 뇌가 거대하고 말이 많은 천재처럼 생각하도록 가르칠 수 있음을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →