← 최신 논문
🤖 machine learning

WDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-Training

이 논문은 앵커 롤아웃 정책과 보조 평가 정책을 역 KL 발산을 통해 고정된 교사 모델에 맞추도록 공동 학습시킴으로써 온-폴리시 증류를 안정화하는 혼합 제약 공동 학습 방법인 WDL-OPD를 소개하며, 이는 기존의 단일 정책 접근 방식들과 비교하여 수학적 추론 및 코드 생성 작업에서 최첨단 성능을 달성한다.

원저자: Zehao Chen, Gongxun Li, Tianxiang Ai, Yifei Li, Zixuan Huang, Wang Zhou, Tao Huang, Fuzhen Zhuang, Xianglong Liu, Jianxin Li, Deqing Wang, Yikun Ban

게시일 2026-08-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zehao Chen, Gongxun Li, Tianxiang Ai, Yifei Li, Zixuan Huang, Wang Zhou, Tao Huang, Fuzhen Zhuang, Xianglong Liu, Jianxin Li, Deqing Wang, Yikun Ban

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

완벽한 케이크를 굽는 법을 어린 도제에게 가르치려 한다고 상상해 보세요. 옛날 방식이라면, 당신은 숙련된 요리사가 쓴 레시피 북을 건네주며 그것을 암기하라고 말했을 것입니다. 하지만 문제가 하나 있습니다. 도제는 자신이 자신의 주방에서 찾을 수 있는 재료들로만 연습하게 되는데, 그 재료들은 요리사의 고급 식료품 저장고와는 매우 다를 수 있습니다. 이러한 불일치는 도제가 마침내 실제 세상에서 케이크를 구우려고 할 때 혼란을 야기합니다.

인공지능의 세계에서, 이것을 "증류(distillation)"라고 부릅니다. 우리는 거대하고 매우 똑똑한 AI(스승)로부터 작은, 더 빠른 AI(학생)를 가르치려고 노력합니다. 보통 학생은 스승의 완벽한 정답으로부터 배웁니다. 하지만 "온폴리시 증류(On-Policy Distillation, OPD)"라는 더 새롭고 똑똑한 방법은 게임의 판도를 바꿉니다. OPD에서 학생은 자신의 시도 자체로부터 배우며, 스승은 그 특정 시도들을 실시간으로 교정해 줍니다. 이는 마치 도제가 자신만의 엉망진창인 케이크를 굽고 있으면, 요리사가 개입하여 바로 '그 특정 케이크'를 고쳐주는 것과 같습니다. 문제는 이 과정이 불안정해질 수 있다는 점입니다. 학생이 조금 배울 때마다 학생의 굽는 방식이 변하고, 이는 다시 요리사가 무엇을 교정해야 하는지를 변화시켜, 학생을 더 낫게 만드는 대신 오히려 더 나쁘게 만드는 요동치는 피드백 루프를 만들어냅니다.

이 논문은 이 요동을 해결하기 위해 WDL-OPD라는 새로운 방법을 소개합니다. 단 한 명의 학생이 스승으로부터 배우는 대신, 연구자들은 함께 협력하는 두 명의 학생 팀을 구성했습니다. 한 학생인 "앵커(Anchor)"가 모든 베이킹(연습 문제 생성)을 수행합니다. 두 번째 학생인 "보조(Auxiliary)"는 동일한 베이킹 과정을 지켜보되 직접 작업은 하지 않습니다. 두 학생 모두 스승의 교정을 살펴보지만, 그들은 자신들의 아이디어를 서로 혼합하여 최선의 학습 방법을 찾아냅니다. 이것은 마치 리더가 스텝을 이끌지만, 파트너가 리듬의 균형을 잡도록 돕는 댄스 듀오와 같습니다. 만약 리더가 비틀거리면, 파트너가 그 충격을 흡수하여 전체 안무가 무너지지 않도록 하는 것입니다.

연구자들은 이 아이디어를 수학 문제 풀기와 컴퓨터 코드 작성이라는 두 가지 유형의 AI 작업에 테스트했습니다. 그들은 17억 개에서 40억 개의 "뇌 세포"(파라미터)를 가진 모델들을 사용했습니다. 결과는 유망했지만 마법 같은 수준은 아니었습니다. 수학 테스트에서, 이 새로운 두 명의 학생 팀은 그들이 본 것 중 가장 똑똑한 학생 AI를 만들어냈습니다. 예를 들어, MATH500이라는 어려운 수학 테스트에서 40억 파라미터 규모의 학생은 이전 최고 기록인 63.0%에서 크게 뛰어올라 68.5%의 정답률을 기록했습니다. 17억 파라미터 버전에서도 52.1%에서 58.5%로 상승했습니다.

하지만 이야기는 코드 작성 테스트에서 더욱 흥ло로워집니다. 이 실험에서 단일 학생 방식(기존 방식)은 완전히 무너졌습니다. AI가 반복적인 패턴을 보이거나 혼란에 빠지는 "엔트로피 증가" 현상이 나타났습니다. 그러나 두 명의 학생 팀은 안정성을 유지하며 작동 가능한 코드 작성 AI를 만들어냈으며, 이 모델은 표준 테스트에서 0.637점을 기록했습니다. 반면 단일 학생 시도는 사용 가능한 결과를 전혀 만들어내지 못했습니다.

저자들은 이 방법이 효과적인 유일한 이유를 입증한 것은 아니라고 신중하게 밝히고 있습니다. 그들은 하나의 가설을 제시합니다: 아마도 두 번째 학생이 "충격 흡수 장치" 역할을 하여, 메인 학생이 너무 급격하게 혹은 과도하게 행동을 바꾸지 않도록 학습의 무게를 나누어 가짐으로써 학습 과정을 안정적으로 유지한다는 것입니다. 하지만 그들은 모든 조건이 동일한 상태에서 학생 수만 다르게 설정한 완벽하게 공정한 대조 실험을 수행하지 않았기 때문에, 이에 대해 100% 확신할 수는 없다고 인정합니다. 또한, 두 모델을 동시에 훈련하기 때문에 더 많은 컴퓨터 자원이 소모된다는 점도 언급했습니다.

요약하자면, 이 논문은 학습 과정에 "조력자" 학생을 추가하는 것이 AI 훈련을 더 안정적이고 효과적으로 만들 수 있음을 시사하며, 특히 AI가 코딩이나 고급 수학 같은 어려운 과제를 수행할 때 그러합니다. 이 논문은 AI 훈련의 모든 문제를 해결했다고 주장하는 것이 아니라, 적어도 이 특정 테스트에서 학습 과정이 붕괴되는 것을 막아주는 새롭고 흥미로운 도구를 제안하고 있습니다. 저자들은 다음 단계로, 두 뇌의 이점이 훈련 설정의 다른 요소들과 어떻게 다른지 분리하여, 왜 두 명의 학생 팀이 그렇게 잘 작동하는지를 정확히 증명하기 위한 더 통제된 실험을 수행할 것이라고 믿고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →