← 최신 논문
🤖 machine learning

Asymmetric On-Policy Distillation: Bridging Exploitation and Imitation at the Token Level

본 논문은 비효과적인 부정적 강화 학습을 지역적 발산 최소화로 대체함으로써 표준 온-정책 증류의 구조적 약점을 해결하고, 더 높은 정책 엔트로피를 유지하면서 수학적 추론 및 도구 사용 적응에서 우수한 성능을 달성하는 새로운 훈련 프레임워크인 비대칭 온-정책 증류 (AOPD) 를 제안한다.

원저자: Nan Jia, Haojin Yang, Xing Ma, Jiesong Lian, Shuailiang Zhang, Weipeng Zhang, Ke Zeng, Xunliang Cai, Zequn Sun

게시일 2026-05-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Nan Jia, Haojin Yang, Xing Ma, Jiesong Lian, Shuailiang Zhang, Weipeng Zhang, Ke Zeng, Xunliang Cai, Zequn Sun

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

어린 견습생 ("학생" AI) 이 고수 ("교사" AI) 를 관찰하며 복잡한 수학 퍼즐을 푸는 법을 배우는 상황을 상상해 보세요.

오랫동안 이 작업을 수행하는 표준적인 방법은 견습생이 퍼즐을 스스로 풀어보게 하는 것이었습니다. 한 단계씩 올바르게 풀면 교사는 하이파이브를 해주고, 잘못 풀면 엄하게 "아니오"라고 말했죠. 이를 **온-정책 증류 (On-Policy Distillation)**라고 합니다.

하지만 이 논문의 저자들은 이러한 "하이파이브 또는 아니오" 방식이 학습을 느리게 하고 좌절스럽게 만드는 세 가지 주요 결함이 있음을 발견했습니다.

  1. "비명" 문제 (높은 분산): 견습생이 매우 나쁜 실수를 할 때, 교사의 "아니오"는 너무 크고 가혹합니다 (수학적으로 말해 신호가 매우 크고 무제한입니다). 이는 견습생을 겁먹게 만듭니다. 견습생은 구체적인 교정을 배우는 대신 혼란을 겪으며 사고 과정에서 예측 불가능한 급격한 변화를 겪게 됩니다.
  2. "침묵" 문제 (기울기 소실): 대부분의 시간 동안 견습생의 단계는 그저 "그럭저럭"입니다. 훌륭하지도, 끔찍하지도 않죠. 구식 시스템에서는 교사가 중립적인 "흠" 신호를 보냅니다. 이 신호가 너무 약하기 때문에, 교사가 실제로 더 나은 방법이 있음에도 불구하고 견습생은 이러한 순간들로부터 아무것도 배우지 못합니다. 학습 과정이 멈추게 됩니다.
  3. "블라인드 스폿" 문제 (탐색의 블랙홀): 견습생이 막다른 길에 빠졌을 때, 구식 시스템은 그 방향으로 가지 말라고만 알려줄 뿐, 대신 어디로 가야 하는지는 알려주지 않습니다. 견습생은 올바른 길이 존재한다는 사실조차 모른 채 빙글빙글 돌며 새로운 경로를 맹목적으로 추측하게 됩니다.

해결책: AOPD ("스마트 튜터" 접근법)

이 논문은 **비대칭 온-정책 증류 (Asymmetric On-Policy Distillation, AOPD)**라는 새로운 방법을 제안합니다. 이는 상황에 따라 교수 스타일을 바꾸는 튜터라고 생각하시면 됩니다.

모든 상황에 동일한 "하이파이브/아니오" 규칙을 적용하는 대신, AOPD 는 두 가지 다른 모드를 사용합니다.

  • 모드 1: 응원단 (활용): 견습생이 교사가 좋아하는 일을 할 때 ("긍정적인" 단계), 시스템은 구식 방법처럼 작동합니다. "잘했어! 정확히 그걸 계속 해!"라고 말하며 좋은 행동을 강화합니다.
  • 모드 2: GPS (모방): 견습생이 막히거나 실수를 하거나 그저 "그럭저럭"한 일을 할 때 (비긍정적 단계), 시스템은 가혹한 "아니오"와 약한 "흠" 신호를 중단합니다. 대신 즉시 지도를 꺼내 보여줍니다. "추측을 멈춰. 교사의 지도를 봐. 이 특정 지점에서 교사가 취할 정확한 경로가 여기 있어"라고 말하죠.

왜 이것이 더 잘 작동하는가

저자들은 다양한 크기의 AI 모델을 사용하여 어려운 수학 경시대회 (AIME 및 HMMT 등) 에서 이를 테스트했습니다. 그들이 발견한 바는 다음과 같습니다.

  • 더 똑똑한 학습: 상황이 어려워질 때 "GPS" 모드로 전환함으로써, 견습생은 큰 실수에 겁먹거나 중립적인 상황에 지루해하지 않습니다. 그들이 필요로 할 때 정확하고 도움이 되는 지시를 받습니다.
  • 더 빠르고 강력함: 새로운 방법은 일관되게 구식 "하이파이브/아니오" 방법을 능가했습니다. 실제로 견습생이 약한 기술로 시작했을 때 ("약한 초기화"), 새로운 방법은 그들이 훨씬 빠르게 따라잡도록 도와주어 구식 방법보다 약 8% 더 많은 정답을 얻게 했습니다.
  • 더 나은 기억력: 견습생이 수학을 마스터한 후 새로운 기술 (예: 도구 사용) 을 배울 때, 구식 방법은 수학 기술을 잊게 만들었습니다. 반면 새로운 방법 (AOPD) 은 유연한 스펀지처럼, 이미 가지고 있던 수학 지식을 지우지 않고 새로운 도구 기술을 학습했습니다.

큰 그림

간단히 말해, 이 논문은 모든 학습 순간을 동일하게 취급해서는 안 된다고 주장합니다.

  • 일이 잘 풀릴 때는 학생이 스스로 계속 탐색하도록 격려해야 합니다.
  • 일이 잘 풀리지 않거나 그저 "그럭저럭"할 때는 추측 게임을 중단하고 학생에게 교사의 더 나은 방법을 직접 보여줘야 합니다.

적절한 순간에 "스스로 시도하게 하기"와 "정답을 보여주기"를 적절히 섞음으로써, AI 는 더 빠르게 학습하고 실수를 줄이며 배운 내용을 더 잘 기억하게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →