← 최신 논문
🤖 machine learning

Knowledge Distillation from Large Reasoning Models to Compact Student Models: A Case Study on the John O Bryan Mathematics Competition

이 논문은 듀얼 에이전트 프레임워크와 조기 종료를 사용하여 DeepSeek-R1 교사 모델로부터 증류된 사고 사슬(Chain-of-Thought) 데이터로 소형 Qwen2.5-7B 학생 모델을 미세 조정하는 것이 John O'Bryan 수학 경시대회 및 MATH-500 벤치마크에서 정확도를 유의미하게 향상시키는 동시에, 응답 길이가 짧을수록 추론 품질이 저하된다는 상관관계를 밝혀냈음을 입증한다.

원저자: Gaurab Baral, Aaditya Khanal, Yangyang Tao, Junxiu Zhou

게시일 2026-07-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Gaurab Baral, Aaditya Khanal, Yangyang Tao, Junxiu Zhou

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게는 아주 뛰어나고 세계적인 수준의 수학 튜터(이름을 Professor DeepSeek이라고 부릅시다)가 있습니다. 그는 믿기지 않을 정도로 어려운 경시대х 문제를 풀 수 있습니다. 그는 매우 훌륭하지만, 덩치가 크고 느리며 거대한 슈퍼컴퓨터를 필요로 합니다. 당신은 이 작은, 더 빠르고, 더 저렴한 학생(이름을 Student Qwen이라고 부릅시다)에게 교수님처럼 생각하는 법을 가르쳐서, 그녀가 일반 노트북에서도 똑같은 일을 할 수 있게 만들고 싶습니다.

이 논문은 연구자들이 John O'Bryan Mathematics Competition(2011년부터 2025년까지 노던 켄터키 대학교에서 개최된 실제 대회)의 특정 수학 문제들을 사용하여 학생을 가르치려 했던 이야기입니다.

이 실험의 이야기를 다음과 같이 간단하게 나누어 설명합니다:

1. 훈련 방법: "풀이 과정을 보여라"

연구자들은 단순히 학생에게 정답만 알려주지 않았습니다. 그들은 **사고 사슬 증류(Chain-of-Thought Distillation)**라는 특별한 기법을 사용했습니다.

  • 교사: 먼저, "Professor DeepSeek"이 671개의 과거 경시대회 문제를 풀었습니다. 하지만 그는 단순히 답만 적는 대신, 마치 시험에서 풀이 과정을 적는 학생처럼 자신의 사고 단계를 하나하나 상세히 적었습니다.
  • 검증자: 두 번째 AI가 교수의 작업 내용을 확인하여 단계들이 실제로 올바른지 점검했습니다. 오직 완벽한 풀이만이 남겨졌습니다.
  • 학생: 그 후, "Student Qwen"(더 작은 모델)이 이러한 단계별 풀이를 모방하도록 훈련되었습니다.

2. "과잉 연습"의 함정

연구자들은 전형적인 문제인 **과적합(Overfitting)**에 직면했습니다.
연습 문제의 정답 자체를 암기해 버리는 학생을 상상해 보세요. 만약 약간 다른 문제가 주어지면, 그 학생은 실패합니다.

  • 연구자들은 처음에 학생이 1,000번의 "라운드"(반복) 동안 훈련하도록 허용했습니다.
  • 결과: 학생은 논리를 배우는 대신 훈련 문제의 특정 단어들을 암기하기 시작했습니다. 그녀의 성능은 오히려 새로운 문제에 대해 더 나빠졌습니다.
  • 해결책: 연구자들은 학생이 200 라운드에서 정점에 도달했다는 것을 깨달았습니다. 그 이후로는 그저 베끼고 있을 뿐이었습니다. 그래서 그들은 학생이 "신선함"과 일반화 능력을 유지할 수 있도록 훈련을 조기에 중단했습니다(200 라운드에서 중단).

3. 결과: 확실한 개선

훈련을 일찍 중단함으로써, 학생은 눈에 띄게 향상되었습니다:

  • 훈련 전: 학생은 경시대회 문제의 약 **65%**를 맞혔습니다.
  • 훈련 후: 그녀는 약 **69.4%**까지 뛰어올랐습니다.
  • 보너스: 그녀는 단순히 이 특정 문제들만 잘하게 된 것이 아닙니다. 그녀는 또 다른 유명한 수학 벤치마크인 MATH-500에서도 성적이 좋아졌는데, 이는 그녀가 단순히 정답을 외운 것이 아니라 실제 추론 기술을 배웠음을 증명합니다.

4. "단어 수" 실험

연구자들은 알고 싶었습니다: 학생에게 얼마나 많은 "생각 공간"이 필요한가?
그들은 학생에게 엄격한 단어 제한(시험에서의 엄격한 글자 수 제한과 같은)을 두어 문제를 풀도록 강제했습니다.

  • 제한 없음 (R1): 그녀는 약 220단어를 썼고 **69%**를 맞혔습니다.
  • 중간 제한 (R2): 그녀는 약 120단어를 썼고 정확도는 **62%**로 떨어졌습니다.
  • 엄격한 제한 (R6): 그녀는 단 약 31단어만 쓰도록 강요받았습니다. 그녀의 정확도는 **42%**로 폭락했습니다.

비유: 이것은 누군가에게 복잡한 퍼즐을 풀라고 하는 것과 같습니다. 만약 작은 메모장(적은 단어 수)을 준다면, 그들은 단계를 건너뛰고 추측해야 합니다. 만약 전체 노트(많은 단어 수)를 준다면, 그들은 논리를 써 내려가며 정답을 맞힐 수 있습니다. 연구는 이러한 어려운 문제들을 위해서는 좋은 답을 얻기 위해 약 50~100단어 정도의 "생각 공간"이 필요하다는 것을 발견했습니다.

5. 어려움을 겪은 부분

  • 속도 vs 논리: 학생은 "Two-Person Speed" 섹션에서 가장 약했습니다. 이 문제들은 빠른 다단계 계산을 요구합니다. 단어 수가 제한되었을 때, 그녀는 필요한 계산 단계를 모두 담을 수 없었고, 이로 인해 정확도가 다른 섹션보다 더 심하게 급락했습니다.
  • 형식 오류: 흥sa롭게도, 연구자들은 학생의 실수 중 약 **40%**가 수학 실력 때문이 아니라는 것을 발견했습니다. 그녀는 실제로 맞는 숫자를 구했지만, 그것을 지저분하게 적었습니다(예: 분수를 약분하지 않고 그대로 두거나, 답을 박스 안에 넣는 것을 잊어버림). 만약 인간이나 간단한 스크립트가 그녀의 글을 정리해 주었다면, 그녀의 점수는 훨씬 더 높았을 것입니다.

핵심 요약

이 논문은 거대하고 강력한 AI를 데려와서 더 작고 저렴한 AI에게 수학 문제를 효과적으로 추론하는 법을 가르칠 수 있다는 것을 증명합니다. 단, 암기를 시작하기 전에 훈련을 멈춘다면 말입니다.

하지만 주의할 점이 있습니다: 생각에는 공간이 필요합니다. 만약 AI가 너무 간결하게(너무 적은 단어로) 말하도록 강요한다면, 어려운 문제를 풀 수 있는 능력을 잃게 됩니다. 이러한 유형의 수학 경시대회를 위한 "최적의 지점(sweet spot)"은 AI가 약 50~100단어 정도의 추론을 써 내려갈 수 있는 충분한 여유를 주는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →