QED-Nano: Teaching a Tiny Model to Prove Hard Theorems
이 논문은 DeepSeek-Math-V2 에서의 증류, 루브릭 기반 강화학습, 그리고 추론 캐시를 활용한 반복적 요약 - 정제 사이클이라는 3 단계 학습 파이프라인을 통해 4B 규모의 소형 오픈 모델인 QED-Nano 를 개발하여, 훨씬 더 큰 오픈 모델들을 능가하고 독점 모델에 필적하는 수학 올림피아드 증명 성능을 달성했다고 주장합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
QED-Nano: 작은 천재가 수학 올림피아드를 정복하다
이 논문은 **"작은 인공지능 (AI) 모델로도 세계적인 수학 경시대회 (IMO) 수준의 어려운 문제를 풀 수 있을까?"**라는 질문에 대한 답을 제시합니다.
기존의 거대 AI(수천 억 개의 파라미터를 가진 모델) 는 비싸고, 어떻게 작동하는지 알 수 없으며, 재현하기 어렵습니다. 이 연구팀은 **"작고, 저렴하며, 누구나 열 수 있는 (오픈소스) 40 억 파라미터 모델인 'QED-Nano'를 만들어, 거대 모델들과 맞먹는 수학 증명 능력을 갖게 했다"**고 선언합니다.
이 복잡한 내용을 일상적인 비유로 쉽게 설명해 드리겠습니다.
1. 문제 상황: 거인 vs. 작은 천재
- 기존의 거대 모델 (Gemini 3 Pro, DeepSeek 등): 마치 수천 명의 수학자 팀이 모여서 문제를 푸는 것과 같습니다. 엄청나게 강력하지만, 팀을 유지하는 비용이 천문학적이고, 그들이 어떻게 문제를 풀었는지 그 과정 (레시피) 을 알 수 없습니다.
- QED-Nano (4B 모델): 마치 재능 있는 고등학생 1 명입니다. 팀원 수는 적지만, 올바른 훈련을 받으면 거인 팀 못지않은 실력을 발휘할 수 있습니다.
2. 훈련 방법: 3 단계 레시피
이 작은 학생을 세계적인 수학자로 만들기 위해 연구팀은 3 단계의 특별한 훈련 과정을 거쳤습니다.
1 단계: 모방 수업 (SFT - 지도 학습)
- 비유: 세계적인 수학자 (DeepSeek-Math-V2, 685B 모델) 가 쓴 완벽한 해설집을 복사해서 공부하게 합니다.
- 과정: 거대 모델이 푼 7,500 개의 문제와 해설을 작은 모델에게 보여주고, "이렇게 적어봐"라고 가르칩니다.
- 결과: 이제 작은 모델은 수학 문제를 풀 때 필요한 '글쓰기 스타일'과 '논리 구조'를 배웠습니다. 하지만 아직 스스로 깊게 생각하지는 못합니다.
2 단계: 실전 훈련 (RL - 강화 학습)
- 비유: **엄격한 채점관 (Rubric)**을 모시고 실전 모의고사를 치릅니다.
- 과정: 단순히 정답만 맞으면 점수를 주는 게 아닙니다. 채점관은 해설의 **중간 단계 (체크포인트)**를 하나하나 꼼꼼히 봅니다.
- "이 단계는 잘 썼네? +1 점!"
- "여기 논리가 빠졌네? -1 점!"
- "계산 실수가 있네? -2 점!"
- 효과: 모델은 정답만 맞추려는 '요령'이 아니라, 논리적으로 타당한 증명 과정을 만드는 법을 배우게 됩니다.
3 단계: 메모리 보강 (Reasoning Cache - 추론 캐시)
- 비유: 긴 긴 산을 오르는 등산가에게 '휴식과 요약'을 가르치는 것입니다.
- 문제: 수학 증명 문제는 너무 길어서 (수십만 단어), AI 가 처음부터 끝까지 한 번에 생각하면 기억이 나빠지고 헷갈립니다.
- 해결:
- 문제를 풀다가 중간에 멈춥니다.
- "지금까지 무엇을 증명했지?"라고 요약을 적어 메모장에 적습니다.
- 그 메모를 보고 다음 단계를 이어갑니다.
- 효과: 이 과정을 반복하면, 작은 모델도 수백만 단어에 달하는 긴 논리를 놓치지 않고 완성할 수 있게 됩니다. 마치 긴 글을 쓸 때 목차를 계속 확인하며 쓰는 것과 같습니다.
3. 놀라운 결과: 작은 모델의 역전
이 훈련을 마친 QED-Nano는 다음과 같은 성과를 냈습니다.
- 규모 대비 압도적: 40 억 파라미터 (작은 모델) 이지만, 300 억이나 1,200 억 파라미터인 다른 오픈소스 모델들보다 훨씬 잘 풀었습니다.
- 거인과의 대결: 유료로만 쓸 수 있는 거대 모델 (Gemini 3 Pro) 의 성능에 거의 근접했습니다.
- 비용 효율: 거대 모델을 돌리는 비용의 1/3 만이면 같은 성능을 낼 수 있습니다.
4. 핵심 교훈: "무조건 크게 만드는 것보다, 잘 훈련시키는 것이 중요하다"
이 논문이 우리에게 주는 메시지는 다음과 같습니다.
"AI 를 더 똑똑하게 만드는 비결은 무조건 모델을 키우는 (파라미터 늘리기) 것만이 아닙니다. 작은 모델에게도 '어떻게 생각할지 (추론)'와 '어떻게 스스로 고칠지 (피드백)'를 가르쳐주면, 거대 모델과 어깨를 나란히 할 수 있다는 것입니다."
마치 재능 있는 소년에게 올바른 코칭과 훈련 시스템을 제공하면, 거대한 스포츠 팀을 이길 수 있는 것과 같은 이치입니다. 이제 우리는 비싼 AI 에 의존하지 않고, 작고 효율적인 모델로도 어려운 수학 문제를 풀 수 있는 시대가 열린 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.