Question Begets Question: Self-Evolving Curriculum for Reinforcement Fine-Tuning on Competition Mathematics
이 논문은 데이터 부족과 추론 과정의 한계를 극복하기 위해 모델의 현재 강점으로부터 문제 변형을 반복적으로 생성하는 자기 진화형 커리큘럼인 "Question Begets Question"(QbQ)을 소개하며, 이는 AIME에서 16.5%의 pass@1 점수를 달성함으로써 경시대회 수학 미세 조정에서의 성능 정체를 성공적으로 돌파했습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 아주 똑똑하지만 경험은 부족한 학생에게 세상에서 가장 어려운 수수께끼를 푸는 법을 가르치려 한다고 상상해 보세요. 당신에게는 수수께끼 도서관이 있지만, 규모는 아주 작고, 단계별 설명이 담긴 정답 해설지는 없이 오직 최종 정답만 가지고 있습니다. 당신은 학생에게 더 많은 수수께끼를 주며 가르치려 하지만, 아무리 많은 수수께끼를 추가해도 학생은 어떤 벽에 부딪힙니다. 학생은 특정 숙련도 수준에서 멈춰 서게 되고, 아무리 연습을 더 많이 해도 더 나아지기를 거부합니다. 이것은 인공지능(AI)을 연구하는 과학자들이 겪는 흔한 골칫거리입니다. 그들은 AI가 수학이나 법률 같은 복잡한 기술을 배우기를 원하지만, 종종 좋은 연습 문제의 양이 부족하고, AI에게 생각하는 법을 보여줄 상세한 "사고 과정"이 없으며, AI가 성장이 멈춰버리는 좌절스러운 "천장"에 도달하는 것을 목격하곤 합니다.
이 논문은 바로 그 문제를 깊이 파고듭니다. 연구진은 인간 교사가 모든 해결 단계의 과정을 직접 작성하지 않고도 어떻게 그 학습 천장을 깨뜨릴 수 있을지 알아보고자 했습니다. 그들은 스마트한 컴퓨터 프로그램(AI 모델)과 일련의 까다로운 수학 경시대회 문제들을 사용했습니다. 단순히 AI에게 똑같은 문제를 더 많이 제공하는 대신, 그들은 "질문이 질문을 낳는다(Question-begets-Question)"라는 영리한 기술을 발명했습니다. 이것은 마치 숙련된 요리사가 제자에게 단순히 레시피를 더 많이 주는 것이 아니라, 제자가 거의 성공할 뻔했던 레시피를 가져와 재료를 아주 살짝만 수정하여 약간 다른 새로운 요리를 만들어내는 것과 같습니다. 제자가 거의 마스터해가는 문제를 바탕으로 끊임없이 새롭고 약간씩 변형된 도전 과제들을 만들어냄으로써, 연구진은 AI를 그 한계 너머로 밀어 올릴 수 있는 방법을 찾아냈습니다.
자기 진화형 커리큘럼의 이야기
연구진은 Qwen2.5-Math-7B라는 컴퓨터 모델로 시작했습니다. 처음에 이 모델은 AIME라고 불리는 특정 유형의 고등학교 수학 경시대회 문제에 매우 취약했습니다. 스스로 문제를 풀 수 있는 확률은 약 **5.6%**에 불과했습니다. 팀은 이 모델을 더 잘 가르치고 싶었지만, 세 가지 큰 장애물에 직면했습니다. 연습 문제의 부족, 사고 과정을 적어놓은 "정답 해설지"의 부재, 그리고 모델이 결국 벽에 부딪혀 학습을 멈출 것이라는 두려움이었습니다.
이러한 문제의 부재를 해결하기 위해, 그들은 질문이 질문을 낳는(QbQ) 방식을 사용했습니다. 삼각형의 넓이를 구하는 수학 문제가 있다고 가정해 봅시다. 일반적인 방식이라면 단순히 숫자만 바꾸는 것(삼각형을 더 크게 만들거나 작게 만드는 것)으로 더 많은 연습 문제를 만들 것입니다. 하지만 연구진의 "선생님" AI는 더 똑똑하게 행동했습니다. 그것은 학생이 거의 맞히기 직전인 문제를 가져와 특정 "변형 규칙"을 적용했습니다. 예를 들어, 질문을 '넓이 구하기'에서 '그 삼각형 안에 있는 원의 반지름 구하기'로 바꾸거나, 혹은 다른 진법으로 답을 구하도록 요구할 수 있습니다. 이러한 새로운 문제들은 신선하고 다양하면서도, 동일한 핵심 기술을 정확히 테스트합니다.
하지만 단순히 대량의 새로운 문제들을 생성하는 것만으로는 충분하지 않았습니다. 실제 문제와 합성된 문제를 섞은 정적인 데이터셋으로 모델을 훈련했을 때, 모델은 천장에 부딪혔습니다. 모델은 **5.6%**에서 약 12.5% 또는 **14.5%**까지 향상되었지만, 그 후 멈춰버렸습니다. 아무리 많은 데이터를 더 넣어주어도 모델은 더 이상 나아지지 못했습니다. 그것은 마치 특정 연습 시험의 답을 암기했지만, 질문에 약간의 변화만 생겨도 대응하지 못하는 학생과 같았습니다.
돌파구는 훈련 데이터를 정적인 더미로 취급하는 대신, 자기 진화형 커리큘럼으로 취급하면서 찾아왔습니다. 모델에게 뒤섞인 문제들이 담긴 거대한 가방을 주는 대신, 그들은 훈련을 여러 라운드로 구성했습니다. 마법이 일어난 과정은 다음과 같습니다:
- 체크인: 각 라운드가 끝날 때마다, 그들은 모델이 방금 배운 문제들을 대상으로 테스트를 진행했습니다.
- 스윗 스팟(Sweet Spot): 그들은 모델이 대부분의 경우 맞히지만, 항상 맞히지는 못하는 지점을 찾았습니다. 그들은 이를 "거의 맞히는(mostly-right)" 구간이라고 불렀습니다.
- 씨앗(Seed): 그들은 이 특정 "거의 맞히는" 문제들을 씨앗으로 삼아, 다음 배치의 새롭고 약간 더 어려운 변형 문제들을 생성했습니다.
- 루프(Loop): 모델을 이 새로운 배치로 훈련시키고, 다시 확인하고, 새로운 "거의 맞히는" 문제를 찾아내어 이 과정을 반복했습니다.
가장 놀라운 점은 무엇이었을까요? 연구진은 모델이 처참하게 틀리는 문제보다, 이미 잘 풀고 있는 문제를 연습할 때 가장 빠르게 향상된다는 것을 발견했습니다. 보통 우리는 실수를 바로잡음으로써 배운다고 생각합니다. 하지만 여기서 AI는 자신의 "아쉬운 실패(near-misses)"를 가져와서, 그것을 약간씩 수정하고 마스터함으로써 가장 잘 배웠습니다. 이는 테니스 선수가 공을 네트에 계속 맞히며 연습하는 것이 아니라, 성공적으로 리턴하던 서브에 아주 미세한 회전을 추가하며 계속해서 연습하는 것과 같았습니다.
이 자기 진화형 루프를 20라운드 동안 사용함으로써, 모델은 벽에 부딪히지 않았습니다. 모델은 계속해서 올라갔습니다. 다른 방법들이 약 **14.5%**에서 정체될 때, 이 자기 진화형 접근 방식은 모델의 성공률을 16.5%(최종 테스트에서는 구체적으로 16.46%)까지 끌어올렸으며, 멈출 기색을 전혀 보이지 않았습니다. 더욱 인상적인 것은, 모델이 한 번도 본 적 없는 더 어려운 문제들을 해결하는 법을 배웠다는 점이며, 이는 "천장"이 모델의 지능 한계가 아니라 훈련 방식의 한계였음을 증명합니다.
연구진은 또한 AI가 단순히 선생님의 "사고 과정"을 복사하는 것이 아님을 확실히 했습니다. 그들은 AI에게 선생님의 단계별 추론 과정을 절대 보여주지 않았으며, 오직 질문과 최종 정답만을 보여주었습니다. 이는 AI가 인간을 흉내 내는 것이 아니라 스스로 생각하는 법을 배웠음을 의미합니다. 이 연구는 AI가 종종 정체되는 이유가 학습 능력이 부족해서가 아니라, 우리가 잘못된 종류의 연습을 제공하고 있기 때문임을 시사합니다. AI의 현재 위치에 딱 맞춰 커리큘럼을 끊임없이 재구성함으로써, 우리는 AI가 자신의 한계를 돌파하도록 도울 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.