← 최신 논문
🤖 machine learning

OptProver: Bridging Olympiad and Optimization through Continual Training in Formal Theorem Proving

이 논문은 올림피아드 수학 기반의 증명 모델을 전문가 반복(expert iteration) 데이터 큐레이션과 특화된 선호 학습(preference learning) 기법을 통해 학부 수준의 최적화(optimization) 영역으로 효과적으로 전이시킨 'OptProver'를 제안합니다.

원저자: Chenyi Li, Yanchen Nie, Zhengyu Ming, Gong Zhang, Kun Yuan, Zaiwen Wen

게시일 2026-04-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Chenyi Li, Yanchen Nie, Zhengyu Ming, Gong Zhang, Kun Yuan, Zaiwen Wen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 배경: "수학 올림피아드 금메달리스트가 공대생이 된다면?"

지금까지의 AI 수학 모델들은 주로 '수학 올림피아드' 스타일의 문제를 잘 풀도록 훈련되었습니다. 마치 논리 퍼즐이나 창의적인 사고력을 요구하는 퀴즈를 잘 푸는 '천재 소년'과 같죠.

그런데 문제는 이 천재 소년에게 갑자기 '공학 수학(최적화)' 책을 던져주면, 갑자기 버벅거리기 시작한다는 겁니다. 왜 그럴까요?

  • 올림피아드 수학: "이 퍼즐의 규칙을 찾아내서 논리적으로 풀어봐!" (창의적 추론)
  • 최적화 수학: "이 복잡한 함수에서 가장 낮은 지점을 찾기 위해, 기존의 정해진 공식과 도구(라이브러리)를 아주 정교하게 사용해!" (전문 도구 활용)

기존 AI는 올림피아드식 '창의적 사고'에는 익숙하지만, 공학에서 쓰는 '특수한 도구와 복잡한 공식'을 사용하는 법을 배우려 하면, 오히려 예전에 배웠던 논리력까지 까먹어버리는 '지식의 충돌(Catastrophic Forgetting)' 현상을 겪습니다.

2. 문제점: "맞는 말인데, 쓸모없는 말만 하는 AI"

연구진은 AI를 공학 수학으로 훈련시킬 때 두 가지 큰 벽을 발견했습니다.

  1. 지식의 망각: 새로운 공식(최적화)을 배우느라 예전에 잘하던 논리 문제들을 다 까먹음.
  2. 길을 잃은 탐험가 (Stagnant Tactics): AI가 수학 문제를 풀 때 한 단계씩 나아가는데, 문법적으로는 맞는 말(예: "이 식을 이렇게 변형하자")을 하지만, 정작 문제 해결에는 전혀 도움이 안 되는 **'헛스윙'**을 계속하는 겁니다. 마치 미로에서 벽을 짚으며 "이 벽은 딱딱하네?"라고 말만 하고 앞으로 나아가지 못하는 것과 같습니다.

3. 해결책: "OptProver의 3단계 특훈"

연구진은 이 문제를 해결하기 위해 **'OptProver'**라는 새로운 훈련법을 만들었습니다.

① 1단계: 스스로 깨우치기 (Self-Distillation)

AI에게 단순히 교과서를 읽히는 게 아니라, 스스로 수학 문제들을 풀어보게 합니다. 직접 풀어보고 "아, 이렇게 하니까 답이 나오네!"라고 성공한 경로만 골라서 다시 공부하게 만드는 '자기 주도 학습' 방식입니다.

② 2단계: "쓸모없는 말은 하지 마!" (Utility-Aware Preference)

이게 이 논문의 핵심입니다. AI가 문제를 풀 때, 문법적으로는 맞지만 문제 해결에 도움이 안 되는 '헛스윙'을 하면 "그건 틀린 거야!"라고 엄격하게 혼을 냅니다.

  • 성공한 경로: "오, 아주 효율적으로 잘 풀었어! (칭찬)"
  • 문법은 맞지만 제자리걸음인 경로: "말은 되는데, 시간 낭비야. 하지 마! (벌점)"
    이렇게 함으로써 AI가 미로 속에서 헤매지 않고 가장 빠른 길로만 가도록 훈련시킵니다.

③ 3단계: "너무 어려운 건 일단 넘어가자" (Perplexity-Weighted)

AI가 공부하다가 너무 생소하고 어려운 단어가 나오면 당황해서 학습이 꼬일 수 있습니다. 그래서 너무 난해한 데이터는 가중치를 낮춰서, AI가 감당할 수 있는 수준부터 차근차근, 안정적으로 배우게 조절해 줍니다.

4. 결과: "올림피아드 실력은 유지하면서, 공학 수학까지 마스터!"

결과는 놀라웠습니다.

  • 전문성 확보: 새로운 벤치마크(OptBench)에서 기존 모델들을 압도하며 최적화 문제를 아주 잘 풀게 되었습니다.
  • 기초 실력 유지: 가장 중요한 점은, 공학 수학을 배웠다고 해서 예전에 잘하던 올림피아드 문제나 일반 수학 문제 실력이 떨어지지 않았다는 것입니다. 오히려 일반적인 수학 실력이 더 좋아지기도 했습니다.

요약하자면...

이 논문은 **"AI에게 새로운 전문 지식을 가르칠 때, 예전 실력을 잃지 않으면서도 '쓸데없는 헛스윙'을 하지 않고 핵심을 찌르는 법을 가르치는 똑똑한 훈련법"**을 제안한 것입니다. 덕분에 AI는 이제 단순한 수학 천재를 넘어, 실무적인 공학 수학까지 다룰 수 있는 '준전문가'로 성장할 수 있게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →