← 최신 논문
💬 NLP

AdvancedMathBench: A Benchmark Suite for Advanced Mathematical Proof Generation and Verification

본 논문은 고급 수학적 증명 생성을 평가하기 위한 ProverBench와 증명 검증을 평가하기 위한 VerifierBench를 포함한 포괄적인 벤치마크 스위트 및 특화된 자동 검증 파이프라인을 특징으로 하는 AdvancedMathBench를 소개하며, 이를 통해 현재의 최첨단 거대 언어 모델들이 학부 및 박사 수준의 엄밀한 증명을 구성하고 검증하는 데 여전히 상당한 어려움을 겪고 있음을 밝힌다.

원저자: Lingkai Kong, Zijian Wu, Yuzhe Gu, Haiteng Zhao, Wenyong Huang, Shuang Sun, Zhicheng Xiong, Xiaotian Zhang, Shuya Zhao, Yan Wang, Disheng Xu, Wenwei Zhang, Kai Chen

게시일 2026-07-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Lingkai Kong, Zijian Wu, Yuzhe Gu, Haiteng Zhao, Wenyong Huang, Shuang Sun, Zhicheng Xiong, Xiaotian Zhang, Shuya Zhao, Yan Wang, Disheng Xu, Wenwei Zhang, Kai Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 고등학교 수학 시험을 완벽하게 통과하고, 까다로운 대수학이나 기하학 문제도 인간보다 빠르게 풀어내는 초지능 로봇을 만들었다고 상상해 보세요. 당신은 아마 이렇게 생각할 것입니다. "와! 이 로봇은 수학 천재구나!" 하지만 만약 당신이 이 로봇에게 박사 과정 수준의 수학 문제를 건네준다면 어떻게 될까요? 로봇은 실제로 그 논리를 이해하고 있는 걸까요, 아니면 그저 정답일 것 같은 숫자를 찍어서 운 좋게 맞히기를 바라고 있는 걸까요?

이것이 바로 AdvancedMath-Bench라는 새로운 연구가 조사하고 있는 내용입니다. 연구진은 AI 모델이 두 가지 매우 어려운 일, 즉 완벽한 수학적 증명을 처음부터 **작성(write)**하는 것과 다른 사람의 증명이 실제로 옳은지 **검증(check)**하는 것을 할 수 있는지 테스트하기 위해 특별한 "수학 체육관"을 구축했습니다.

"증명"은 결과가 아니라 과정에 있다 (단순한 답이 아닌 것)

대부분의 AI 수학 테스트는 객관식 퀴즈와 같습니다. 로봇은 그저 정답인 알파벳(A, B, C 또는 D)을 고르거나 최종 숫자만 적으면 됩니다. 답이 맞으면 로봇은 금메달을 받습니다.

하지만 고급 수학은 단순히 최종 숫자에 관한 것이 아니라, 그 과정에 관한 것입니다. 이는 요리사에게 맛있는 케이크를 내놓으라고 하는 것을 넘어, 왜 각 재료를 넣었는지 설명하고 케이크가 무너지지 않을 것임을 증명하는 정확한 레시피를 작성하라고 요구하는 것과 같습니다. 만약 레시피에 숨겨진 실수(예: 설탕 대신 소금을 사용함)가 있다면, 처음에는 케이크가 괜찮아 보일지 몰라도 결국 망치게 됩니다.

이 논문은 현재의 AI 벤치마크가 최종 정답만을 확인하기 때문에 너무 쉽다고 주장합니다. 그것들은 "레시피" 부분을 놓치고 있습니다. 이를 해결하기 위해 연구진은 AdvancedMath-Bench를 만들었습니다. 이 벤치마크는 AI에게 수학 문제의 전체 이야기를 써 내려가게 한 뒤, 그 이야기가 말이 되는지 확인하도록 강제합니다.

두 가지 큰 도전 과제

1. "작성자" 테스트 (ProverBench)

먼저, 연구진은 AI에게 수학자가 되어 완전한 증명을 작성하도록 요청했습니다. 연구진은 두 단계로 나뉜 245개의 문제를 제공했습니다:

  • 학부 수준 (Undergraduate, UG): 까다로운 대학 기말고사 수준.
  • 박사 자격 시험 (Doctoral Qualifying, QE): 박사가 되기 위해 반드시 통과해야 하는 매우 어려운 시험 수준.

결과: 가장 똑똑한 AI 모델들조차 고전했습니다. 가장 뛰어난 모델인 GPT-5.5-xhigh는 대학 수준 문제에서 64.5점을 받았습니다. 하지만 박사 과정 수준의 문제로 넘어가자 점수는 48.9로 떨어졌습니다.

이는 AI가 고등학교 수학에는 뛰어나지만, 고급 연구에 필요한 깊고 엄격한 논리를 다루기에는 아직 갈 길이 멀다는 것을 시사합니다. 논문은 단순히 정답을 맞히는 것만으로는 부족하며, 모델이 견고한 논거를 구축해야 한다고 제안합니다. 현재 AI는 여전히 가장 어려운 단계에서 비틀거리고 있습니다.

2. "편집자" 테스트 (VerifierBench)

다음으로, 연구진은 AI에게 엄격한 편집자 역할을 맡겼습니다. 연구진은 다른 모델들이 작성한 888개의 증명(정답인 것도 있고, 숨겨진 함정이 가득한 것도 있음)을 제시하며 물었습니다: "이 증명은 유효한가요? 만약 아니라면, 어디에 실수가 있습니까?"

결과: 이것은 훨씬 더 어려웠습니다. 가장 뛰어난 모델인 DeepSeek-V4-Pro65.1(Balanced F1 점수로 불림)점에 그쳤습니다.

여기서 까다로운 점은, 만약 AI에게 단순히 "이것이 맞습니까 틀립니까?"(단순 Yes/No)라고 묻는다면 꽤 잘하는 것처럼 보인다는 것입니다. 하지만 "왜 그런지"를 설명하고 구체적인 오류를 지적하라고 하면 성능이 급격히 떨어집니다.

예를 들어, 어떤 모델들은 "네, 이것은 옳습니다!"라고 말하고 싶어 너무 의욕이 앞선 나머지 명백한 실수를 놓치기도 했습니다. 한 모델인 gpt-oss-120b는 유효한 증명에 대해서는 95.3%의 확률로 "예"라고 답했지만, 유효하지 않은 증명에 대해서는 "아니오"라고 답한 경우가 32.0%에 불ید었습니다. 이는 마치 부정행위를 해도 모두에게 A를 주는 선생님과 같았습니다. 논문은 진짜 병목 현상이 정답을 인식하는 것이 아니라, 그럴듯해 보이지만 틀린 증명 속의 미묘하고 교묘한 오류를 찾아내는 데 있다고 제나합니다.

테스트의 공정성을 확보하는 방법

"AI의 증명이 정말 좋은지 어떻게 알 수 있나요?"라는 의문이 들 수 있습니다. 다른 AI에게 물어볼 수도 없는데, 그들도 똑같은 실수를 할 수 있기 때문입니다.

그래서 연구진은 특별한 **자동 검증 파이프라인(Automatic Verification Pipeline)**을 구축했습니다. 이것은 전문 수학가 팀이 초정밀 로봇에게 증명을 채점하는 법을 가르친 것과 같습니다.

  • 연구진은 수천 개의 사례를 수집했고, 실제 전문가들이 이를 검토하게 했습니다.
  • 연구진은 로봇이 "치명적 오류(Fatal Errors, 증명 전체를 무너뜨리는 종류)"와 "회복 가능한 오류(Recoverable Errors, 수정 가능한 작은 실수)"를 구분하도록 훈련시켰습니다.
  • 연구진은 "비관적인" 규칙을 사용했습니다: 8개의 서로 다른 체크 항목이 모두 완벽하다고 해야만 그 증명을 수용합니다. 단 하나의 체크에서도 결함이 발견되면 그 증명은 실패한 것으로 간듭로.

이 시스템은 매우 정교하여, 다른 모델들이 70.6점을 받은 테스트 세트에서 82.1점을 기록하며 다른 상위 AI 판독기들을 능가했습니다. 이는 수학 AI를 진정으로 테스트하려면 일반적인 챗봇이 아닌, 특화되고 엄격한 채점자가 필요함을 시사합니다.

핵심 요약

이 논문은 AI가 수학을 "못한다"고 말하는 것이 아닙니다. 가장 어렵고 고급스러운 수학의 경우, AI는 여전히 배우는 중이라는 것입니다.

  • 증명 작성: 가장 뛰어난 AI는 대학 수준 문제에서 약 64.5점을 받았으며, 박사 과정 수준 문제에서는 48.9점으로 떨어졌습니다.
  • 증명 검증: 가장 뛰어난 AI의 점수는 65.1로, 여전히 많은 미묘한 오류를 놓치고 있음을 의미합니다.

연구진은 우리가 더 이상 최종 결과만을 봐서는 안 된다고 제안합니다. AI가 실제 과학적 발견에 도움을 주기를 원한다면, 완벽한 논리적 근거를 구성할 수 있어야 하며, 무엇보다도 다른 누구보다 먼저 자신의 실수를 잡아낼 수 있어야 합니다. 그때까지 "수학 천재" 로봇은 여전히 성장 중인 학생입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →