← 최신 논문
🤖 AI

MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement

이 논문은 Mathlib 지식 검색과 검증 유도 반복 정교화(verification-guided iterative refinement)를 활용하여 대규모 FormalVerse 데이터셋을 구축하고, 이를 통해 기존의 특화된 자동 형식화(autoformalization) 모델들을 여러 벤치마크에서 크게 능가하는 MathForm-8B의 학습을 가능하게 하는 프레임워크인 MathForm을 소개한다.

원저자: Lushi Pu, Weiming Zhang, Xinheng Xie, Zixuan Fu, Bingxiang He, Hengyu Zhao, Hongya Lyu, Xin Li, Jie Zhou, Yudong Wang

게시일 2026-08-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Lushi Pu, Weiming Zhang, Xinheng Xie, Zixuan Fu, Bingxiang He, Hengyu Zhao, Hongya Lyu, Xin Li, Jie Zhou, Yudong Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑하지만 약간은 서투른 로봇에게 순수 논리의 언어를 가르치려 한다고 상상해 보세요. 이 로봇은 거대 언어 모델(LLM)로, 평범한 영어로 이야기를 읽고, 시를 쓰고, 수학 퍼즐을 푸는 데 매우 뛰어납니다. 하지만 문제가 하나 있습니다. 수학 정리를 절대적인 확실성으로 증명하려면, 단순히 단어를 사용하는 것만으로는 부족하며, Lean 4라고 불리는 매우 엄격한 컴퓨터 언어를 사용해야 합니다. Lean 4를 모든 단어, 기호, 규칙이 완벽해야만 금고 문이 열리는 초고보안 금고라고 생각해보세요. 문제는 이 로봇이 수학은 잘 알지만, Lean 4가 사용하는 특정한 '규칙서'(Mathlib이라고 불림)는 모른다는 것입니다. 이는 마치 완벽한 스테이크를 요리할 줄 아는 요리사에게, 한 번도 본 적 없는 언어로 쓰인 레시피를 따르라고 요청하면서, 심지어 재료의 이름조차 모르는 상황과 같습니다. 요리사는 추측은 할 수 있겠지만, 틀릴 가능성이 높습니다.

여기에서 '자동 형식화(autoformalization)'가 등장합니다. 즉, 인간의 수학을 이 엄격한 컴퓨터 코드로 번역하는 기술입니다. 오랫동안 연구자들은 로봇이 훈련 과정에서 기억한 규칙에 의존하기를 바라며, 단순히 수학을 '번려'하라고 요청해 왔습니다. 하지만 로봇은 잘못된 재료를 사용하거나 결정적인 단계를 잊어버리는 등 실수를 반복했습니다. 왜냐하면 로봇이 자신의 기억력에만 의존하려 했기 때문입니다. 새로운 논문인 MathForm은 이러한 "추측하고 희망하기(guess and hope)" 방식이 잘못되었다고 주장합니다. 대신, 그들은 로봇이 코드를 쓰기 에 규칙서를 찾아볼 수 있게 하고, 만약 실수를 하더라도 엄격한 편집자가 단순히 결과물을 버리는 것이 아니라, 무엇이 잘못되었는지 정확히 알려주고 제대로 될 때까지 다시 시도하게 만드는 시스템을 구축했습니다.

MathForm의 연구진은 로봇이 형식 수학의 언어를 완벽하게 구사하게 하려면, 단순히 초안을 쓰고 잘 되기를 바라는 것만으로는 부족하다는 것을 깨달았습니다. 그들은 로봇의 작업 흐름을 고치기 위해 3단계 조립 라인을 구축했습니다. 첫째, 로봇이 코드 한 줄을 쓰기도 전에, '연구자(Researcher)' 에이전트가 방대한 Mathlib 라이브러리를 스캔하여 해당 문제에 필요한 정확한 정의와 규칙을 찾아냅니다. 이는 요리사에게 칼을 들기도 전에 '스테이크'에 관한 특정 요리책 페이지를 건네주는 것과 같습니다. 둘째, 로봇이 코드를 작성하면 '검사관(Inspector)'이 이를 확인합니다. 만약 코드에 구문 오류(쉼표 누락 등)가 있다면 검사관이 이를 지적합니다. 만약 코드가 컴파일은 되지만 의미가 틀린 경우(예를 들어, '모든 숫자'라고 말했지만 실제로는 '양수만'을 의미했던 경우), 검사관은 그 의미론적 오류를 설명합니다. 셋째, 로봇은 포기하는 대신 이 피드백을 사용하여 코드를 다시 작성합니다. 코드가 완벽해질 때까지 이 "작성-검사-수정"의 순환 과정을 반복합니다.

이 영리한 루프를 사용하여, 연구팀은 약 367,000개의 검증된 수학 예시를 포함하는 거대한 새로운 데이터셋인 FormalVerse를 만들었습니다. 그리고 이 데이터로 새로운 모델인 MathForm-8B를 학습시켰습니다. 결과는 놀라웠습니다. 이 상대적으로 작은 모델(80억 개의 파라미터)이 기존의 "추측하고 희망하기" 방식에 의존했던 훨씬 더 큰 전문 모델(320억 개의 파라미터)보다 수학 형식화 능력이 더 뛰어났습니다. 6가지의 어려운 수학 테스트에서, MathForm-8B는 코드가 실제 인간의 문제와 일치하는지를 의미하는 엄격한 '일관성 검사(Consistency Check)'를 약 72.4%의 확률로 통과하며 이전의 최고 모델들을 제쳤습니다. 가장 어렵고 추상적인 대수학 문제에서도 이 모델은 더 큰 경쟁 모델들을 크게 앞질렀습니다. 이 논문은 모델에게 정보를 찾아볼 수 있는 적절한 도구를 제공하고 실수로부터 배울 기회를 주는 것이, 거대한 뇌를 갖는 것보다 똑똑한 작업 흐름을 갖는 것이 수학 천재가 되는 데 더 중요하다는 점을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →