← 최신 논문
🤖 AI

Ax-Prover: A Deep Reasoning Agentic Framework for Theorem Proving in Mathematics and Quantum Physics

Ax-Prover는 모델 컨텍스트 프로토콜을 통해 대규모 언어 모델과 Lean 도구를 결합하여 다양한 과학 분야에서 자율적이고 협력적인 형식적 정리 증명을 가능하게 하며, 새로운 벤치마크에서의 뛰어난 일반화 능력과 복잡한 수학 작업에서의 실용성을 입증하는 다중 에이전트 프레임워크입니다.

원저자: Benjamin Breen, Marco Del Tredici, Jacob McCarran, Javier Aspuru Mijares, Weichen Winston Yin, Kfir Sulimany, Jacob M. Taylor, Frank H. L. Koppens, Dirk Englund

게시일 2026-05-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Benjamin Breen, Marco Del Tredici, Jacob McCarran, Javier Aspuru Mijares, Weichen Winston Yin, Kfir Sulimany, Jacob M. Taylor, Frank H. L. Koppens, Dirk Englund

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 여러분이 매우 어려운 퍼즐, 예를 들어 복잡한 수학 문제나 물리학적 미스터리를 풀려고 한다고 가정해 봅시다. 여러분에게는 두 가지 유형의 도우미가 있습니다:

  1. 일반주의자: 수학, 물리학, 역사 등 모든 것에 대해 조금씩 알고 있으며 대화와 브레인스토밍에 뛰어난 똑똑하고 잘 읽은 인간입니다. 하지만 그들은 'Lean'이라는 특정 퍼즐 게임의 엄격하고 경직된 규칙을 배운 적이 없기 때문에, 종종 사소한 실수를 하거나 규칙을 잘못 이해합니다.
  2. 전문가: 오직 그 특정 퍼즐 게임만 훈련받은 로봇입니다. 규칙을 완벽하게 알고 있지만, 너무 특화되어 있어 약간 다른 유형의 퍼즐에 대해 질문하거나 규칙서가 업데이트되면 혼란을 겪습니다. 또한 여러분과 대화하거나 도움을 주기 위해 외부 도구를 사용할 수도 없습니다.

Ax-Prover는 일반주의자를 고용하지만, 완벽한 퍼즐 해결사가 될 수 있도록 특별한 도구 세트를 제공하는 초지능 프로젝트 관리자처럼 작동하는 새로운 시스템입니다.

작동 방식: "세 개의 머리를 가진" 팀

모든 것을 하려고 노력하는 하나의 거대한 두뇌 대신, Ax-Prover는 함께 작업하는 세 명의 "에이전트"(AI 도우미) 팀을 사용합니다:

  • 오케스트레이터 (관리자): 이 에이전트 스스로 퍼즐을 풀지는 않습니다. 오케스트라의 지휘자처럼 행동합니다. 문제를 받아서 해결사에게 할당하고, 피드백을 경청하며, 작업이 완료되었거나 다시 시도해야 할 시기를 결정합니다.
  • 프로버 (건설자): 이는 스마트한 채팅 봇과 같은 일반주의자 AI 입니다. 단계별로 해결책을 구축하려고 시도합니다. 하지만 여기가 마법 같은 부분입니다. 단순히 추측하지 않습니다. 다음과 같은 기능을 제공하는 디지털 도구상자(MCP 도구라고 함)를 갖추고 있습니다:
    • 정의를 확인하기 위해 규칙서 (Lean 라이브러리) 를 엽니다.
    • 컴퓨터에 "이 단계가 지금 올바른가요?"라고 묻습니다.
    • 이전에 본 유사한 퍼즐을 검색합니다.
    • 실수를 즉시 수정합니다.
    • 비유: 나무를 못 박기 전에 레이저 수평기로 자른 부분이 곧은지 즉시 확인할 수 있는 목수를 상상해 보세요. 비뚤어져 있으면 즉시 수정합니다.
  • 검증자 (검사관): 이 에이전트는 엄격한 품질 관리 담당자입니다. 최종 작업을 검토하여 규칙과 대조합니다. 아주 작은 오류 하나라도 발견되면 작업을 건설자에게 돌려보내 수정하게 합니다. 어떤 것도 틈새로 빠져나가지 않도록 보장합니다.

이것이 큰 문제인 이유

이 논문은 이 시스템을 두 가지 유형의 도전 과제에서 테스트했습니다:

  1. 표준 수학 경시대회: 푸트남 시험 (매우 어려운 고등학교/대학 수학) 과 같은 것들입니다.
  2. 새롭고 더 어려운 분야: 저자들은 추상 대수학(고급, 연구 수준의 수학) 과 양자 물리학(원자 및 아원자 입자의 물리학) 을 위한 새로운 테스트를 만들었습니다.

결과:

  • 전문가 (로봇): 훈련받은 표준 수학에서는 훌륭했지만, 팀이 양자 물리학이나 새로운 유형의 대수학에 그들을 사용하려고 시도했을 때 실패했습니다. 그들은 이탈리아 요리만 할 수 있는 요리사처럼, 스시를 만들어 달라고 하면 무엇을 해야 할지 모릅니다.
  • 일반주의자 (채팅 봇): 도구가 없으면 창의적이지만 너무 많은 실수를 하여 유용하지 않았습니다.
  • Ax-Prover (팀): 새로운 분야 (양자 및 대수학) 에서 전문가들을 능가했으며 표준 수학에서도 매우 잘 수행했습니다. 이는 특정 분야에 훈련되지 않은 똑똑한 일반 AI 에게 자신의 작업을 확인할 수 있는 적절한 도구를 제공함으로써, 훈련받지 않은 분야에서도 문제를 해결할 수 있음을 증명했습니다.

논문에서 제시된 실제 사례

저자들은 단순히 테스트를 실행하는 데 그치지 않고, 실제 과학자들과 어떻게 작동하는지 보여주었습니다:

  • 암호학자: 데이터 보호에 사용되는 수학 공식을 증명하려는 보안 전문가가 있었습니다. 해당 전문가는 수학을 알았지만, 엄격한 'Lean' 언어로 작성하는 방법은 몰랐습니다. Ax-Prover는 파트너 역할을 하여 전문가의 아이디어를 코드로 번역하고, 원래 논리에 숨겨진 결함을 발견했으며, 일반 노트북에서 단 이틀 만에 검증된 증명서를 생성했습니다.
  • 양자 물리학자: 연구원들은 양자 컴퓨터에서 정보가 어떻게 손실되는지에 대한 규칙을 증명하고자 했습니다. Ax-Prover는 그들의 물리학식 추론을 엄격하고 기계가 확인한 증명으로 변환하여 수학이 100% 견고하도록 보장했습니다.

결론

Ax-Prover 는 모든 과학 분야마다 새롭고 비싼 로봇을 구축할 필요가 없음을 보여줍니다. 대신, 똑똑한 일반 AI 에게 자신의 작업을 확인하고 전문가와 대화할 수 있는 도구 세트를 제공하면, 수학, 물리학, 암호학에서 복잡한 증명을 검증하는 데 도움이 되는 강력하고 유연한 조수가 될 수 있습니다. 이는 AI 를 "추측 기계"에서 앞으로 나아가기 전에 모든 단계를 다시 확인하는 "신중한 수학자"로 변모시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →