← 최신 논문
🤖 AI

RMA: an Agentic System for Research-Level Mathematical Problems

본 논문은 문헌 기반, 증명 생성, 검증을 위한 전문 모듈로 작업을 분해하기 위해 다중 역할 반복 워크플로우를 활용하여 연구 수준의 수학 문제에서 GPT-5.2R 과 같은 강력한 베이스라인을 능가하는 에이전트 프레임워크인 연구 수학 에이전트 (RMA) 를 소개합니다.

원저자: Zelin Zhao, Bo Yuan, Jaemoo Choi, Yongxin Chen

게시일 2026-05-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zelin Zhao, Bo Yuan, Jaemoo Choi, Yongxin Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

수학 세계의 완전히 새롭고 아직 해결되지 않은 미스터리를 풀려고 한다고 상상해 보세요. 이는 책 뒤에 정답이 숨겨져 있고 알려진 레시피만 따르면 되는 고등학교 교과서의 퍼즐과는 다릅니다. 대신, 아직 쓰이지 않은 사전에 새로운 장을 쓰는 것과 같습니다. 규칙을 창안하고, 적절한 단어를 찾아내며, 아이디어가 참임을 증명해야 하며, 동시에 실수로 다른 사람의 작업을 복사하지 않았는지 확인해야 합니다.

이 논문은 이러한 어렵고 해결되지 않은 수학 미스터리를 해결하도록 특별히 설계된 새로운 AI '로봇' 팀인 RMA(Research Math Agents) 를 소개합니다.

다음은 간단한 비유를 통해 설명한 RMA 의 작동 방식입니다:

문제: '고독한 천재' 대 '연구 팀'

이전 AI 시스템은 고독한 천재와 같았습니다. 국제 수학 올림피아드와 같은 대회 수학 문제는 정답이 명확하고 경로가 뚜렷하기 때문에 이를 해결하는 데 뛰어났습니다. 하지만 실제 개방형 연구 수학에 직면하면 종종 막히거나, 사실을 지어내거나 (할루시네이션), 포기하곤 했습니다.

RMA 는 대학 연구실의 전문 연구 팀처럼 행동함으로써 게임의 규칙을 바꿉니다. 모든 일을 혼자 하려는 한 대의 로봇 대신, RMA 는 작업을 구조화된 팀 노력으로 분할합니다.

RMA 팀: 분업

RMA 를 처음부터 시작해 초고층 빌딩 (증명) 을 짓는 건설 작업대로 생각하세요. 그들은 단순히 추측하지 않으며, 세 가지 주요 역할을 가진 엄격한 워크플로우를 따릅니다:

  1. 초기화자 (건축가):

    • 역할: 이 에이전트는 혼란스럽고 복잡한 문제 진술을 살펴보고 명확한 청사진으로 변환합니다. 큰 문제를 작고 관리 가능한 목표들로 분해합니다.
    • 비유: 고객이 "떠다니는 건물을 짓고 싶다"라는 모호한 아이디어를 제시하면, 건축가가 이를 받아 첫 번째 청사진을 그려 정확히 무엇을 건설해야 하는지 정의하는 것과 같습니다.
  2. 제안자들 (건설업자 및 엔지니어):

    • 역할: 이 에이전트들은 청사진을 받아 증명을 구축해 봅니다. 벽에 부딪히면 (논리적 공백), 단순히 포기하지 않습니다. '도서관'으로 돌아가 새로운 도구나 유사한 건물 설계 (교과서의 정리) 를 찾아 다른 건설 방법을 시도합니다.
    • 비유: 다양한 재료와 설계를 시도하는 엔지니어 팀과 같습니다. 보가 부러지면 '불가능하다'고 말하지 않고, 도서관에서 더 강한 강철 합금을 찾아 다시 시도합니다.
  3. 검증자들 (검사관):

    • 역할: 이 에이전트들은 엄격한 건물 검사관처럼 행동합니다. 그들은 아무것도 건설하지 않고 오직 작업만 점검합니다. 논리의 균열, 누락된 단계, 또는 가짜 재료를 찾습니다. 실수를 발견하면 건설업자들에게 수정을 위해 되돌아가라고 보냅니다.
    • 비유: 건물을 돌아다니며 벽을 두드리고 청사진을 확인하는 안전 검사관과 같습니다. 결함을 발견하면 '수정' 티켓을 발급하고, 건설업자들은 진행하기 전에 이를 수정해야 합니다.

'공유 노트' (구조화된 기억)

RMA 의 핵심 요소는 모두가 디지털 노트 (공유 기억) 를 공유한다는 점입니다.

  • 건축가는 청사진을 씁니다.
  • 건설업자들은 건설 노트와 새로운 아이디어를 추가합니다.
  • 검사관들은 비판 노트를 씁니다.
  • 중요하게도: 아무도 이전 내용을 지우지 않습니다. 새로운 페이지를 추가할 뿐입니다. 이는 팀이 저지른 모든 실수와 찾은 모든 도구를 기억하여 실수를 반복하지 않도록 한다는 것을 의미합니다.

'공정 경기' 규칙

AI 가 정답을 찾아보며 부정행위를 하지 않도록 하기 위해 RMA 는 공정 비교 모듈을 갖추고 있습니다.

  • 이는 해결책이 있을 수 있는 웹사이트로 가는 문을 잠그는 엄격한 심판과 같습니다.
  • 이는 AI 가 문제가 생성되기 전에 출판된 오래된 교과서와 논문만 보도록 하여, AI 가 단순히 복사 - 붙여넣기하는 것이 아니라 실제로 생각하고 발견하도록 강제합니다.

결과: 효과가 있었을까요?

연구자들은 유명한 수학자들이 기여한 10 개의 실제 미해결 수학 문제로 구성된 'First Proof' 벤치마크에서 RMA 를 테스트했습니다.

  • 경쟁: 그들은 RMA 를 OpenAI 의 'GPT-5.2R'과 Google DeepMind 의 'Aletheia'를 포함한 다른 최상위 AI 시스템과 비교했습니다.
  • 결과:
    • Aletheia는 문제 중 하나도 해결하지 못했습니다.
    • GPT-5.2R은 10 개 중 3 개를 해결했지만, 때로는 사소한 논리적 오류를 범하거나 약한 답변을 제시했습니다.
    • RMA는 10 개 중 8 개의 문제를 해결했습니다.
    • 더 중요한 것은, 인간 수학자들이 증명을 검토한 결과, RMA 의 해결책이 다른 시스템들보다 더 논리적이고 명확하며 신뢰할 수 있다고 평가했다는 점입니다.

결론

이 논문은 어려운 수학을 푸는 것이 더 똑똑한 '뇌' (단일 강력한 AI 모델) 를 갖는 것이 아니라 더 나은 과정을 갖는 것이라고 주장합니다. 작업을 전문 역할 (건축가, 건설업자, 검사관) 로 분할하고, 공유 노트를 제공하며, 작업을 반복적으로 점검하도록 강제함으로써 RMA 는 가장 똑똑한 단일 AI 조차 해결하지 못하는 문제에 대처할 수 있습니다.

어둠 속에서 혼자 집을 짓도록 한 사람을 요청하는 것과 청사진, 도서관, 안전 검사관이 있는 팀을 고용하는 것의 차이와 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →