LeanMarathon: Toward Reliable AI Co-Mathematicians through Long-Horizon Lean Autoformalization
LeanMarathon은 장기적 자동 형식화(autoformalization) 실패를 극복하기 위해 진화하는 청사진과 2단계 오케스트레이터를 중심으로 하는 멀티 에이전트 시스템을 도입하였으며, 최근 에르되시(Erdős) 문제에 관한 4편의 연구 논문에서 7개의 정리를 오류 없이 성공적으로 형식화하였습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 거대한 레고 성을 쌓으려고 한다고 상상해 보세요. 하지만 당신은 AI 로봇 팀과 함께 이 일을 하고 있습니다. 목표는 단순히 성 하나를 만드는 것이 아닙니다. 인간 수학자가 작성한 매우 복잡하고 손으로 쓴 설계도를 바탕으로 성을 만드는 것이며, 모든 레고 조각은 물리 법칙(이 경우에는 'Lean'이라는 컴퓨터 언어의 엄격한 규칙)에 따라 완벽하게 들어맞아야 합니다.
이전 시도들의 문제는 만약 로봇 한 대가 초기에 작은 실수—예를 들어 잘못된 색상의 브릭을 사용하거나 설계도의 한 줄을 잘못 읽는 실수—를 저지르면, 전체 팀이 그 오류 위에 계속해서 성을 쌓아 올린다는 점이었습니다. 결국, 그들은 눈으로 보기에는 멀쩡해 보이는 거대하고 아름다운 성을 완성하겠지만, 기초가 잘못되었기 때문에 지붕을 올리려는 순간 무너져 버릴 것입니다. 로봇들은 혼란에 빠지거나, 서로 다투거나, 혹은 며칠 동안 똑같은 실수를 반복하며 계속 작업을 이어갔을 것입니다.
LeanMarathon은 로봇 팀이 무너지지 않도록 조직하는 새로운 방법입니다. 이 방식이 어떻게 작동하는지 쉬운 비유를 통해 설명하겠습니다.
1. "살아있는 설계도" (기록 시스템)
로봇들에게 정적인 PDF 파일을 주는 대신, LeanMarathon은 세 가지 역할을 동시에 수행하는 단 하나의 살아있는 문서를 사용합니다:
- 수학의 골격 (형식적 코드).
- 평이한 영어로 쓰인 이야기 (자연어 설명).
- 모든 조각이 다음 조각과 어떻게 연결되는지 보여주는 지도.
이것은 마치 모든 문장 옆에 작은 "체크 표시"가 있는 공유 구글 문서와 같습니다. 만약 어떤 문장이 틀리면 체크 표시가 빨간색으로 변합니다. 로봇들은 이 빨간 표시를 그냥 무시할 수 없습니다. 반드시 수정하고 다음 단계로 넘어가야 합니다.
2. 네 명의 특화된 로봇 (에이전트)
모든 것을 다 하려는 하나의 슈퍼 로봇(이는 로봇을 과부하 상태로 만들고 혼란에 빠뜨리기 쉽습니다) 대신, LeanMarathon은 네 명의 특화된 로봇을 사용합니다. 각 로봇은 매우 구체적인 직무를 가지며, **"자신의 구역만 만질 수 있다"**는 엄격한 규칙을 따릅니다.
- 설계자 (Blueprinter): 이 로봇은 원래의 인간 논문을 읽고 이를 작고 관리 가능한 레고 조각들로 나눕니다. 초기 지도를 그리지만 아직 벽을 쌓지는 않습니다. 구조를 설정할 뿐입니다.
- 검사관 (Target-Reviewer): 본격적인 건축이 시작되기 전, 이 로봇은 지도를 원래의 인간 논문과 대조하여 확인합니다. "설계자가 목표를 오해했는가?"를 묻습니다. 만약 지도는 "탑을 쌓으라"고 되어 있는데 논문은 "다리를 놓으라"고 되어 있다면, 검사관은 즉시 모든 것을 중단시키고 수정을 위한 티켓을 발행합니다. 이 로봇은 건축하지 않습니다. 오직 확인만 합니다.
- 건축가 (Worker): 이들은 실제로 힘든 일을 수행하는 로봇들입니다. 하지만 여기에는 비결이 있습니다. 각 건축가는 오직 하나의 아주 작은 레고 조각만을 배정받습니다. 이들은 병렬로(동시에 여러 명이) 작업합니다. 이들은 자신에게 할당된 특정 조각과 그 주변의 즉각적인 브릭들만 만질 수 있습니다. 옆 동료의 작업물에는 손을 댈 수 없습니다. 만약 막히게 되면, 추측하는 대신 손을 들어 도움을 요청합니다.
- 수정자 (Refiner): 만약 건축가가 막히거나 검사관이 문제를 발견하면, 수정자가 투입됩니다. 이 로봇은 문제가 발생한 특정 구역을 살펴보고, 무엇이 잘못되었는지 이해하기 위해 원래의 인간 논문을 다시 읽습니다. 이 로봇은 신체의 다른 부분은 건강하게 유지하면서 특정 장기만을 수술하는 외과의사와 같습니다.
3. "신호등" (CI 게이트)
이것은 가장 중요한 안전 장치입니다. 건설 현장 입구에 있는 교통 신호등을 상상해 보세요.
- 각 건축가가 조각 하나를 완성하거나 수정자가 수리를 마칠 때마다, 그들은 신호등 앞에서 멈춰야 합니다.
- 컴퓨터 프로그램(신호등)이 자동으로 확인합니다: "이 조각이 잘 맞는가? 이야기와 일치하는가? 올바르게 연결되었는가?"
- 통과하면, 그 조각은 메인 성 구조에 합쳐집니다.
- 실패하면, 조각은 즉시 거부됩니다. 로봇은 다시 시도해야 합니다.
- 핵심은: 이 과정은 자동이며 즉각적으로 일어납니다. 사람이 모든 브릭을 일일이 확인할 필요가 없습니다. 이는 "나쁜 브릭"이 메인 구조 안으로 들어오는 것을 방지합니다.
4. "마라톤" 전략
"마라톤"이라는 이름은 이들이 길고 어려운 과제를 처리하는 방식에서 왔습니다.
- 기존 방식: 한 로봇이 마라톤 전체를 혼자 달리려 합니다. 그러다 지치고, 환각 증상을 보이며, 쓰러집니다.
- LeanMarathon 방식: 그들은 마라톤을 아주 짧은 스프린트(단거리 경주)로 나눕니다. 만약 한 로봇이 넘어지더라도, 그 하나의 스프린트만 영향을 받을 뿐입니다. 나머지 팀원들은 계속 달려 나갑니다. 작업이 작고 독립적인 조각들로 나뉘어 있기 때문에, 팀은 며칠간의 진척을 잃지 않고도 즉각적으로 실수로부터 회복할 수 있습니다.
실제로 무엇을 달성했나요?
연구진은 AI의 도움을 받아 작성된 두 개의 매우 어렵고 실제적인 수학 논문에 이 시스템을 테스트했습니다. 이 논문들에는 네 가지 유명한 미해결 수학 문제(Erdős 문제)가 포함되어 있었습니다.
- 결과: LeanMarathon은 이 논문들의 모든 수학적 내용을 완벽하게 검증된 코드로 변환하는 데 성공했습니다. 이 시스템은 258개의 서로 다른 수학적 단계(보조 정리 및 정리)를 오류 없이 증명해 냈습니다.
- 비교: 그들은 동일한 논문에 대해 상용 "올인원" AI 로봇(Aristotle이라는 이름)을 테스트했습니다. 이 로봇은 모든 것을 한꺼번에 하려다 혼란에 빠졌고, 며칠 동안 실행한 후에도 작업을 끝내지 못했습니다. 이 로봇은 완성되지 않은, 망가진 조각들을 남겼습니다.
- 교훈: 이 논문은 AI로 어려운 수학을 수행하기 위해서는 단순히 더 "똑똑한" 로봇이 필요한 것이 아니라, 실수를 방지하고 팀이 원래의 목표에 집중할 수 있게 하는 더 나은 팀 구조가 필요하다는 것을 보여줍니다.
요약하자면, LeanMarathon은 AI 로봇을 엄격한 규칙과 자동 점검 기능이 있는 절제되고 특화된 팀으로 조직함으로써, 복잡하고 긴 수학적 논증을 완벽하게 검증된 오류 없는 코드로 바꿀 수 있음을 증명합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.