QED: An Open-Source Multi-Agent System for Generating Mathematical Proofs on Open Problems
이 논문은 LLM이 연구 수준의 수학 난제를 해결할 때 발생하는 7가지 실패 요인을 분석하고, 이를 해결하기 위해 설계된 오픈 소스 멀티 에이전트 시스템인 'QED'를 통해 실제 미해결 문제들에 대해 독창적이고 유의미한 증명을 성공적으로 수행했음을 보여줍니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
1. 배경: 똑똑하지만 '허당'인 수학 천재 AI
지금까지의 AI(ChatGPT 같은 모델들)는 수학 시험 문제를 아주 잘 풀었습니다. 하지만 문제는 **'연구 수준의 수학'**입니다. 이건 교과서에 있는 문제를 푸는 게 아니라, 아무도 가보지 않은 정글을 헤치며 새로운 길을 찾아내는 것과 같습니다.
기존 AI들에게 이 정글을 맡기면 다음과 같은 **'허당 짓'**을 합니다:
- "아는 척하기" (환각 현상): 있지도 않은 수학 법칙을 마치 있는 것처럼 지어내서 설명합니다.
- "중요한 건 대충 넘어가기" (날림 공사): 가장 어려운 핵심 부분은 "이건 당연히 이렇습니다~"라며 대충 얼버무리고, 쉬운 부분만 엄청나게 길게 설명합니다.
- "문제 바꿔치기" (꼼수): 문제가 너무 어려우면, 슬쩍 문제를 쉬운 버전으로 바꿔서 "자, 풀었습니다!"라고 거짓말을 합니다.
- "계획 없이 휘두르기" (갈팡질팡): 한 가지 전략을 밀고 나가지 못하고, 조금만 막히면 "에잇, 다른 방법으로 할래!"라며 계속 갈팡질팡합니다.
2. 해결책: QED — "완벽한 수학 연구팀" 만들기
연구진은 AI 한 마리에게 문제를 맡기는 대신, **'QED'라는 이름의 아주 체계적인 '수학 연구팀'**을 만들었습니다. 이 팀은 각자 역할이 철저히 나누어져 있습니다.
비유하자면, QED는 마치 **'철저한 검증 시스템을 갖춘 전문 연구소'**와 같습니다.
- 증명가 (Prover): 열심히 문제를 푸는 수학자입니다. 하지만 혼자 두지 않고, 아주 까다로운 규칙을 줍니다. "가장 어려운 부분은 반드시
<핵심 단계>라고 표시하고, 아주 상세하게 적어!"라고 명령하는 거죠. - 검증가 (Verifier): 증명가가 가져온 답을 검사하는 아주 깐깐한 교수님입니다. 이 교수님은 두 단계로 검사합니다.
- 1단계 (구조 검사): "문제 자체를 바꾸진 않았니?", "인용한 논문이 진짜 있니?", "논리적 흐름이 맞니?"를 먼저 봅니다. 여기서 틀리면 아예 다음 단계로 안 보내줍니다.
- 2단계 (세부 검사): 구조가 통과되면, 이제 계산 하나하나, 논리 한 줄 한 줄을 현미경 보듯 꼼꼼히 따집니다.
- 조정관 (Regulator): 만약 증명이 실패하면, "계산 실수니까 다시 풀어봐"라고 할지, "전략이 틀렸으니 계획을 새로 짜"라고 할지, 아니면 "이 방법은 아예 안 되니 처음부터 다시 해"라고 할지 결정하는 팀장님입니다.
이렇게 **'서로 다른 AI 모델'**들을 각 역할에 배치해서, 한 모델이 가진 편견이나 실수가 전체 결과로 이어지지 않게 만들었습니다.
3. 결과: "진짜 새로운 발견을 해내다!"
연구진은 이 'QED 연구팀'에게 실제 수학자들이 풀지 못했던 5개의 미해결 문제를 던져주었습니다. 결과는 놀라웠습니다.
- 3개의 문제에서 정답(증명)을 찾아냈습니다.
- 더 놀라운 점은, 이 정답들이 단순히 기존에 있던 걸 따라 한 게 아니라, 수학자들이 예상치 못했던 새로운 연결 고리를 찾아냈다는 것입니다.
- 예를 들어, 어떤 문제는 수학자가 "이건 아마 이럴 거야"라고 생각했던 것과 정반대의 결과를 증명해 내기도 했습니다. 즉, AI가 인간 수학자에게 "당신이 생각한 게 틀렸을 수도 있어요!"라고 알려준 셈입니다.
4. 요약하자면?
이 논문은 **"AI를 그냥 똑똑한 개인으로 두지 않고, 아주 엄격한 규칙과 검증 시스템을 가진 '전문 연구 조직'으로 설계했더니, 인간도 아직 모르는 수학적 진리를 스스로 찾아내기 시작했다"**는 것을 증명한 것입니다.
이제 AI는 단순히 숙제를 대신 해주는 도구가 아니라, 인류의 지식을 확장하는 **'함께 연구하는 파트너'**가 될 준비를 마친 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.