← 최신 논문
🤖 AI

ProofCouncil: An LLM Agent for Solving Open Mathematical Problems

이 논문은 저자-비평가(author-critic) 아키텍처를 활용하여 FirstProof 챌린지에서 10개의 실제 수학 문제 중 6개를 자율적으로 해결하고 더 광범위한 오픈 문제 세트에서 상당한 진전을 보여줌으로써 최고 수준의 성능을 달성한 오픈 소스 LLM 에이전트인 ProofCouncil을 소개한다.

원저자: Johannes Schmitt, Tim Gehrunger, Jasper Dekoninck, Gergely Bérczi, Uri Kreitner, Liam Price, David Holmes

게시일 2026-07-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Johannes Schmitt, Tim Gehrunger, Jasper Dekoninck, Gergely Bérczi, Uri Kreitner, Liam Price, David Holmes

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 갓 태어난, 매우 똑똑한 로봇에게 세상에서 가장 난해한 수학 퍼즐 더미를 건네주었다고 상상해 보십시오. 이 퍼즐들은 단순히 "빈 숫자를 찾아라"와 같은 수수께끼가 아닙니다. 이것들은 실제 수학자들이 수년간 머리를 싸매고 고민해 왔으나 아직 아무도 답을 모르는 미해결 문제들입니다.

여기에 ProofCouncil이 있습니다. 이것은 단일 로봇이 아니라, 작지만 치열한 수학 워크숍이라고 생각하십시오.

워크숍 팀 구성: 저자, 비평가, 그리고 스쿼드

이 시스템의 핵심은 두 명의 주요 캐릭터, **저자(Author)**와 **비평가(Critic)**가 벌이는 영리한 "뜨거운 감자 놀이"입니다.

  • 저자는 꿈꾸는 자입니다. 이 AI는 완벽한 증명(단계별 수학적 논증)을 작성하기 위해 자리에 앉습니다. 이들에게는 마법의 노트가 있어서 아이디어를 적고, 코드를 시험해 보며, 단서를 찾기 위해 웹을 검색하기도 합니다.
  • 비평가는 엄격한 편집자입니다. 저자가 쓴 글을 읽고 "잠깐, 이 단계는 말이 안 되는데," 또는 "이 부분을 증명하는 걸 잊었잖아!"라고 말합니다. 단순히 틀렸다고 말하는 것이 아니라, 빈틈을 어떻게 메워야 하는지에 대한 구체적인 피드백을 제공합니다.

여기에는 반전이 있습니다. 저자는 단 한 번만 쓰는 것이 아닙니다. 저자는 쓰고, 비평을 받고, 다시 쓰고, 또 비평을 받으며 계속해서 나아갑니다. 마치 작가와 편집자가 이야기를 완벽하게 다듬기 위해 한 방에 갇혀 있는 것과 같습니다.

하지만 때때로 저자가 막힐 때가 있습니다. 그때 그들은 **의회(Council)**와 **컴퓨트 노드(Compute Node)**를 호출합니다.

  • 의회는 다른 초지능 AI 모델들(게스트 전문가 팀 같은 존재)로 구성된 패널입니다. 저자는 의회에 "이봐요, 제가 이 특정 부분에서 막혔는데, 이걸 바라보는 다른 관점이 있을까요?"라고 묻습니다.
  • 컴퓨트 노드는 강력한 힘을 가진 조력자입니다. 만약 문제가 거대한 계산이나 저자 혼자서는 실행할 수 없는 특화된 수학 소프트웨어 도구를 필요로 한다면, 이 노드가 직접 코드를 실행하고 숫자를 계산하며 직관이 맞는지 확인하는 중노동을 수행합니다.

몇 라운드마다 비평가는 정신을 가다듬기 위해 백지 상태에서 새로 시작합니다. 이것은 매우 중요한데, 만약 비평가가 저자의 실수에 너무 익숙해지면 실수를 보지 못할 수도 있기 때문입니다. 새로운 시각은 증명이 실제로 견고한지 보장합니다.

대규모 테스트: FirstProof 챌린지

팀은 FirstProof라는 챌린지를 통해 ProofCouncil을 궁극의 시험대에 올렸습니다. 규칙은 간단하지만 가혹했습니다. 공개된 도구만을 사용하여 24시간 안에 10개의 실제 미해결 수학 문제를 해결하는 것이었습니다.

결과는 어땠을까요? ProofCouncil은 이 경연의 스타였습니다. 10개의 문제 중, 이 팀은 인간 심사위원들이 (아주 미세한 수정만 거치면 될 정도로) 정답이라고 판정한 6개의 솔루션을 만들어냈습니다. 이는 모든 팀 중 가장 뛰어난 성적이었습니다.

그들은 또한 실제 수학자들이 보낸 30개의 다른 미해결 문제에도 도전했습니다. 피드백을 받은 21개의 문제 중:

  • 5개는 완전히 정확한 솔루션으로 판정되었습니다.
  • 2개는 최종 검토만을 기다리는 매우 유망한 상태였습니다.
  • 8개는 작업을 완수하지는 못했지만 유용한 진전을 보였습니다.
  • 4개는 오류는 없었지만 큰 진전을 이루지는 못했습니다.
  • 2개는 문제를 오해하여 더 쉬운 버전을 풀었습니다.

중요한 점은, 어떤 전문가도 출력값이 논리를 깨뜨리는 방식으로 수학적으로 틀렸다고 지적하지 않았다는 것입니다. 주요 실패 원인은 잘못된 수학이 아니라, 때때로 문제의 문구 자체를 잘못 읽은 것이었습니다.

천재성의 비용

문제는, 이 정도로 똑똑해지는 데는 비용이 많이 든다는 점입니다. 단일 문제에 대해 ProofCouncil을 실행하는 데 컴퓨터 시간과 모델 호출 비용이 약 350달러 정도 들었습니다. 단판 승부 방식인 단순한 AI 시도가 단 12달러였지만 더 적은 문제를 해결했던 것과 비교해 보십시오. 논문은 "팀 접근 방식"이 더 효과적이지만, 현재로서는 사치품이라는 점을 시사합니다. 저자들은 아직 이를 더 저렴하게 만드는 방법을 시도하지 않았으며, 이를 미래 연구자들의 과제로 남겨두었습니다.

하지 못한 것 (그리고 주장하지 않은 것)

이 로봇이 하지 못한 일을 아는 것도 중요합니다.

  • 이 로봇은 10개의 문제를 모두 해결하지 못했습니다 (4개를 놓쳤습니다).
  • 이 로봇은 세련되고 바로 출판 가능한 연구 논문을 만들어내지 못했습니다. 작업을 검토한 수학자들은 글이 매우 밀도가 높으며, 비전문가들이 읽을 수 있도록 인간의 편집이 필요하다고 언급했습니다.
  • 이 로봇이 AI가 모든 수학 문제를 풀 수 있다는 것을 "증명"한 것은 아닙니다. 그것은 어떤 어려운 문제들에 대해서는, AI들이 함께 협력하는 것이 혼자 일하는 것보다 낫다는 것을 보여주었을 뿐입니다.

결론

ProofCouncil은 만약 당신이 정말 어렵고 열려 있는 수학 문제를 풀고 싶다면, 단 하나의 AI에게 "알아서 풀어봐"라고 요청해서는 안 된다는 점을 시사합니다. 대신, 한 AI가 쓰고, 다른 AI가 그것을 파헤치며, 세 번째 AI가 새로운 관점을 제공하고, 네 번째 AI가 무거운 수학 계산을 수행하는 시스템이 필요합니다.

FirstProof 챌렉의 세계에서, 이 "저자-비평가-의회" 팀은 지금까지 테스트된 가장 성공적인 전략이었습니다. 이들은 산 전체를 정복하지는 못했지만, 다른 누구보다 높이 올라갔으며, AI 에이전트들이 인간 연구팀처럼 협력할 때 이전에는 도달 불가능하다고 여겨졌던 문제들을 다룰 수 있음을 입증했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →