OEIS Open: How many conjectures can language models turn into theorems?
이 논문은 OEIS로부터 추출한 492개의 형식화된 수학적 추측으로 구성된 보안 벤치마크인 OEIS Open을 소개하며, 최소한의 도구를 갖춘 언어 모델이 적절한 비용으로 이러한 미해결 문제의 약 30%에서 44%를 자율적으로 해결할 수 있음을 입증하는 동시에, 방대한 문헌에 대한 접근이나 정교한 에이전트 루프가 성능을 유의미하게 향상시키지는 못했음을 보여준다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
숫자들의 거대한 디지털 도서관인 OEIS(온라인 정수 수열 백과사전)를 상상해 보십시오. 이것은 수학자들이 발견한 패턴(1, 2, 4, 8...과 같은 단순한 것부터 기이하고 신비로운 것까지)을 목록화하는 거대한 카탈로그와 같습니다. 종종 패턴을 나열한 뒤에는 누군가 그 패턴이 영원히 어떻게 작동하는지에 대한 추측을 적어 놓기도 합니다. 이러한 추측을 '추측(conjecture)'이라고 부릅니다. 오랫동안 이 추측들을 증명하는 것은 칠판과 끝없는 인내심을 가진 인간 천재들의 전유물이었습니다. 하지만 최근에는 컴퓨터도 이 퍼즐들을 풀기 위해 도전하기 시작했습니다. 큰 질문은 이것입니다. 인공지능(AI)이 실제로 스스로 진실을 찾아낼 수 있을까요, 아니면 인간이 손을 잡아주어야만 할까요? 이 논문은 AI 에이전트가 허가되지 않은 방법이나 인간의 도움 없이 수학적 추측을 증명하거나 반증하도록 하는 엄격한 테스트를 설정함으로써 이 질문을 파고듭니다.
이 연구를 진행한 Epoch AI 그룹의 연구진은 OEIS OPEN이라는 새로운 도전 과제를 만들었습니다. 이것을 거대한 수학 장애물 코스라고 생각하십시오. 그들은 OEIS에서 가져온 492개의 열린 수학적 추측들을 'Lean'이라는 엄격한 컴퓨터 언어로 번환했는데, 이는 매우 엄격한 심판 역할을 합니다. 이 게임에서 AI 에이전트는 텍스트 편집기, 커맨드 라인(컴퓨터 터미널 같은 것), 그리고 계산기라는 몇 가지 기본적인 도구와 함께 디지털 방에 투입됩니다. AI의 유일한 목표는 컴퓨터 심판이 받아들일 수 있는 증명을 작성하는 것입니다. 만약 AI가 그 추측이 참임을 증명할 수 없다면, 반드시 그것이 거짓임을 증명해야 합니다. 함정은 무엇일까요? AI에게는 각 추측당 컴퓨터 사용 시간으로 쓸 수 있는 50달러라는 엄격한 예산이 주어집니다. 만약 문제를 해결하기 전에 돈을 다 써버리면, AI는 패배합니다.
결과는 놀라울 정도로 유망했습니다. 가장 뛰어난 AI 모델들은 492개의 추측 중 147개를 해결하여 약 **30%**의 점수를 기록했습니다. 이는 그들이 이 미지의 수열 중 거의 3분의 1을 스스로 확정된 정리(또는 반증)로 바꾸어 놓았음을 의미합니다. 가장 성공적인 모델은 Claude Opus 4.8로 30%를 해결했으며, GPT-5.5와 Gemini 3.5 Flash도 각각 26%와 22%를 해결하며 선전했습니다. 이것이 중요한 이유는 연구진이 매우 단순한 AI 설정을 사용했기 때문입니다. 즉, 시도하고, 확인하고, 다시 시도하는 기본적인 루프 형태였습니다. 이는 거대한 팀의 도움을 받는 복잡한 로봇이 아니었습니다. 사실, 이 단순한 접근 방식은 동일한 문제의 9%만을 해결한 훨씬 더 복잡한 시스템인 AlphaProof Nexus보다 더 나은 성과를 냈습니다.
연구진은 AI가 더 똑똑해질 수 있는지 확인하기 위해 몇 가지 "파워업(power-ups)"을 테스트했습니다. 그들은 AI가 과거 인간의 작업으로부터 배울 수 있기를 바라며 인터넷상의 방대한 수학 논문 라이브러리인 arXiv(476,000개)에 대한 접근 권한을 주었습니다. 또한, 하위 에이전트에게 작업을 위임하거나 장기간 기억할 수 있는 더 복적인 "두뇌"를 제공하는 실험도 했습니다. 놀랍게도, 이 두 가지 업그레이드 모두 도움이 되지 않았습니다. AI는 라이브러리를 통해 더 많은 추측을 해결하지 못했고, 복잡한 두뇌 역시 더 빠르거나 정확하게 만들지 못했습니다. 이 특정 유형의 수학 문제에 있어서는 방대한 라이브러리나 복잡한 개성보다는 단순하고 집중된 도구 세트와 적절한 예산이 더 중요하다는 것을 보여줍니다.
흥หนึ่ง 흥미로운 발견은, 연구진이 단일 추측에 더 많은 비용을 지불할 용의가 있을수록 AI가 문제를 해결할 가능성이 높아졌다는 점입니다. 성공률은 꾸준하고 예측 가능한 방식으로 상승했습니다. 예산을 열 번 늘릴 때마다 성공률은 약 10%포인트씩 뛰어올랐습니다. 이는 만약 AI에게 더 큰 예산을 주었다면 더 많은 문제를 해결할 수 있었을 것임을 시사합니다. 그러나 논문은 이 추측들이 수학적으로는 유효하지만, 대부분 수학계의 "미지(unknowns)"라는 점을 주의 깊게 언급합니다. 이것들은 리만 가설처럼 유명하고 세상을 바꿀 만한 난제들이 아니라, 인간 수학자들의 관심을 거의 받지 못한 작고 무명한 퍼즐들일 가능성이 높습니다.
그렇다면 이 모든 것이 무엇을 의미할까요? 이 논문은 AI가 이제 적절한 비용으로 실제 열린 수학 연구 문제를 자율적으로 해결할 능력이 있음을 보여줍니다. AI는 이제 단순히 답이 알려진 퍼즐을 푸는 수준을 넘어, 우리가 알고 있는 지식의 경계를 넓히고 있습니다. 하지만 한계도 보여줍니다. AI는 더 많은 책을 읽는다고 해서 더 똑똑해지지 않았으며, 여전히 가장 어렵고 모호한 문제들에는 고전하고 있습니다. 연구진은 우리가 AI가 하룻밤 사이에 천재 수학자가 되는 "질적 도약"을 목격하고 있는 것은 아니지만, 하나씩 숫자를 풀어가며 미지의 영역을 깎아 나가는 꾸준하고 강력한 도구를 목격하고 있다고 결론짓습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.