← 최신 논문
🤖 AI

First Proof Second Batch

이 논문은 수학자들이 기여한 10개의 서로 다른 문제와 인간의 풀이 및 심사 보고서를 포함한 보충 자료를 제시함으로써, 연구 수준의 수학 문제를 해결하는 데 있어 현재 AI 시스템의 능력을 평가한다.

원저자: Mohammed Abouzaid, Nikhil Srivastava, Rachel Ward, Lauren Williams

게시일 2026-06-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mohammed Abouzaid, Nikhil Srivastava, Rachel Ward, Lauren Williams

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

수학자들이 고도의 "요리 경연 대회"를 개최하기로 결정한 상황을 상상해 보십시오. 케이크를 굽는 대신, 인공지능에게 새로운 수학적 증명을 만들어내라고 요구하는 것입니다. 이 문서는 그 경연의 두 번째 라운드인 First Proof Second Batch의 공식 성적표입니다.

이곳에서 일어난 일을 쉬운 용어로 풀어서 설명하면 다음과 같습니다.

설정: 새로운 형태의 시험

이 실험의 첫 번째 라운드에서는 누구나 문제를 풀 수 있도록 개방되어 있었습니다. 마치 오픈 하우스와 같았습니다. 하지만 이번 두 번째 라운드에서 주최측은 훨씬 더 엄격하고 과학적인 방식을 원했습니다.

  • 셰프들 (AI 시스템): 주최측은 네 명의 특정 "셰프"를 초대하여 경합을 벌이게 했습니다. 이들은 단순히 무작위 컴퓨터가 아니었습니다. UCLA나 프린스턴 같은 유수의 대학교와 OpenAI 같은 기업에서 만든 고급 AI 시스템들이었습니다.
  • 재료 (문제들): 주최측은 AI에게 교과서에 나오는 이미 풀린 오래된 수학 문제들을 주지 않았습니다. 대신, 실제 인간 수학자들이 최근 자신의 연구에서 발견한 10개의 완전히 새로운 미해결 퍼즐을 던져주었습니다. 이 문제들은 인터넷에 게시되거나 학술지에 발표된 적이 없는 것들이었습니다.
  • 규칙: AI는 인간이 곁에서 정답을 속삭여주지 않는 상태에서 스스로 문제를 해결해야 했습니다. 주최측은 모든 단계를 지켜보았고, AI가 입력하는 모든 단어를 기록했으며, "주방"을 운영하는 데 드는 비용을 엄격하게 기록했습니다.

심사: 블라인드 테이스팅

AI가 제출한 "요리"(증명)가 완성되자, 30명의 전문가 수학자로 구성된 심사단이 판정을 내렸습니다. 공정성을 위해 심사위원들은 어떤 AI가 만든 요리인지 알지 못했습니다. 그들은 각 솔루션에 대해 다음과 같은 등급을 매겼습니다:

  • 거의 완벽함 (Essentially Flawless): 바로 서빙할 수 있는 완벽한 요리.
  • 소폭 수정 필요 (Minor Revisions): 맛은 좋지만, 소금을 한 꼬집 더 넣거나 가니쉬를 더 잘 갖춰야 함.
  • 대폭 수정 필요 (Major Revisions): 메인 요리는 준비되었으나, 소스가 탔거나 재료가 빠져 있음. 많은 작업이 필요함.
  • 탈락 (Rejected): 먹을 수 없는 요리.

결과: 엇갈린 성적표

결과는 놀라운 돌파구와 당혹스러운 실패가 뒤섞인 모습이었습니다.

1. "와우" 모먼트 (성공 사례)

  • 깜짝 손님: 복잡한 유체 방정식과 관련된 문제(문제 5)에서, 한 AI는 단순히 인간의 해법을 복사하는 데 그치지 않고, 이를 해결하기 위한 완전히 새로운 방식을 발명해 냈습니다. 심사위원들은 매우 감명받았으며 이를 "거의 완벽하다"고 평가했습니다. 이는 마치 셰프가 이전에 어떤 인간도 생각하지 못했던 새로운 요리 기법을 발명한 것과 같았습니다.
  • 모방자들: 또 다른 문제(문제 6)의 경우, 두 AI가 완벽하게 문제를 풀어냈습니다. 그들은 인간의 해법 경로를 따랐지만, 매우 기계적인 정밀함으로 수행하여 심사위원들로부터 "글쓰기 스타일은 다소 로봇 같지만, 수학적으로는 정확하다"는 평을 들었습니다.

2. "환각" 문제 (실패 사례)

  • 가짜 인용: AI가 존재하지 않거나 AI의 주장과 일치하지 않는 책이나 논문을 자신 있게 인용하는 문제가 반복적으로 나타났습니다. 이는 마치 셰프가 "이 소스는 유명한 프랑스 셰프의 비밀 재료로 만들었습니다"라고 말했지만, 막상 책을 확인해보니 그 셰프는 그런 글을 쓴 적이 없는 것과 같습니다.
  • 표절: 한 사례에서는, 한 AI가 기하학 문제를 풀면서 인간 수학자의 이전 작업물을 거의 토씨 하나 틀리지 않고 그대로 복사하여 사용했습니다. 특이한 라벨과 용어까지 똑같이 사용하면서도 출처를 밝히는 것을 잊었습니다. 만약 인간 학생이 이랬다면 부정행위로 퇴학당했을 것입니다.
  • 잘못된 길: 여러 문제에서 AI들은 실제로 거짓인 것을 증명하려고 시도하거나, 터무니없는 논리의 루프에 빠졌습니다. 한 AI는 존재하지 않는 정리를 만들어내어 기하학 문제를 풀려고 시켰는데, 이는 자신의 증명을 완결된 것처럼 보이게 하기 위해 심사위원들에게 거짓말을 하는 것과 같았습니다.

3. 요리 비용
보고서는 또한 "식사 비용"에 대해서도 살펴보았습니다.

  • 어떤 AI 시스템은 저렴했지만 실수를 저질렀습니다.
  • 어떤 시스템은 믿기 힘들 정도로 비싸서, 단 하나의 솔루션을 만드는 데 컴퓨터 시간으로 수천 달러를 소모하기도 했습니다.
  • 가장 성공적인 솔루션들은 대개 가장 많은 "생각 시간"(토큰)과 비용을 필요로 했습니다.

핵심 결론

이 논문은 AI가 일상적인 수학에는 매우 능숙해지고 있다고 결론짓습니다. 만약 문제가 이전에 본 적이 있는 형태이거나, 단순히 알려진 레시피를 따라야 하는 것이라면 AI는 잘 해낼 수 있습니다.

하지만 진정한 창의성—새로운 아이디어를 내놓거나, 서로 관련 없는 두 분야 사이의 깊은 연결 고리를 찾아내거나, 혹은 무언가를 지어내는 함정을 피하는 능력—에 있어서 AI는 여전히 고전하고 있습니다. AI는 종로 가짜 논문을 인용하거나 논증의 가장 어려운 부분을 건너뛰는 방식으로 "그럴듯하게 속이려는" 경향이 있습니다.

요약하자면: AI는 레시피를 완벽하게 따를 수는 있지만, 스스로 새로운 요리 스타일을 발명하기에는 아직 준비가 되지 않은, 매우 빠르고 매우 비싼 견습 요리사입니다. AI의 작업을 검토하고, 인용을 수정하며, 재료를 환각하고 있지는 않은지 확인해 줄 인간 셰프가 반드시 필요합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →