← 최신 논문
💻 computer science

Human vs Machine Mathematical Difficulty on Project Euler: An Experimental Analysis

이 논문은 26개의 AI 모델이 50개의 프로젝트 오일러 문제에 대해 시도한 3,840건의 사례를 분석하여, 기계의 노력이 인간의 난이도에 따라 하위 선형적으로 확장된다는 점(더 나쁜 확장을 예측하는 가설에 반함)을 입증하는 한편, 성공 확률은 지수적 감소 모델을 따르며, 궁극적으로 최첨단 성능의 지평에 대해 75일의 배가 시간을 추정한다.

원저자: David Holmes, Johannes Schmitt

게시일 2026-06-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: David Holmes, Johannes Schmitt

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

개요: 시간과 복잡성을 향한 경주

Project Euler를 수학 문제들을 위한 거대한 공공 체육관이라고 상상해 보세요. 사람(그리고 이제는 AI까지)들이 이 퍼즐을 풀기 위해 등록합니다. 체육관은 가장 빠른 인간의 기록을 위해 스톱워치를 켜두고, 정답을 찾는 데 정확히 얼마나 걸렸는지 기록합니다.

이 논문의 저자들은 단순한 질문에 답하고자 했습니다: 수학 문제가 어려워짐에 따라, AI 시스템은 인간보다 더 빠른 속도로 성능이 저하되는가?

수학자 티모시 가워스(Timothy Gowers)가 제안한 한 가지 이론이 있었습니다. AI가 금방 지쳐버리는 단거리 스프린터와 같을 것이라는 가설이었죠. 그 아이디어는 이렇습니다: "AI는 쉬운 단거리 달리기에는 빠르지만, 경주가 길어지고 힘들어질수록 AI의 노력은 폭발적으로 증가하며 결국 인간에게 뒤처질 것이다."

저자들은 50개의 최근 수학 문제와 26개의 서로 다른 AI 모델 데이터를 사용하여 이 이론을 테스트했습니다. 결과는 다음과 같습니다.


1. "노력" 테스트: AI는 더 빨리 지치는가?

이론: 저자들은 인간이 어려운 문제를 푸는 데 1시간을 보낼 때마다, AI는 훨씬 더 많은 시간(컴퓨터 연산 능력, 즉 생성된 '토큰'이나 단어 수로 측정됨)을 써야 할 것이라고 생각했습니다. 문제가 어려워질수록 AI의 노력이 급증할 것이라 예상했습니다.

비유: 인간과 로봇이 산을 오르고 있다고 상상해 보세요.

  • 예상: 로봇은 산 아래에서는 훌륭하지만, 경사가 가팔라질수록 로봇은 인간이 한 걸음 내디딜 때 100걸음을 걸어야 합니다.
  • 실제: 저자들은 그 반대의 결과를 발견했습니다. 가장 강력한 AI 모델들의 경우, 산이 가팔라질수록 로봇은 인간에 비해 오히려 더 효율적이었습니다.
    • 만약 인간이 어려운 문제를 푸는 데 1시간이 걸린다면, AI는 2시간 분량의 컴퓨터 작업을 할 수도 있습니다.
    • 하지만 인간이 10시간이 걸린다면, AI는 15시간 정도의 컴퓨터 작업만 하면 될 수도 있습니다.
    • 결과: 그 격차는 벌어지지 않았고, 오히려 줄어들었습니다. AI는 이 특정 문제들에 대해 인간보다 더 잘 적응(scale)했습니다. 저자들은 이를 b<1b < 1이라고 부르는데, 이는 기본적으로 "AI가 우리가 예상했던 것보다 더 빠르게 난이도를 처리하는 능력이 향상되고 있음"을 의미합니다.

왜 그럴까요? 저자들은 이 수학 문제들에 많은 "코딩" 또는 "구현" 단계가 포함되어 있다고 추측합니다. 인간은 코드를 입력하고 디버깅하는 데 많은 시간을 쓰지만, AI는 타이핑과 디버깅에 매우 빠릅니다. 따라서 AI가 "생각"하는 부분에서는 느릴지라도, "수행"하는 부분에서의 초고속 능력 덕분에 전체적인 시간이 매우 효율적으로 보이게 됩니다.

2. "신뢰성" 테스트: AI는 그냥 포기해 버리는가?

이론: AI가 효율적일 수는 있지만, 문제가 어려워지면 단순히 혼란에 빠져 실패할 수도 있습니다. 저자들은 성공 확률이 예측 가능한 방식으로 떨어지는지 테스트했습니다.

비유: 어두운 숲속을 걷고 있다고 상상해 보세요.

  • 이론: 발걸음을 옮길 때마다 넘어질 확률이 일정하게 존재합니다. 경로가 길어질수록(문제가 어려워질수록) 넘어질 가능성이 높아집니다.
  • 실제: 데이터는 이 모델에 완벽하게 부합했습니다. AI의 성공률은 매끄럽고 예측 가능한 곡선을 그리며 떨어졌습니다.
    • 문제가 인간에게 1시간 걸리는 문제라면, AI는 90%의 확률로 성공할 수 있습니다.
    • 문제가 인간에게 4시간 걸리는 문제라면, AI의 성공률은 약 50%로 떨어집니다.
    • 결과: AI는 "에너지가 고갈되거나" "잘못된 방향으로 탐색해서" 실패하는 것이 아닙니다. AI는 장기간의 작업에 있어 신뢰성이 떨어지는 것입니다. 마치 달리기는 빠르지만, 경주가 길어지면 계속 자기 신발 끈에 걸려 넘어지는 러너와 같습니다.

3. "지평선(Horizon)" 테스트: AI는 얼마나 오래 버틸 수 있는가?

저자들은 "50% 지평선"(h50h_{50})을 계산했습니다. 이는 AI가 문제를 해결할 확률이 50/50이 되는 지점입니다.

  • 발견: 이 연구에서 가장 뛰어난 AI 모델들은 인간의 시간이 대략 2.5~4.3시간 정도 걸리는 지점에서 50% 성공률에 도달했습니다.
  • 비유: AI를 손전등이라고 생각해 보세요. 잠시 동안은 밝게 빛나지만, 인간이 문제를 풀기 위해 10시간을 걸어야 한다면, AI의 빛(올바른 궤도를 유지하는 능력)은 4시간째에 이미 깜빡이며 꺼져버립니다.
  • 추세: 저자들은 이 "손전등"이 얼마나 빨리 밝아지고 있는지 추적했습니다. 그 결과, 최고의 AI는 약 75일마다 능력이 두 배로 향상되는 속도로 그 "지구력"을 높이고 있음을 발견했습니다.

4. "에이전트(Agent)"의 반전: AI에게 팀을 주다

논문은 또한 "에이전트형(Agentic)" 모델도 살펴보았습니다. 이들은 단순히 한 번 답하는 것이 아니라, 문제를 분해하고, 다시 시도하고, 자신의 작업을 검토할 수 있는 도구(마치 계산기와 연습장을 사용하는 인간처럼)를 가진 AI입니다.

  • 결과: 이러한 "AI 팀"은 일반적인 AI(인간 시간 기준 0.3시간에서 50% 지점)보다 더 긴 시간(인간 시간 기준 최대 1.7시간)이 걸리는 문제들도 해결할 수 있었습니다.
  • 주의점: 하지만 이러한 도구를 사용하더라도, 최상위 인간들이 10시간 이상 걸려 푸는 아주 어려운 문제들은 여전히 해결하지 못했습니다. 그저 "지구력의 한계"를 조금 더 밀어냈을 뿐입니다.

요약: 이것이 의미하는 바는 무엇인가?

이 논문은 AI가 단순히 어려워지는 문제 앞에서 "연료가 떨어져서" 비효율적으로 변할 것이라는 기존의 공포가 이 특정 수학 퍼즐들에 대해서는 사실이 아님을 결론짓습니다.

  • 효율성: AI는 문제가 어려워질수록 이러한 과업에서 인간보다 오히려 더 효율적입니다.
  • 진짜 문제: 병목 현상은 효율성이 아니라 신뢰성입니다. AI는 작업을 수행할 수는 있지만, 작업이 너무 길어지면 길을 잃거나 실수를 범하는 경향이 있습니다.
  • 한계: 현재 최고의 AI는 인간이 약 4시간 정도 걸리는 문제를 안정적으로 처리할 수 있습니다. 그보다 더 어려운 문제는 AI가 짐작하거나 실패하기 시작합니다.

요약하자면: AI는 지치는 것이 아니라, 단지 주의가 산만해지는 것입니다. AI는 매우 뛰어나고 빠른 일꾼이지만, 성공하기 위해서는 매우 짧고 집중적인 과업이 필요합니다. 만약 길고 복적인 프로젝트를 맡긴다면, AI는 마무리를 하기 전에 아마도 자기 신발 끈에 걸려 넘어질 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →