← 최신 논문
🤖 AI

Measuring AI Ability to Complete Long Software Tasks

이 논문은 AI의 능력을 인간의 노력과 비교하여 정량화하기 위해 "50% 작업 완료 시간 지평(50%-task-completion time horizon)" 지표를 도입하며, 프런티어 모델들이 이제 인간이 통상적으로 50분이 걸리는 작업을 50분 만에 완료할 수 있다는 점을 발견하였고, 이러한 두 배 증가 추세는 AI가 5년 이내에 한 달 분량의 소프트웨어 작업을 자동화할 수 있음을 시사한다.

원저자: Thomas Kwa, Ben West, Joel Becker, Amy Deng, Katharyn Garcia, Max Hasin, Sami Jawhar, Megan Kinniment, Nate Rush, Sydney Von Arx, Ryan Bloom, Thomas Broadley, Haoxing Du, Brian Goodrich, Nikola Jurkov
게시일 2026-07-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Thomas Kwa, Ben West, Joel Becker, Amy Deng, Katharyn Garcia, Max Hasin, Sami Jawhar, Megan Kinniment, Nate Rush, Sydney Von Arx, Ryan Bloom, Thomas Broadley, Haoxing Du, Brian Goodrich, Nikola Jurkovic, Luke Harold Miles, Seraphina Nix, Tao Lin, Chris Painter, Neev Parikh, David Rein, Lucas Jun Koba Sato, Hjalmar Wijk, Daniel M. Ziegler, Elizabeth Barnes, Lawrence Chan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 인간과 로봇 사이의 경주를 지켜보고 있다고 상상해 보세요. 하지만 트랙 위를 달리는 대신, 두 존재 모두 거대하고 끊임없이 불어나는 소프트웨어 퍼즐 더미를 해결하려 노력하고 있습니다. 수년 동안 우리는 까다로운 테스트를 통해 이 AI 로봇들이 얼마나 뛰어난지 측정하려 해왔지만, 그 테스트들은 종ผล 종종 실제 세상에서 로봇이 얼마나 빨리 일할 수 있는지를 제대로 알려주지 못하는 인위적인 비디오 게임 레벨처럼 느껴졌습니다.

이를 해결하기 위해, METR의 연구진은 훨씬 더 직관적인 것을 측정하기로 했습니다: AI가 실패하기 시작할 때까지 얼마나 오래 일할 수 있는가?

그들은 이를 **"타임 호라이즌(Time Horizon, 시간 지평)"**이라고 불렀습니다. 이것은 지능의 배터리 수명과 같습니다. 만약 어떤 AI가 인간이 끝내는 데 10분이 걸리는 퍼즐을 해결할 수 있다면, 그 AI의 타임 호라이즌은 10분입니다. 만약 4시간이 걸리는 작업을 처리할 수 있다면, 그 호라이즌은 4시간입니다. 연구진은 AI가 작업을 정확하게 완수할 확률이 **50%**가 되는 구체적인 지점을 찾고자 했습니다.

거대한 발견: 기하급수적 폭발

연구팀은 1초짜리 단순 확인 작업(특정 파일 이름을 찾아내는 것 등)부터 8시간짜리 방대한 연구 프로젝트에 이르기까지, 170개의 서로 다른 작업으로 구성된 방대한 컬렉션을 모았습니다. 그들은 숙련된 인간 전문가를 고용하여 이 작업들을 완료하는 데 시간이 얼마나 걸리는지 측정했습니다. 그런 다음, 2019년에 출시된 오래된 GPT-2부터 2025년에 출시된 최신 모델인 o3에 이르기까지 12가지의 서로 다른 AI 모델이 이 문제들을 해결하도록 했습니다.

놀라운 점은 바로 이것입니다: AI의 "배터리 수명"이 7개월마다 두 배로 늘어나고 있다는 것입니다.

2019년에 최고의 AI는 인간이 완료하는 데 약 2초 정도 걸리는 작업만을 안정적으로 처리할 수 있었습니다. 2025년에 이르러, 최고 모델들(o3와 같은)은 인간이 약 110분(거의 2시간) 동안 수행하는 작업을 50%의 성공률로 처리할 수 있게 되었습니다.

연구진은 이러한 성장이 단순히 조금 빨라지는 것이 아니라, 기하급수적인 곡선을 그리고 있다는 것을 발견했습니다. 그것은 마치 눈덩이가 언덕 아래로 굴러 내려가며 특정 나무를 지날 때마다 두 배씩 커지는 것을 보는 것과 같습니다. 그들은 2019년부터 2025년까지의 추세를 측정했으며, "배가되는 시간(doubling time)"은 약 207일(대략 7개월)로 나타났습니다.

왜 더 나아지고 있는가?

이 논문은 AI가 단순히 모호한 방식으로 "똑똑해지고" 있는 것이 아니라, 구체적이고 실용적인 기술을 갖추고 있다고 제안합니다. 연구진이 왜 이전 모델들은 실패하고 새로운 모델들은 성공했는지 조사했을 때, 새로운 모델들이 다음과 같은 특징을 가졌음을 발견했습니다:

  • 도구 사용 능력 향상: 계산기나 코드 에디터를 망가뜨리지 않고 사용하는 법을 압니다.
  • 실수 수정 능력 향상: 예전 AI는 실수를 하면 똑같은 오류를 반복하곤 했지만, 새로운 모델은 오류를 포착하고 "앗"이라고 말하며 다른 경로를 시도할 수 있습니다.
  • 논리적 추론 능력 향상: 길을 잃지 않고 사고의 흐름을 따라갈 수 있습니다.

"지저분한" 예외 조항: 현실 세계는 더 어렵다

하지만 이 논문은 로봇들이 아직 전쟁에서 승리했다고 말하지 않도록 매우 주의를 기울입니다. 연구진은 이러한 테스트들이 너무 "깔끔하다"고 명시적으로 주장합니다.

AI가 규칙이 명확한 매뉴얼로 작성되어 있고, 적들은 예측 가능하며, 갑작스러운 정전이 없는 비디오 게임을 플레이하고 있다고 상상해 보세요. 연구진은 실제 업무를 **"지저분하다(messy)"**고 부릅니다. 현실 세계의 작업은 지시 사항이 불분명하거나, 사람들과 대화가 필요하거나, 자원이 고갈되는 상황을 포함합니다.

연구진이 더 "지저분한"(덜 구조화되고 더 혼란스러운) 작업에 대해 AI를 테스트했을 때, AI의 성능은 현저히 떨어졌습니다. 논문은 AI가 "깔끔한" 퍼즐에는 뛰어나지만, 실제 소프트웨어 엔지니어의 하루처럼 혼란스럽고 예측 불가능한 성격에는 여전히 어려움을 겪을 수 있다고 시사합니다. 그들은 AI의 성능 향상이 지저분한 작업에서 둔화된다는 증거를 아직 발견하지 못했지만, "깔끔한 테스트"와 "지저분한 현실" 사이의 간극이 큰 미지수라고 경고합니다.

이것이 미래에 의미하는 바는 무엇인가?

연구진은 이 곡선이 어디로 향하는지 보기 위해 수학적 계산을 수행했습니다. 만약 7개월마다 두 배가 되는 이 추세가 계속된다면, 그들은 5년 이내(2028년 중반에서 2031년 중반 사이)에 AI 시스템이 현재 인간이 한 달(약 167시간) 동안 수행하는 소프트웨어 작업을 자율적으로 완료할 수 있을 것이라고 예측합니다.

그들은 이것이 보장이 아닌 **투영(projection)**임을 강조합니다. 이는 AI가 정확히 이 속도로 계속 개선될 수 있는지, 그리고 그 "깔끔한" 테스트 결과가 "지저분한" 실제 세계에도 적용되는지에 달려 있습니다. 만약 추세가 유지된다면, 우리는 가까운 미래에 복잡한 프로젝트에서 사실상 풀타임 직원처럼 일할 수 있는 AI 에이전트를 보게 될 수도 있습니다. 하지만 만약 추세가 둔화되거나 현실의 "지저분함"이 너무 어려운 것으로 판명된다면, 이 타임라인은 변할 수 있습니다.

핵심 요약

이 논문은 AI가 모든 것을 해결했다고 주장하는 것이 아닙니다. 대신, 우리에게 진보를 측정할 수 있는 새로운 자를 제공합니다. 지난 6년 동안, 긴 호흡의 복잡한 작업을 처리하는 AI의 능력이 무서운 속도로 성장하여 약 7개월마다 작업 일수가 두 배로 늘어났음을 보여줍니다. 비록 지저분한 현실의 혼돈을 다루는 데는 여전히 큰 격차가 있지만, 그 궤적은 AI가 한 달간의 근무 교대를 스스로 수행할 수 있는 날이 생각보다 가까울 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →