Frontier AI Forecasting Has a Measurement Problem: An Audit of Progress Evidence
이 논문은 프런티어 AI 예측의 측정 기반을 감사하며, 결정적인 데이터 공백, 벤치마크 불일치, 그리고 소스의 집중화가 단순한 추세 기반 예측을 저해한다는 점을 발견하고, 방어 가능한 예측은 대신 투명한 프로토콜 및 링크를 갖춘 명시적이고 버전이 관리되는 측정 시스템에 근거해야 한다고 주장한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
우리는 인공지능의 역량이 마치 일기 예보처럼 정밀하게 예측되는 시대에 살고 있습니다. 전문가들은 컴퓨터가 얼마나 빨라지고 있는지, 얼마나 많은 데이터가 주입되고 있는지, 그리고 표준화된 테스트에서 얼마나 잘 수행하는지를 보고 기계가 언제 인간 수준의 추론에 도달하거나 심지어 그것을 넘어설지를 추측합니다. 이러한 예측은 대개 달력상의 특정 날짜 형태로 나타나며, 특정 연도가 되면 AI가 복잡한 문제를 해결하거나 특정 과업을 수행할 수 있을 것이라고 시사합니다. 그 논리는 매우 간단해 보입니다. 자동차가 얼마나 빨리 가는지 측정할 수 있다면, 목적지에 언제 도착할지도 계산할 수 있다는 것입니다. 하지만 이 접근 방식은 하나의 숨겨진 가정을 전제로 합니다. 즉, 속도를 측정하는 데 사용된 자(ruler)가 어제와 오늘이 같아야 하며, 속도계가 도로 위의 모든 자동차에 대해 제대로 작동하고 있어야 한다는 가정입니다.
파브리시오 F. 코스타(Fabricio F. Costa)의 새로운 분석은 이 가정에 의문을 제기합니다. 이 논문은 AI의 미래를 예측하는 것이 불가능하다고 주장하는 것이 아니라, 현재 우리가 이를 시도하는 방식이 불안정한 토대 위에 구축되어 있다고 주장합니다. 저자는 이러한 예측을 만드는 데 사용되는 공공 기록을 엄격하게 감사하였으며, 데이터를 그래프 위의 매끄러운 선이 아니라 개별적인 사건, 측정값, 그리고 출처들의 집합으로 취급했습니다. 조사 결과, 이러한 시스템을 구축하는 데 사용된 자원과 실제 성능 사이의 연결 고리는 대중적인 예측이 시사하는 것보다 훨씬 더 파편화되어 있음이 드러났습니다. 연구는 이러한 예측을 뒷받 p는 증거가 종종 불완전하고 일관성이 없으며, 단일 정보원에 크게 의존하고 있음을 밝혀냈습니다. 이는 뉴스에서 자주 인용되는 구체적인 날짜들이 과학적 결론이라기보다는 추측에 가깝다는 것을 의미합니다.
문제의 범위를 이해하려면 먼저 이러한 예측이 일반적으로 어떻게 구성되는지를 살펴보아야 합니다. 연구자들은 보통 두 가지 요소를 연결하려고 시도합니다. 모델을 훈련하는 데 사용된 컴퓨팅 파워의 양과 모델이 벤치마크 테스트에서 달성한 결과입니다. 벤치마크란 단순히 상식 질문에 답하거나 수학 문제를 푸는 것과 같은 특정 기술을 측정하기 위해 설계된 표준화된 질문이나 과업의 집합을 말합니다. 기본 아이디어는 모델에 더 많은 컴퓨팅 파워를 제공할수록, 이러한 테스트에서의 점수가 예측 가능한 방식으로 올라간다는 것입니다. 만약 그 관계를 매핑할 수 있다면, 점수가 특정 임계값에 도달하는 시점을 앞으로 투영해 볼 수 있습니다. 그러나 이 투영이 유효하려면, 동일한 시스템에 대해 컴퓨팅 파워와 테스트 점수가 모두 알려진 데이터 포인트가 필요합니다.
저자가 62개의 주요 인공지능 시스템에 대한 공공 기록을 조사했을 때, 상당한 격차가 나타났습니다. 많은 시스템에 대해 사용된 컴퓨팅 파워에 대한 정보는 구할 수 있었지만, 가장 발전된 폐쇄형(closed-source) 모델 중 상당수에 대해서는 정보가 누락되어 있었습니다. 반대로, METR라고 불리는 특정하고 널리 인용되는 측정 프로그램의 성능 점수는 많은 폐쇄형 모델에 대해 사용 가능했지만, 오픈 소스 시스템에 대해서는 완전히 부재했습니다. 이는 선을 긋는 데 필요한 두 가지 데이터, 즉 '연료'와 '속도'가 동일한 기계에 대해 공존하는 경우가 드물다는 상황을 만들었습니다. 62개 시스템 전체 중에서 컴퓨팅 추정치와 성능 점수가 모두 기록된 것은 단 7개뿐이었습니다. 이는 예측에서 흔히 보이는 매끄러운 곡선들이 실제로는 아주 적은 수의 데이터 포인트를 통해 그려진 것이며, 나머지 풍경은 빈 공간이라는 것을 의미합니다.
문제는 테스트 자체가 정적인 상태가 아니라는 점을 고려할 때 더욱 심화됩니다. 마치 자(ruler)가 약간 다른 눈금을 가진 새로운 자로 교체될 수 있는 것처럼, AI를 측정하는 벤치마크는 모델이 단순히 정답을 암기하는 것을 방지하기 위해 끊임없이 업데이트되거나 수정되거나 교체됩니다. 이 감사는 이러한 서로 다른 버전의 테스트들이 서로 어떻게 연관되는지를 조사했습니다. 조사 결과, 이전 버전의 테스트 점수를 새로운 버전의 점수와 비교하려고 할 때 그 관계가 항상 단순하고 직선적인 변화를 보이는 것은 아니라는 사실이 밝혀졌습니다. 때때로 새로운 테스트는 무언가를 약간 다르게 측정하거나, 난이도가 변하여 점수가 예상치 못하게 급등하거나 급락하기도 합니다. 연구는 인기 있는 테스트의 두 버전에 대한 시스템의 성능을 조사함으로써 이를 테스트했으며, 이전 점수와 새로운 점수 사이의 연결 관계가 두 점수를 비교하는 수학적 방법에 따라 크게 달라진다는 것을 발견했습니다. 어떤 경우에는 새로운 버전이 훨씬 더 가파른 향상을 보여주는 반면, 다른 경우에는 향상이 평탄해 보이기도 했습니다. 이는 점수의 상승이 반드시 AI가 더 똑똑해졌음을 의미하는 것이 아니라, 단지 테스트가 변했을 수도 있음을 시사합니다$합니다.
이 문제의 또 다른 핵심적인 이슈는 증거의 집중 현상입니다. AI의 진보를 추적하는 데 사용되는 구체적인 데이터 포인트의 대다수는 단 하나의 측정 프로그램에서 나옵니다. 감사에서 기록된 71개의 주요 정량적 사건 중 52개가 단 하나의 출처에서 나왔습니다. 이것은 마치 단 하나의 도시에서 얻은 온도계 읽기 값에 의존하여 대륙 전체의 기상 패턴을 이해하려는 것과 같습니다. 그 도시가 정확할 수는 있지만, 그것이 대륙의 나머지 지역에서도 동일한 기상 조건을 겪고 있는지는 알려주지 않습니다. 또한 감사는 이러한 측정값 중 다수가 실제 현장 테스트가 아닌 실험실 출시(laboratory releases)에서 온다는 점에 주목했습니다. 실험실에서는 조건이 통제되지만, 현실 세계에서 AI는 예측 불가능한 환경, 다양한 사용자, 그리고 다양한 수준의 지원과 상호작용합니다. 논문은 단일 출처와 단일 유형의 테스트에 의존하는 것이 잘못된 확신을 만든다고 주장합니다. 즉, 데이터가 일관되어 보이기 때문에 예측에 대한 신뢰도가 높게 나타나지만, 실제로는 데이터가 진정으로 독립적이지 않은 것입니다.
저자는 또한 이러한 서로 다른 측정값들을 연결하는 데 사용되는 통계적 테스트의 위력에 대해서도 살펴보았습니다. 분석 결과, 현재의 데이터 세트는 매우 큰 변화 외에는 아무것도 감지하기에는 너무 작은 경우가 많았습니다. 만약 컴퓨팅 파워와 성능 사이의 관계가 미세하게 변한다면, 현재의 기록들은 이를 완전히 놓칠 가능성이 큽니다. 연구는 이러한 시스템의 개선 방식에서 발생하는 작은 변화를 신뢰성 있게 감지하기 위해서는, 연구자들이 구 버전과 신 버전의 벤치마크를 동시에 사용하는 훨씬 더 많은 시스템을 테스트해야 한다고 계산했습니다. 이처럼 더 크고 다양한 데이터 세트 없이는, 특정 이정표에 도달할 시기를 정확히 알고 있다고 주장하는 그 어떤 예측도 본질적으로 추측에 불과합니다.
이 논문은 우리가 AI의 발전을 측정하는 것을 멈춰야 한다고 제안하는 것이 아닙니다. 대신, 더 정직하고 복잡한 접근 방식을 요구합니다. AI의 모든 역량을 단 하나의 숫자나 단 하나의 날짜로 압축하려 하기보다, 저자는 '포트폴리오' 방식의 측정을 제안합니다. 이는 모델을 실행하는 데 드는 에너지와 비용, 장기간에 걸친 신뢰성, 실제 작업에서의 수행 능력, 그리고 안전 위험을 처리하는 방식 등 다양한 요소들을 동시에 추적하는 것을 포함합니다. 또한, 결과가 특정 연구실이나 특정 테스트의 산물이 아님을 보장하기 위해 서로 다른 연구 그룹들이 서로 다른 방법으로 동일한 모델을 테스트하는 시스템이 필요할 것입니다. 목표는 단 하나의 완벽한 자라는 개념에서 벗어나, 지능의 다양한 측면을 각자의 불확실성을 가진 다양한 도구들로 측정하는 방향으로 나아가는 것입니다.
궁극적으로, 이 연구는 인공지능의 미래에 대한 방어 가능한 예측은 무엇을 측정하고 있는지, 그리고 어떻게 측정하고 있는지에 대해 투명해야 한다고 결론짓습니다. 예측은 데이터가 어디서 누락되었는지, 테스트가 어떻게 변했는지, 그리고 증거가 어디서 왔는지를 밝혀야 합니다. 측정 시스템에 대한 설명 없이 단순히 날짜만을 제시하는 예측은 과학적 주장이 아니라 추측입니다. 이 논문은 해당 분야가 예측의 일부로서 측정 시스템 자체를 다룰 것을 촉구하며, 날짜는 그것을 찾아내는 데 사용된 자만큼만 의미가 있다는 점을 인정해야 한다고 강조합니다. 커뮤니티가 컴퓨팅 파워, 성능, 그리고 실제 결과가 다양한 시스템 전반에 걸쳐 일관되고 독립적으로 측정되는 기록을 구축할 수 있을 때까지, 그 어떤 예측에서 가장 정밀한 부분은 달력의 날짜가 될 것이며, 가장 불확실한 부분은 그곳에 도달하는 과정에서 실제로 측정되고 있는 대상이 될 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.