← 최신 논문
🤖 machine learning

A Later Test Set Is Not a New Domain: Pretraining Familiarity Survives a Contamination-Free Hold-Out

이 논문은 시계열 파운데이션 모델의 성공이 일반적인 예측 능력이 아니라 특정 데이터 도메인에 대한 사전 학습된 친숙함에서 주로 기인하기 때문에, 시간적 홀드아웃 테스트가 이들의 성능 우위를 완전히 제거하는 데 실패하며, 따라서 공정한 평가를 위해 도메인 수준의 홀드아웃이 필요함을 입증한다.

원저자: Mahdi Naser Moghadasi (BrightMind AI), Faezeh Ghaderi (University of Texas at Arlington)

게시일 2026-09-10
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mahdi Naser Moghadasi (BrightMind AI), Faezeh Ghaderi (University of Texas at Arlington)

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

데이터 과학의 세계에는 하나의 거대한 컴퓨터 프로그램이 전력 사용량부터 주가에 이르기까지 거의 모든 반복되는 패턴의 미래를 예측하는 법을, 특정 패턴에 대해 구체적으로 배우지 않고도 학습할 수 있다는 믿음이 커지고 있습니다. 파운데이션 모델(foundation models)로 알려진 이 프로그램들은 방대한 양의 과거 데이터 라이브러리를 통해 훈련되며, 시간이 흐르는 방식의 일반적인 '형태'를 학습합니다. 일단 훈련되면, 이 모델들이 새로운 숫자 집합을 보고 다음에 올 숫자를 예측하는 능력이 각 작업마다 처음부터 새로 구축해야 하는 전통적인 방식보다 더 뛰어날 것이라는 약속이 담겨 있습니다. 그러나 이러한 주장에는 그림자가 드리워져 있습니다. 이 모델들을 측정하는 데 사용되는 테스트들이 오래된 공개 기록물에 의존하기 때문에, 모델이 진정으로 미래를 예측하는 능력이 있는 것인지 아니면 단순히 과거를 암기한 것인지를 구별하는 것이 불가능했기 때문입니다. 만약 모델이 구축되기 전의 데이터를 가지고 테스트를 받는다면, 그것은 진정한 예측 능력을 보여주는 것이 아니라 훈련 중에 보았던 사실들을 회상하고 있는 것일 수 있습니다.

이 수수께끼를 풀기 위해 연구자들은 어떤 모델도 본 적이 없을 법한 새로운 종류의 테스트를 구축했습니다. 그들은 13가지의 서로 다른 예측 도구(어떤 것은 오래되고 단순하며, 어떤 것은 새롭고 복잡함)를 모아, 가장 최신 모델이 출시된 이후에 발표된 데이터를 예측하도록 요청했습니다. 데이터는 위키피디아 페이지 조회수, 시간별 날씨 패턴, 시간별 공기 질 수치, 덴마크 전력망의 전력 사용량, 그리고 통화 간 일일 환율이라는 다섯 가지 서로 다른 인간 활동 영역에서 가져왔습니다. 테스트에 사용된 모든 관측치는 모델이 훈련될 당시에는 아직 오지 않았던 시간인 2026년에 기록되었습니다. 이는 어떤 모델도 자신이 예측해야 할 특정 수치를 암기할 수 없도록 보장하기 위함이었습니다. 목표는 이 강력한 사전 훈련된 거인들이 진정으로 신선한 도전에 직면했을 때 여전히 겸손하고 구식인 도구들보다 뛰어난 성능을 보일 수 있는지 확인하는 것이었습니다.

결과는 헤드라인이 시사하는 것보다 더 미묘한 이야기를 드러냈습니다. 사전 훈련된 모델들이 모든 곳에서 승리한 것은 아니었습니다. 일일 환율 데이터의 경우, 가장 진보된 인공지능부터 가장 단순한 추측에 이르기까지 테스트된 모든 방법이 정확히 동일하게 작동했으며, 그 어떤 것도 내일이 오늘과 같을 것이라고 가정하는 기본적인 예측을 이기지 못했습니다. 시간별 전력망 데이터에서는 'Theta'라고 불리는 고전적인 비머신러닝 방식이 1위를 차지했으며, 화려한 사전 훈련된 모델들은 이 방식과 차별화된 모습을 보여주지 못했습니다. 이러한 사례들에서 신기술은 아무런 이점을 제공하지 못했습니다. 하지만 모델들은 다른 분야에서 빛을 발했습니다. 그들은 위키피디아 페이지뷰 데이터에서 훨씬 더 뛰어난 성과를 보였는데, 여기서 그들은 고전적인 방식들보다 트래픽 급증을 훨씬 더 정확하게 예측했습니다. 그 차이는 극명했습니다. 주간 위키피디아 조회수의 경우, 가장 우수한 사전 훈련된 모델은 가장 우수한 고전적 방식보다 오차가 28% 더 작았습니다.

연구자들은 모델이 왜 어떤 곳에서는 성공하고 어떤 곳에서는 실패했는지 질문했습니다. 그들은 처음에 데이터 자체의 성격이 핵심일 것이라고 의심했습니다. 그들은 모델이 매우 노이즈가 많거나 혹은 포착하기 어려운 복잡하고 반복적인 주기를 가진 데이터에서 더 잘 작동하는지 궁금해했습니다. 그들은 데이터의 주기 강도와 무작위성을 측정했지만, 이러한 요소들은 그 패턴을 설명하지 못했습니다. 모델이 데이터가 지저분하거나 계절성이 높아서 더 잘 작동한 것이 아니었습니다. 대신, 답은 모델 자체의 훈련 이력에 있었습니다. 모델이 가장 잘 수행했던 영역은 위키피디아 페이지뷰였습니다. 이는 선도적인 모델 중 하나인 TimesFM의 제작자들이 자신들의 훈련 라이브러리의 대부분을 구성한다고 설명한 데이터 유형과 정확히 일치합니다. 모델은 수백만 개의 위키피디아 트래픽 패턴을 읽으며 수년간 시간을 보냈습니다. 비록 특정 2026년의 수치를 본 적은 없지만, 모델은 위키피디아 트래픽의 일반적인 행동 양식을 매우 잘 학습했기에 해당 도메인의 미래를 쉽게 예측할 수 있었던 것입니다.

이 발견은 이러한 모델들의 이점이 보편적인 예측 능력에서 오는 것이라기보다, 그들이 길러진 특정 데이터에 대한 깊은 친숙함에서 온다는 것을 시사합니다. 연구자들이 동일한 위키피디아 데이터에 대해 서로 다른 사전 훈련된 모델들을 비교했을 때, 위키피디아 데이터로 훈련된 모델 군이 다른 모델들을 지속적으로 앞질렀습니다. 날씨나 공기 질과 같은 다른 데이터 유형에서는 그와 같은 이점이 사라졌습니다. 모델들은 마법이 아니었습니다. 그들은 특정 도서관의 책들을 읽고 그 안의 이야기들을 회상할 수 있는 전문가들이었습니다. 비록 그 이야기의 챕터들은 새로운 것이었을지라도 말입니다.

연구는 또한 이 모델들이 자신의 확신을 표현하는 방식에 숨겨진 결함을 발견했습니다. 사전 훈련된 모델들은 종종 점 예측(point prediction)에서는 정확했지만, 체계적으로 과잉 확신하는 경향이 있었습니다. 그들이 가능한 결과의 범위를 제공할 때, 80%의 확신을 주장했지만 실제 예측이 실제 결과를 포함하는 경우는 약 70%에 불여했습니다. 반면, 오래된 고전적 방식들은 더 신중하여, 실제 결과를 더 자주 포착할 수 있도록 더 넓은 범위를 제공하곤 했습니다. 전력망이나 공급망을 관리하기 위해 이러한 예측을 사용하는 사람에게, 이러한 과잉 확신은 위험할 수 있으며, 이는 예비 전력을 너무 적게 확보하게 만드는 결과로 이어질 수 있습니다. 연구자들은 사전 훈련된 모델들이 더 빠르고 종종 더 정확하지만, 그들의 보정(calibration) 부족은 그들이 항상 결정적인 판단을 내릴 때 더 안전한 도구는 아님을 지적했습니다.

궁극적으로, 논문은 단순히 테스트 날짜를 미래로 옮기는 것만으로는 모델이 진정으로 일반화되었다는 것을 증명하기에 충분하지 않다고 결론짓습니다. 모델은 훈련 중에 특정 도메인의 '풍미'를 학습했다면 미래의 날짜에 대한 테스트를 통과할 수 있습니다. 모델의 일반화 능력을 진정으로 측정하려면, 미래의 날짜뿐만 아니라 훈련 데이터에 포함되지 않은 전체 도메인을 제외한 벤치마크를 실시해야 합니다. 실무자에게 주는 교훈은 명확합니다. 어떤 도구를 선택하기 전에, 단지 어떤 도구가 가장 강력한지가 아니라, 당신이 예측하려는 데이터가 그 도구가 자라온 데이터와 닮았는지를 물어야 합니다. 만약 데이터가 다르다면, 모델의 외견상의 탁월함은 사라질 것이며, 더 단순하고 신중한 도구들이 더 신뢰할 수 있는 선택지로 남게 될 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →