Reverso: Efficient Time Series Foundation Models for Zero-shot Forecasting
이 논문은 훨씬 더 큰 트랜스포머 기반 모델들의 성능에 필적하면서도 파라미터 수를 2개 이상의 자릿수만큼 줄이기 위해 긴 컨볼루션과 선형 RNN 레이어를 결합한 작은 하이브리드 아키텍처를 활용하는 고효율 제로샷 시계열 파운데이션 모델 제품군인 Reverso를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 미래를 예측하려고 노력하고 있다고 상상해 보세요. 하지만 단순히 날씨나 주식 시장을 추측하는 것이 아니라, 시간이 흐름에 따라 변하는 길고 구불구불한 숫자들의 줄을 보고 있는 것입니다. 이것을 **시계열 예측(time series forecasting)**이라고 부릅니다. 수십 년 동안 과학자들은 이 숫자 줄의 다음 숫자가 무엇일지 추측하기 위해 수학적 기교와 단순한 컴퓨터 프로그램을 사용해 왔습니다. 하지만 최근, **파운데이션 모델(foundation model)**이라는 새로운 종류의 초스마트 컴퓨터 두뇌가 등장했습니다. 이 모델들을 세상의 모든 요리를 맛본 마스터 셰프라고 생각해 보세요. 단 하나의 레시피(예: 전기 사용량 예측)만 배우는 대신, 그들은 모든 레시피의 "언어"를 한꺼번에 배웁니다. 이를 통해 이들은 처음 보는 재료 몇 가지만 보고도 어떤 새로운 요리의 미래도 예측할 수 있습니다. 이것을 **제로샷 예측(zero-shot forecasting)**이라고 합니다. 하지만 여기에는 함정이 있습니다. 이 마스터 셰프가 되기 위해서, 이 모델들은 보통 거대해야 하며, 엄청난 양의 컴퓨터와 막대한 전력을 필요로 합니다. 이들은 많은 화물을 실을 수 있지만 작은 도시 골목길에는 들어갈 수 없는, 연료를 엄청나게 잡아먹는 거대한 트럭과 같습니다.
이 논문은 **리베르소(Reverso)**라는 새로운 계열의 시계열 모델을 소개하며, 다음과 같은 간단한 질문을 던집니다. 우리가 정말로 패키지를 배달하기 위해 거대한 트럭이 필요한가, 아니면 그만큼 빠르게 달릴 수 있는 날렵하고 효율적인 오토바이를 만들 수 있는가? 저자들인 연구팀은 모델을 단순히 더 크게 만드는 것에 대한 현재의 집착이 본질을 놓치고 있을 수도 있다고 주장합니다. 그들은 훌륭한 시계열 모델의 비결이 단순히 규모의 크기가 아니라, 모델이 데이터를 얼마나 영리하게 바라보느냐에 있다고 제안합니다. 그들은 리베르소가 매우 작으면서도(어떤 버전은 '두뇌 세포'라고 할 수 있는 파라미터가 수십만 개에 불과합니다) 거대한 수십억 개의 파라미터를 가진 거인들과 대등하게 성능을 발휘할 수 있도록 설계했다고 말합니다. 이 논문은 몇 가지 똑똑한 기술을 사용함으로써, 우리가 미래를 정확하게 예측하는 능력을 잃지 않으면서도 이 모델들을 노트북이나 심지어 스마트폰 같은 일상적인 기기에서 실행할 수 있을 만큼 작게 만들 수 있다고 제안합니다.
거대 모델의 문제점
인공지능의 세계에는 "클수록 좋다"는 인기 있는 아이디어가 있습니다. 모델을 똑똑하게 만들고 싶다면, 더 많은 데이터와 더 많은 두뇌 세포를 주면 된다는 것입니다. 이 방식은 언어나 시각 분야에서 놀라운 성과를 거두며 에세이를 쓰거나 고양이를 인식하는 거대 모델들을 탄생시켰습니다. 하지만 시계열 분야에서 이 접근 방식은 수억 개의 두뇌 세포를 가진 모델들을 만들어냈습니다. 이 모델들은 미래를 예측하는 데는 뛰어나지만, 사용하기가 매우 까다롭습니다. 너무 무거워서 작은 기기에서 실행하기 어렵고, 학습 비용이 너무 많이 들며, 실시간 상황에서 사용하기에는 너무 느립니다. 이는 자전거 타이어를 고치기 위해 증기 롤러(도로 포장용 무거운 장비)를 사용하는 것과 같습니다. 작동은 하겠지만, 매우 비효율적입니다.
이 논문의 저자들은 다른 길을 가기로 했습니다. 단순히 모델을 크게 만드는 대신, 그들은 이렇게 물었습니다. 어떻게 하면 모델이 데이터를 보는 방식을 더 똑똑하게 만들 수 있을까? 그들은 모델이 "파라미터 효율적(parameter-efficient)"이기를 원했습니다. 즉, 투입한 자원 대비 최대의 효과를 내기를 원했습니다. 그들은 단순히 작은 모델을 원하는 것이 아니라, 거인들과 경쟁할 수 있는 작은 모델을 원했습니다.
리베르소의 레시피: 세 가지 마법의 기술
리베르소를 만들기 위해 저자들은 세 가지 주요 재료가 들어간 간단한 레시レシピ를 만들었습니다. 이것은 단순히 냄비에 모든 것을 던져 넣는 것이 아니라, 최고의 풍미를 끌어낼 수 있는 방식으로 준비하는 요리와 같습니다.
1. "줌 렌즈" 전략 (다중 스케일 입력)
당신이 긴 도로를 보고 있다고 상상해 보세요. 만약 아주 가까이서만 본다면, 도로의 균열을 보게 될 것입니다. 만약 아주 멀리서 본다면, 전체 고속도로는 보이지만 세부 사항은 놓치게 될 것입니다. 대부분의 모델은 단 하나의 거리에서만 도로를 보려고 합니다. 하지만 리베르소는 "줌 렌즈"를 사용합니다. 리베르소는 동일한 시계열 데이터를 가져와 동시에 네 가지 다른 렌즈를 통해 바라봅니다:
- 하나의 렌즈는 데이터를 있는 그대로 봅니다 (높은 디테일).
- 하나의 렌즈는 매 두 번째 지점을 건너뜁니다 (중간 디테일).
- 하나의 렌즈는 매 세 번째 지점을 건너뜁니다 (낮은 디테일).
- 하나의 렌즈는 훨씬 더 많이 건너뜁니다 (매우 낮은 디테일).
동일한 데이터에 대해 이 네 가지 서로 다른 "뷰"를 동시에 모델에 제공함으로써, 모델은 빠르게 발생하는 패턴(갑작스러운 급증 등)과 느리게 발생하는 패턴(계절적 추세 등)을 동시에 학습할 수 있습니다. 이는 마치 네 명의 형사가 각자 다른 각도에서 범죄 현장을 조사한 뒤, 그들의 기록을 합치는 것과 같습니다. 이 기술 덕분에 모델은 방대한 양의 데이터를 한꺼번에 기억하지 않고도 장기적인 패턴을 이해할 수 있습니다.
2. "하이브리드 엔진" (시퀀스 믹싱)
데이터를 확보한 후, 모델은 이를 처리해야 합니다. 대부분의 모델은 "어텐션(attention)"이라고 불리는 방식을 사용하는데, 이는 데이터의 전체 역사를 스캔하여 무엇이 중요한지 찾아내는 스포트라이트와 같습니다. 강력하지만 느리고 무겁습니다. 리베르소는 두 가지 다른 유형의 프로세싱 사이를 전환하는 하이브리드 엔진을 사용합니다:
- 롱 컨볼루션 (Long Convolutions): 이는 밴드의 리듬 섹션이 비트를 유지하는 것처럼, 반복되는 패턴을 찾기 위해 데이터를 훑는 슬라이딩 윈도우와 같습니다.
- 델타넷 레이어 (DeltaNet Layers): 이는 "선형 순환(linear recurrent)" 레이어의 일종입니다. 이것은 가장 중요한 것들을 계속 업데이트하며 기억하는 메모리 뱅크라고 생각하면 됩니다. 전체 역사를 다시 읽을 필요 없이 중요한 것들을 기억합니다.
저자들은 이 두 가지를 혼합하는 것—어떤 부분에는 "슬라이딩 윈도우"를 사용하고 다른 부분에는 "메모리 뱅크"를 사용하는 것—이 최적의 지점임을 발견했습니다. 이는 무거운 스포트라이트(어텐션)만 사용하거나 메모리 뱅크만 사용하는 것보다 더 빠르고 가벼웠습니다. 이는 속도를 위한 터보차저와 효율성을 위한 하이브리드 배터리를 모두 갖춘 자동차를 운전하는 것과 같습니다.
3. "스마트 디코더" (어텐션 헤드)
마지막으로, 모델이 데이터를 처리한 후에는 예측을 수행해야 합니다. 리베르소는 마지막 단계에서 경량화된 형태의 어텐션을 사용하는 특별한 "디코더"를 사용합니다. 이 부분이 실제로 "내가 본 모든 것을 바탕으로, 다음에 어떤 일이 일어날 것 같다"라고 말하는 부분입니다. 저자들은 이 특정 유형의 디코더가 단순하고 투박한 계산보다 훨씬 더 정확한 예측을 하는 데 유리하다는 것을 발견했습니다.
결과: 작지만 강하다
연구팀은 세 가지 버전의 리베르소를 훈련시켰습니다: 아주 작은 버전(20만 파라미터), 작은 버전(55만 파라미터), 그리고 표준 버전(260만 파라미터)입니다. 그런 다음 이 모델들을 세계에서 가장 크고 무거운 모델들(일부는 10억 개 이상의 파라미터를 가짐)과 비교 테스트했습니다.
결과는 놀라웠습니다. Gift-Eval 벤치마크(다양한 유형의 데이터에 걸친 예측 기술을 테스트하는 거대 테스트)에서 표준 리베르소 모델은 0.706의 점수를 기록했습니다. 이는 믿기 힘들 정도로 경쟁력 있는 수치입니다. 이 모델은 100배에서 1,000배 더 큰 모델들과 대등한 성능을 보였습니다.
- 리베르소는 FlowState(260만 파라미터) 및 Tiny-Time Mixers(100만 파라미터)와 같은 모델들을 이겼습니다.
- 또한 TimesFM-2.5(2억 파라미터) 및 Xihe-Max(15억 파라미터)와 같은 거인들에게 매우 근접한 성적을 냈습니다.
하지만 진짜 마법은 정확도뿐만이 아니었습니다. 바로 속도와 메모리 사용량이었습니다. 리베르소는 매우 작기 때문에 훨씬 더 빠르게 실행되며 메모리를 훨씬 적게 사용합니다. 저자들은 "추론 지연 시간(inference latency, 예측을 만드는 데 걸리는 시간)"을 측정했으며, 리베르소가 거대 모델들보다 현저히 빠르다는 것을 발견했습니다. 이는 스포츠카와 화물 열차를 비교하는 것과 같습니다. 열차는 많은 것을 실을 수 있지만, 스포츠카는 목적지에 훨씬 더 빨리 도착하며 연료도 적게 사용합니다.
리베르소가 할 수 있는 것(과 할 수 없는 것)
이 논문은 리베르소가 제로샷 예측(특정 데이터에 대한 사전 훈련 없이 미래를 예측하는 것), 분류(데이터를 카테고리로 나누는 것), 그리고 이상 탐지(이상하고 예상치 못한 사건을 포착하는 것)에 탁월하다는 것을 보여줍니다. 예를 들어, 이상 탐지 테스트에서 리베르소는 "이상함"에 대한 기준이 매우 엄격할 때도 다른 모델들보다 더 많은 이상 현상을 탐지해 냈습니다.
하지만 저자들은 한계에 대해서도 솔직하게 밝히고 있습니다.
- 주로 단일 데이터 라인을 위한 것입니다: 리베르소는 현재 "단변량(univariate)" 모델로 훈련되었습니다. 즉, 한 번에 하나의 숫자 줄만 바라봅니다. 따라서 복잡한 어텐션 메커니즘을 사용하는 거대 모델들만큼 서로 의존하는 여러 데이터 라인(다변량)을 아직 잘 다루지는 못합니다.
- 짧은 시퀀스는 까다롭습니다: 리베르소는 장기 예측에는 놀랍지만, 데이터가 매우 짧을 때는 거대 모델들에 비해 뒤처지는 경우가 있습니다.
- 숫자를 예측하며, 확률을 예측하는 것은 아닙니다: 리베르소는 단일 최적의 추측값(점 예측)을 제공합니다. "비가 올 확률이 90%다"와 같이 자신이 얼마나 확신하는지를 자연스럽게 알려주지는 않습니다. 저자들은 나중에 이 기능을 추가할 수 있다고 제안했지만, 아직 내장되어 있지는 않습니다.
이것이 왜 중요한가
리베르소의 핵심 교훈은 크기가 전부가 아니라는 것입니다. 이 논문은 많은 실제 작업에서 병목 현상은 모델의 크기가 아니라, 모델이 얼마나 잘 설계되었느냐에 달려 있다고 시사합니다. 다중 스케일 입력과 하이브리드 프로세싱을 결합한 영리한 설계를 통해, 여러분은 노트북이나 스마트폰에서 실행될 수 있을 만큼 작으면서도 슈퍼컴퓨터와 경쟁할 수 있는 모델을 구축할 수 있습니다.
이는 매우 중요한 일입니다. 왜냐하면 우리가 계속해서 거대한 데이터 센터를 필요로 하는 점점 더 큰 모델을 만들어야 할 필요가 없을지도 모른다는 것을 의미하기 때문입니다. 대신, 우리는 여러분의 스마트워치, 자율주행 자동차, 또는 원격 기상 관측소와 같은 곳에 배치될 수 있는 효율적이고 컴팩트한 모델을 만들 수 있습니다. 저자들은 세심한 설계가 "성능-효율성 경계선"을 이동시켜, 강력한 AI를 무제한의 컴퓨팅 파워를 가진 사람들뿐만 아니라 모두가 접근할 수 있도록 만들 수 있다고 결론짓습니다.
요약하자면, 리베르소는 미래를 명확하게 보기 위해 반드시 거인이 될 필요는 없으며, 단지 올바른 각도에서 바라보는 법을 알면 된다는 것을 증명합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.