← 최신 논문
🤖 machine learning

OATS: Online Data Augmentation for Time Series Foundation Models

이 논문은 확산 모델(diffusion models)과 탐색-활용(explore-exploit) 메커니즘을 사용하여 특정 훈련 단계에 맞춤화된 고품질의 합성 시계열 데이터를 동적으로 생성하는 원칙적인 온라인 데이터 증강 프레임워크인 OATS를 제안하며, 이는 시계열 파운데이션 모델을 향상시키는 데 있어 정적 증강 베이스라인들을 크게 능가한다.

원저자: Junwei Deng, Chang Xu, Jiaqi W. Ma, Ming Jin, Chenghao Liu, Xu Zhang, Li Zhao, Jiang Bian

게시일 2026-08-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Junwei Deng, Chang Xu, Jiaqi W. Ma, Ming Jin, Chenghao Liu, Xu Zhang, Li Zhao, Jiang Bian

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 초지능형 로봇에게 내일의 날씨나 다음 달의 전력 사용량을 추측하는 것처럼 미래를 예측하는 법을 가르치려 한다고 상상해 보세요. 이를 위해 로봇은 방대한 양의 역사를 공부해야 하지만, 현실 세계의 데이터는 엉망인 경우가 많습니다. 구멍이 뚫려 있기도 하고, 일관성이 없거나, 때로는 데이터 자체가 충분하지 않기도 합니다. 컴퓨터 과학의 세계에서 이것을 "시계열(Time Series)"이라고 부르며, 이를 이해하기 위해 우리가 만드는 로봇들을 "파운데이션 모델(Foundation Models)"이라고 부릅니다. 로봇이 더 잘 배울 수 있도록 돕기 위해, 과학자들은 종종 "데이터 증강(Data Augmentation)"이라는 기술을 사용합니다. 이것은 요리 수업에서 선생님이 원래의 레시피만 주는 것이 아니라, 실제와 똑같이 보이고 맛이 나는 가짜 재료들을 잔뜩 건네주어 당신이 더 많이 연습할 수 있도록 하는 것과 같습니다.

오랫동안 과학자들이 이 가짜 재료를 만드는 방식은 마치 쿠키 틀을 사용하는 것과 비슷했습니다. 그들은 실제 데이터 조각을 가져와서 약간 흔들거나(노이즈 추가), 다른 조각과 섞는(블렌딩) 것과 같이 단순하고 정적인 규칙을 적용했습니다. 이는 일률적인 접근 방식이었습니다. 로봇이 얼마나 많은 것을 배웠는지에 상관없이, 모든 학습 단계에서 동일한 쿠키 틀이 사용되었습니다. 하지만 로봇에게 서로 다른 시기에 서로 다른 종류의 연습이 필요하다면 어떨까요? 만약 로봇이 더 똑똑해짐에 따라 "최적의" 가짜 데이터가 변해야 한다면 어떨까요? 이 논문은 다음과 같은 큰 질문을 던집니다. 우리가 쿠키 틀을 사용하는 것을 멈추고, 매 순간의 학습 단계마다 신선하고 맞춤 제작된 연습 데이터를 구울 수는 없을까요?

이 논문의 저자들은 "그렇다"라고 답하며, OATS(Time Series Foundation Models를 위한 온라인 데이터 증강)라는 새로운 방법을 소개합니다. 정적인 규칙을 사용하는 대신, OATS는 실시간으로 로봇이 배우는 과정을 지켜보는 매우 세심한 코치처럼 행동합니다. 작동 방식은 다음과 같습니다.

먼저, 코치는 어떤 연습 문제가 실제로 도움이 되는지 알아야 합니다. OATS는 "시계열 영향력 점수(Time-Series Influence Scores)"라는 영리한 점수 체계를 사용합니다. 로봇이 시험을 치르고 있다고 상상해 보세요. 코치는 모든 연습 문제를 살펴보고 이렇게 묻습니다. "지금 로봇에게 특정 문제를 풀게 한다면, 최종 시험 성적이 좋아질까?" 만약 어떤 문제가 로봇의 실력 향상에 도움이 된다면, 그 문제는 높은 점수를 받게 됩니다. 이러한 고득점 문제들이 "가이드 신호(guiding signals)"가 됩니다.

다음으로, 코치는 이 신호들을 사용하여 새로운 합성 데이터를 굽습니다. 단순히 복사해서 붙여넣는 대신, OATS는 **확산 모델(diffusion model)**이라는 정교한 도구를 사용합니다. 이것을 마법 같은 화가라고 생각해 보세요. 코치는 화가에게 "가이드 신호"가 되는 가장 좋은 연습 문제들을 건네며 말합니다. "이것들과 느낌은 똑같지만, 독특한 무언가를 만들어내세요." 그러면 화가는 로봇이 그 순간에 배워야 할 내용에 완벽하게 부합하는, 현실적이고 완전히 새로운 시계열 데이터를 생성합니다.

하지만 모든 연습 문제를 확인하여 도움이 되는지 판단하는 것은 많은 시간과 에너지를 소모합니다. 이를 해결하기 위해 OATS는 탐색-활용(Explore-Exploit) 전략을 사용합니다.

  • 탐색(Explore): 때때로 코치는 놓쳤을지도 모를 새로운 숨겨진 보석들을 찾아내기 위해 새로운 문제 묶음을 확인합니다. 이는 철저하지만 느립니다.
  • 활용(Exploit): 다른 때에 코치는 이전에 찾아두었던 고득점 문제들을 기억하여 즉시 새로운 데이터를 생성합니다. 이는 빠르고 효율적입니다.
    OATS는 새로운 정보를 찾는 것과 시간을 절약하는 것 사이의 균형을 맞추며 이 두 가지 모드를 영리하게 전환합니다.

논문 저자들은 전력 사용량이나 날씨 패턴을 포함한 6개의 서로 다른 실제 데이터셋을 사용하여 두 가지 유형의 로봇 아키텍처에서 이 아이디어를 테스트했습니다. 결과는 OATS가 표준 학습 방법(추가 데이터 없음)과 기존의 "쿠키 틀" 방식(예: TSMixup 또는 Jitter)보다 일관되게 우수한 성능을 보였다는 것을 보여주었습니다. 실제로 OATS는 로봇이 더 빠르게 배우고 더 정확한 예측을 하도록 도왔습니다. 저자들은 모든 문제를 확인하는 것(항상 "탐색"하는 것)이 가장 철저하긴 하지만, 항상 최선은 아니라는 것을 발견했습니다. "활용" 단계(캐싱된 점수 사용)를 섞어주는 것이 결과에 지장을 주지 않으면서도 엄청난 양의 컴퓨팅 자원을 절약해 주었습니다.

요약하자면, OATS는 이러한 강력한 시계열 로봇을 훈련시키는 최선의 방법은 무작위로 가짜 데이터를 던져주는 것이 아니라, 로봇의 학습 여정과 함께 진화하는 고품질의 맞춤형 연습 데이터를 정성스럽게 선별하고 생성하는 것이라고 제안합니다. 이는 훈련 과정을 정적인 드릴(drill)에서 데이터와 모델 사이의 역동적이고 반응적인 대화로 변화시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →