← 최신 논문
🤖 machine learning

Rotary Masked Autoencoders are Versatile Learners

본 논문은 불규칙한 시계열을 포함한 다양한 모달리티에 걸쳐 효과적인 표현 학습을 가능하게 하되, 특수한 아키텍처 수정 없이 회전 위치 임베딩을 활용하는 다목적 아키텍처인 로터리 마스크 자동인코더(RoMAE)를 소개합니다.

원저자: Uros Zivanovic, Serafina Di Gioia, Andre Scaffidi, Martín de los Rios, Gabriella Contardo, Roberto Trotta

게시일 2026-05-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Uros Zivanovic, Serafina Di Gioia, Andre Scaffidi, Martín de los Rios, Gabriella Contardo, Roberto Trotta

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 책을 읽도록 설계된 초지능 로봇이 있다고 가정해 봅시다. 이 로봇은 단어가 특정 순서를 가진다는 것을 알고 있기 때문에 문장을 이해하는 데 놀라울 정도로 뛰어납니다. 예를 들어, "The cat sat(고양이가 앉았다)"와 "Sat the cat(앉았다 고양이)"는 서로 다릅니다. 이 로봇은 문장 속 각 단어가 어디에 위치하는지 추적하기 위한 특별한 시스템을 사용합니다.

이제 이 로봇에게 불규칙한 시계열 데이터를 이해하도록 가르치고 싶다고 상상해 보세요. 이는 비가 올 때만 보고서를 보내는 기상 관측소나, 심장 박동이 불규칙할 때만 심박수를 기록하는 심장 모니터와 같습니다. 데이터 포인트는 매 초와 같은 규칙적인 간격으로 들어오는 것이 아니라 무작위 시간에 들어옵니다.

기존의 표준 로봇은 여기서 혼란을 겪습니다. 이 로봇은 메트로놈과 같은 일정한 리듬을 기대하기 때문입니다. 불규칙한 데이터를 입력하면 로봇은 고장 나거나, 혼란을 처리하기 위해 복잡하고 맞춤형인 부품으로 대대적으로 수정되어야 합니다.

이제 **RoMAE(Rotary Masked Autoencoder)**가 등장합니다. 이 논문의 저자들은 어떤 맞춤형 "기어"나 특별한 수정 없이도 이러한 불규칙성을 처리할 수 있는 로봇의 새로운 버전을 구축했습니다. 그들이 어떻게 했는지 간단한 비유를 통해 설명해 보겠습니다.

1. "회전식" 나침반 (RoPE)

비결은 **회전식 위치 임베딩(Rotary Positional Embedding, RoPE)**이라는 방법입니다.

  • 과거의 방식: 로봇이 자를 사용하여 거리를 측정한다고 상상해 보세요. 만약 자에 1, 2, 3, 4 표시만 있다면 "1.5"나 "3.7"을 쉽게 측정할 수 없습니다. 연속적이고 정수가 아닌 숫자에 어려움을 겪습니다.
  • RoMAE 의 방식: 자 대신 로봇은 나침반을 사용합니다. 단순히 걸음을 세는 것이 아니라, 무언가의 "위치"에 대한 이해를 회전시킵니다.
    • 데이터 포인트가 시간 10 에 발생하면 로봇은 내부 시야를 특정 각도로 회전시킵니다.
    • 데이터 포인트가 시간 10.5 에 발생하면 약간 다른 각도로 회전시킵니다.
    • 나침반이 정수뿐만 아니라 어떤 각도라도 가리킬 수 있기 때문에, 로봇은 연속적이고 불규칙한 시간을 완벽하게 이해할 수 있습니다. 로봇에게 "이것은 시계열 데이터다"라고 알려줄 필요도 없습니다. 그저 데이터의 기하학적 구조를 이해할 뿐입니다.

2. "눈가리개" 게임 (Masked Autoencoder)

로봇은 "눈가리개"라는 게임을 통해 학습합니다.

  • 준비: 로봇에게 사진(또는 데이터 스트림) 을 보여주지만, 그중 75% 를 눈가리개(마스크) 로 가립니다.
  • 과제: 로봇은 보이는 부분을 바탕으로 눈가리개 아래에 무엇이 있는지 추측해야 합니다.
  • 결과: 불규칙한 데이터의 누락된 부분을 채우려고 시도함으로써, 로봇은 데이터가 어떻게 행동하는지에 대한 근본적인 패턴을 학습합니다. 이 게임에 능숙해지면 눈가리개를 제거하고 분류나 예측과 같은 실제 작업에 사용할 수 있습니다.

3. "범용 어댑터"

일반적으로 로봇이 이미지를 처리하도록 하려면 하나의 뇌를 구축합니다. 오디오를 처리하도록 하려면 다른 뇌를 구축합니다. 불규칙한 시간을 처리하도록 하려면 세 번째로 매우 복잡한 뇌를 구축합니다.

RoMAE 는 범용 어댑터입니다.

  • 저자들은 이를 이미지(사진 등), 오디오(사운드 클립 등), 불규칙한 시계열(기상 관측소나 심장 모니터 등) 에서 테스트했습니다.
  • 주장: 그들은 RoMAE 가 이러한 작업 중 어느 것에 대해서도 뇌 구조를 변경할 필요가 없다는 사실을 발견했습니다. RoMAE 는 이미지와 오디오에서 기존 최우수 모델만큼 잘 수행했을 뿐만 아니라, 다른 모델들이 어려움을 겪던 불규칙한 시계열 작업에서도 압도적인 성과를 거두었습니다. 이는 전용 셰프 칼만큼이나 날카롭지만, 나사 드라이버와 병따개도 갖춘 스위스 아미 나이프와 같습니다.

4. "앵커" 트릭 ([CLS] 토큰)

이 논문의 흥미로운 발견 중 하나는 로봇이 "절대적" 시간과 "상대적" 시간을 어떻게 구분하는지에 관한 것입니다.

  • 상대적 시간: "이 사건은 저 사건보다 5 분 뒤에 발생했다."
  • 절대적 시간: "이 사건은 정확히 오후 2 시에 발생했다."

저자들은 데이터 시작 부분에 특별한 "앵커" 토큰( [CLS] 토큰이라고 함) 을 추가하면 로봇이 절대적 시간을 파악할 수 있다는 사실을 발견했습니다. 이 앵커가 없으면 로봇은 사건 간의 거리만 알지, 시계에서 어디에 위치하는지는 알지 못합니다.

  • 비유: 어두운 방에 있다고 상상해 보세요. "10 걸음 앞으로 걸어갔다"는 사실만 안다면 집 안의 위치를 알 수 없습니다. 하지만 "문에서 10 걸음 떨어져 있다"고 알려주는 손전등(앵커) 이 있다면 정확한 위치를 알 수 있습니다.

그들이 증명한 것은 무엇인가?

이 논문은 이것이 질병을 치료하거나 내일 주가를 예측할 것이라고 주장하지 않습니다. 대신 그들은 실험을 통해 세 가지 구체적인 사실을 증명했습니다.

  1. 다재다능함: RoMAE 는 특별한 구조 변경 없이 이미지, 오디오, 그리고 불규칙하고 messy 한 시계열 데이터에서 탁월하게 작동합니다.
  2. 성능: 어려운 천문학 과제 (우주에서 온 불규칙한 광곡선을 다루는 ELAsTiCC 데이터셋) 에서 RoMAE 는 해당 작업을 위해 특별히 설계된 전문 모델들을 능가했습니다.
  3. 앵커 효과: 그들은 수학적으로 증명하고 실험적으로 보여주었습니다. 특별한 "앵커" 토큰이 없으면 로봇은 절대적 위치를 알 수 있는 능력을 상실하여 특정 작업이 더 어려워진다는 사실입니다.

함정 (한계점)

이 논문은 단점에 대해 솔직합니다.

  • 속도: 로봇이 데이터를 볼 때마다 모든 단일 데이터 조각에 대해 이러한 "나침반 회전"을 계산해야 하기 때문에, 미리 계산된 자를 사용하는 단순한 모델보다 약간 느립니다 (약 13% 느림).
  • 길이: 이 유형의 모든 표준 로봇과 마찬가지로, 한 번에 방대한 양의 데이터 (전체 소설이나 1 년 분량의 연속 비디오 등) 를 입력하려고 하면 매우 느려집니다.

요약하자면: 저자들은 회전하는 나침반을 사용하여 시간을 이해하는 "범용 학습자"를 구축했습니다. 이를 통해 로봇은 깨끗한 사진과 소리뿐만 아니라 불규칙하고 messy 한 데이터에서도 "눈가리개" 게임을 똑같이 잘 수행할 수 있게 되었으며, 이는 모두 맞춤형 뇌 없이 이루어졌습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →