← 최신 논문
⚡ electrical engineering

Beyond Sinusoids: A Morlet Wavelet Framework for Transformer Positional Encoding

이 논문은 모를레 위치 인코딩(Morlet Positional Encoding, MoPE)을 소개하는데, 이는 사인파 및 회전형 위치 인코딩을 학습 가능한 웨이브릿 기반 접근 방식의 극한 사례로 통합함으로써, 위치와 국소성을 동시에 인코딩하는 동시에 웨이브릿 허용 경계로 수렴하여 트랜스포머 모델의 성능을 향상시킴을 입증하는 새로운 프레임워크이다.

원저자: Athanasios Zeris

게시일 2026-06-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Athanasios Zeris

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

큰 문제: "어디에" vs "얼마나 멀리"

여러분이 책을 읽고 있다고 상상해 보세요. 표준 AI 모델(Transformer)은 문장 속에서 단어가 어디에 있는지 알 수 있는 내장된 방식을 가지고 있습니다. 이를 "위치 인코딩(Positional Encoding)"이라고 부릅니다.

현재 가장 인기 있는 두 가지 시스템(Sinusoidal과 ROPE)은 **완벽하고 무한한 자(ruler)**처럼 작동합니다. 이들은 AI에게 "이 단어는 5번째 단어입니다", "이 단어는 100번째 단어입니다"라고 알려줍니다. 하지만 이들은 모든 위치를 똑같이 취급합니다. 즉, 한 단어의 영향력이 영원히 뻗어나간다고 가정합니다.

저자는 이것이 언어의 특성에 맞지 않는다고 주장합니다. 이야기 속에서 "그(he)"라는 단어는 두 문장 전에 언급된 등장인물을 가리킬 수는 있지만, 두 챕터 전에 언급된 등장인물을 가리키지는 않을 것입니다. 기존의 자(ruler)는 단어의 영향력이 어디까지 도달해야 하는지는 알지 못하며, 그저 "여기에 있다"라고만 말할 뿐입니다.

해결책: "손전등" (MOPE)

저자는 **모를레 위치 인코딩(Morlet Positional Encoding, MOPE)**이라는 새로운 시스템을 제안합니다.

끝없이 이어지는 자 대신, MOPE는 손전등처럼 작동합니다.

  • 빛의 줄기 (위상, Phase): 기존 시스템과 마찬가지로, AI에게 단어의 정확한 각도나 "위상"(예: "당신은 지금 춤의 5번째 단계에 있습니다")을 알려줍니다. 이 부분은 인기 있는 ROPE 시스템과 동일합니다.
  • 주변의 빛 (진폭, Amplitude): 이것이 새로운 부분입니다. 손전등 빛줄기는 중심에서 멀어질수록 점점 어두워집니다. MOPE에서 위치 신호의 "밝기"는 시퀀스의 시작점에서 멀어질수록 점차 사라집니다.

비유:

  • 기존 시스템 (ROPE/Sin-cos): 모든 좌석이 밝고 변하지 않는 빛으로 밝혀져 있는 경기장을 상상해 보세요. 1번 좌석에 앉은 팬은 10,000번 좌석에 앉은 팬만큼이나 아나운서에게 똑같이 "잘 보입니다".
  • 새로운 시스템 (MOPE): 스포트라이트를 상상해 보세요. 중앙에 있는 사람은 매우 밝게 빛납니다. 뒤쪽 줄로 갈수록 빛은 부드러워지며 결국 서서히 사라집니다. 이는 AI에게 다음과 같이 말해줍니다: "가까운 단어들에 집중하세요. 멀리 있는 단어들은 지금 당장 그리 중요하지 않습니다."

"마법 같은" 연결 고리

이 논문은 흥ся로운 사실을 증명합니다. 기존 시스템(Sin-cos 및 ROPE)은 사실 이 새로운 손전등 시스템의 고장 난 버전일 뿐이라는 것입니다.

  • 만약 손전등 빛의 폭을 무한히 넓게 만든다면(즉, 절대 어두워지지 않도록 한다면), 기존의 ROPE 시스템이 됩니다.
  • 만약 빛의 폭을 무한히 넓히고 회전을 제거한다면, 기존의 Sin-cos 시스템이 됩니다.

따라서 MOPE는 단순히 새로운 아이디어일 뿐만 아니라, 기존 아이디어들의 "부모"와 같습니다. MOPE는 AI의 각 부분에서 손전등 빛의 폭을 얼마나 넓게 해야 할지를 데이터로부터 학습합니다.

실험에서는 어떤 결과가 나왔나?

저자는 셰익스피어의 문구 몇 천 개로 구성된 아주 작은 데이터셋을 통해 이를 테스트했습니다. 결과는 다음과 같습니다.

  1. 조합이 승리한다: 이 새로운 "손전등"(MOPE)을 "에너지 게이트 어텐션(Energy-Gated Attention, 어떤 단어가 중요한지 결정하는 문지기 역할)"이라는 다른 도구와 결합했을 때, AI의 다음 단어 예측 능력이 눈에 띄게 향상되었습니다. 이는 두 도구를 각각 따로 사용했을 때보다 더 뛰어난 성적을 거두었습니다.
  2. "스윗 스팟(Sweet Spot)"의 발견: AI는 손전등 빛을 얼마나 넓게 만들지 학습해야 했습니다. 놀랍게도, AI의 뇌 속에 있는 128개의 "손전등" 모두가 특정 수학적 한계치에 도달하도록 스스로 조정되었습니다. 이들은 너무 좁지도, 너무 넓지도 않은, 딱 적절한 "캐릭터-단어 규모"에 맞는 빛의 폭을 찾아냈습니다.
    • 이를 128개의 라디오를 튜닝하는 것에 비유해 보세요: 각기 다른 채널을 찾는 대신, 이들은 모두 신호가 가장 선명한 정확한 주파수에 고정되었습니다.
  3. "시작" 편향: 현재 버전의 MOPE에는 특이점이 있습니다. 이 시스템은 손전등의 "중심"이 항상 텍스트의 맨 앞(단어 #1)에 있다고 가정합니다. 즉, 이야기가 이제 막 시작되더라도 단어 #5는 자연스럽게 단어 #200보다 "더 밝게" 보입니다. 저자는 이것이 한계점임을 인정하며, 향후 버전에서는 AI가 손전등의 "중심"이 어디에 있어야 할지를 직접 학습할 수 있도록 제안했습니다.

요약

이 논문은 단어의 위치를 추적하기 위해 딱딱하고 무한한 자를 사용하는 대신, 스마트하게 사라지는 스포트라이트를 사용해야 한다고 제안합니다. 이 스포트라이트는 자신의 영향력이 어디까지 도달해야 하는지를 스스로 학습합니다.

  • 기존 방식: "나는 여기에 있고, 나는 영원히 중요하다."
  • 새로운 방식 (MOPE): "나는 여기에 있고, 짧은 거리 동안만 중요하며, 그 후에는 서서히 사라진다."

실험 결과, 이러한 "사라지는(fading)" 접근 방식은 다른 스마트한 어텐션 도구들과 결합될 때, 기존 방식보다 언어의 국소적 구조(문장이나 구절 등)를 훨씬 더 잘 이해하도록 도와준다는 것을 보여주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →