← 최신 논문
💬 NLP

Selective Rotary Position Embedding

이 논문은 기존 RoPE의 고정된 회전 방식에서 벗어나 입력값에 따라 회전 각도를 조절하는 'Selective RoPE'를 제안함으로써, 소프트맥스 트랜스포머와 선형 트랜스포머 모두에서 위치 정보 인코딩 성능과 언어 모델링 능력을 향상시켰습니다.

원저자: Sajad Movahedi, Timur Carstensen, Arshia Afzal, Frank Hutter, Antonio Orvieto, Volkan Cevher

게시일 2026-04-27
📖 2 분 읽기☕ 가벼운 읽기

원저자: Sajad Movahedi, Timur Carstensen, Arshia Afzal, Frank Hutter, Antonio Orvieto, Volkan Cevher

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 배경: AI의 기억력 문제 (기억의 병목 현상)

지금의 AI(트랜스포머 모델)는 두 가지 방식의 기억법을 사용합니다.

  • 방식 A (완벽하지만 느린 '전지적 기억법'): 모든 단어를 하나하나 다 대조하며 읽습니다. 아주 정확하지만, 문장이 길어지면 읽어야 할 양이 기하급수적으로 늘어나서 컴퓨터가 너무 힘들어합니다(연산량 폭발).
  • 방식 B (빠르지만 건망증 있는 '요약 기억법'): 정보를 압축해서 메모장에 적어두며 읽습니다. 속도는 엄청 빠르지만, 메모장 용량이 작다 보니 중요한 내용을 금방 까먹거나 엉뚱하게 기억하는 '건망증' 문제가 있습니다.

이 논문의 목표는 "방식 B처럼 빠르면서도, 방식 A처럼 정확하게 기억하는 법"을 찾는 것입니다.


2. 핵심 아이디어: "회전(Rotation)"과 "망각(Decay)"의 조화

연구진은 기존의 '요약 기억법(방식 B)'이 왜 건망증이 심한지 분석했습니다. 그 결과, 두 가지 핵심 요소가 빠져 있다는 것을 발견했습니다.

① 회전 (Rotation): "정보에 이름표(위치) 붙이기"

기존의 빠른 모델들은 정보를 그냥 메모장에 적어 넣기만 했습니다. 그러다 보니 "어떤 단어가 몇 번째에 있었는지"를 구분하기 어려웠죠.

  • 비유: 마치 도서관에 책을 정리할 때, 책 내용만 적어두고 **'어느 선반 몇 번째 칸'**에 있는지 표시를 안 하는 것과 같습니다. 나중에 찾으려면 엉망진창이 되겠죠.
  • Selective RoPE (논문의 해결책): 정보를 저장할 때, 단어의 위치에 따라 정보를 '특정한 각도로 돌려서(회전시켜서)' 저장합니다. 이렇게 하면 나중에 정보를 꺼낼 때 "아, 이건 3번 위치에서 회전된 정보구나!"라고 바로 알 수 있습니다.

② 망각 (Decay): "중요한 것만 남기고 잊기"

정보를 무작정 다 기억하려고 하면 메모장이 금방 꽉 찹니다.

  • 비유: 공부할 때 시험에 안 나올 쓸데없는 잡담까지 다 외우면 정작 중요한 공식은 못 외우는 것과 같습니다.
  • 해결책: 시간이 오래 지난 정보나 중요도가 낮은 정보는 자연스럽게 흐릿해지도록(감쇠) 설계하여, 메모장의 공간을 효율적으로 관리합니다.

3. 이 논문의 발명품: "Selective RoPE"

연구진은 이 두 가지(회전 + 망각)를 결합한 **'Selective RoPE'**라는 기술을 만들었습니다.

이 기술의 특별한 점은 **'회전하는 각도를 AI가 스스로 학습한다'**는 것입니다.

  • 비유: 예전에는 모든 책을 똑같은 각도로 꽂아두었다면, 이제 AI는 **"이 정보는 중요하니까 아주 정교한 각도로 꽂아두고, 저 정보는 대충 꽂아두자"**라고 스스로 판단하며 메모장을 정리하는 똑똑한 사서가 된 것입니다.

4. 결과: 얼마나 좋아졌나요?

연구진이 이 기술을 적용해 테스트해 본 결과는 놀라웠습니다.

  1. 기억력 테스트 (Synthetic Tasks): 아주 긴 문장에서 특정 단어를 찾아내거나, 복잡한 패턴을 따라 하는 테스트에서 기존 모델들을 압도했습니다.
  2. 언어 모델 성능 (Language Modeling): 실제 언어 모델을 학습시켜 보니, 문맥을 이해하는 능력이 훨씬 정교해졌습니다.
  3. 효율성: 성능은 훨씬 좋아졌는데, 계산량(컴퓨터가 쓰는 힘)은 거의 늘어나지 않았습니다. 즉, **"가성비가 엄청나게 좋아진 것"**입니다.

요약하자면!

이 논문은 **"AI가 정보를 저장할 때, 위치 정보를 '회전'이라는 마법을 써서 똑똑하게 기록하고, 동시에 불필요한 건 '망각'하는 법을 가르쳐줌으로써, 빠르면서도 똑똑한 기억력을 갖게 만들었다"**는 내용입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →