← 최신 논문
🤖 machine learning

RoVE: Rotary Value Embeddings Attention for Relative Position-dependent Value Pathways

이 논문은 가치 임베딩을 키(key)와 함께 회전시켜 가치 경로를 위치 민감적으로 만듦으로써 다양한 어텐션 공식을 통합하고, 롱 컨텍스트 및 인컨텍스트 학습 작업에서 표준 RoPE 대비 일관된 성능 향상을 입증하는 파라미터 프리(parameter-free) 수정 방식인 RoVE를 소개한다.

원저자: Alejandro García-Castellanos, Maurice Weiler, Erik J Bekkers

게시일 2026-06-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Alejandro García-Castellanos, Maurice Weiler, Erik J Bekkers

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

문제점: "눈먼 전령사"

대규모 언어 모델(당신이 지금 대화하고 있는 것과 같은)을 서로에게 쪽지를 전달하는 거대한 작업자 팀이라고 상상해 보세요.

  • 쿼리 (읽는 이/The Reader): 한 작업자가 질문을 던집니다.
  • 키 (인덱스/The Index): 다른 작업자들이 "당신이 필요한 답을 내가 가지고 있어요!"라고 적힌 표지판을 들어 올립니다.
  • 밸류 (메시지/The Value): 읽는 이가 누구의 말을 들을지 결정하면, 그 작업자들은 실제 쪽지(데이터)를 건네줍니다.

이 논문은 현대 모델들이 사용하는 방식(RoPE)에 결함이 있다고 지적합니다.

  • 좋은 점: 모델은 누구의 말을 들을지에 대해서는 매우 똑똑합니다. 5단계 떨어진 곳에 있는 작업자의 쪽지와 50단계 떨어진 곳에 있는 작업자의 쪽지는 다르다는 것을 알고 있습니다. 거리를 세심하게 다룹니다.
  • 나쁜 점: 일단 읽는 이가 어떤 작업자의 말을 듣기로 결정하면, 그 작업자가 전달하는 메시지의 내용은 거리가 얼마나 멀든 상관없이 동일하게 취급됩니다.
    • 비유: 당신이 친구의 이야기를 듣고 있다고 상상해 보세요. 친구가 바로 옆에 있다면 목소리가 또렷하게 들립니다. 하지만 친구가 100피트 떨어져 있어도, 마치 바로 옆에 있는 것처럼 똑같은 단어들을 듣게 됩니다. 모델은 "거리"가 단순히 누가 말할지를 결정하는 것뿐만 아니라, 메시지를 어떻게 해석해야 하는지도 바꿔야 한다는 사실을 깨닫지 못합니다.

해결책: RoVE (회전 밸류 임베딩/Rotary Value Embeddings)

저자들은 RoVE라고 불리는 간단하고 비용이 들지 않는 해결책을 제안합니다.

단순히 거리감을 보여주기 위해 "표지판"(Keys)을 회전시키는 대신, RoVE는 메시지가 읽히기 전에 "쪽지"(Values) 또한 회전시킵니다.

  • 비유: 모든 작업자가 지도를 들고 있다고 상상해 보세요.
    • 기존 방식 (RoPE): 읽는 이는 작업자가 정확히 어디에 서 있는지 압니다. 하지만 작업자가 쪽지를 건넬 때, 그 쪽지는 위치와 상관없이 표준 글꼴로 작성되어 있습니다.
    • 새로운 방식 (RoVE): 작업자는 쪽지를 건네기 전에 자신의 거리에 따라 종이를 회전시킵니다. 멀리 있다면 종이가 약간 기울어져 있고, 가까이 있다면 평평한 상태입니다.
    • 결과: 읽는 이가 쪽지를 받았을 때, 종이의 기울기는 자신의 위치를 기준으로 메시지를 어떻게 해석해야 하는지 알려줍니다. 이제 메시지 자체가 자신의 거리를 "알게" 된 것입니다.

이것이 왜 중요한가: "어텐티브 컨볼루션(Attentive Convolution)"

이 논문은 이 작은 변화가 모델의 어텐션 메커니즘을 **"어텐티브 컨볼루션"**이라 불리는 무언가로 바꾼다고 주장합니다.

  • 비유: 표준적인 어텐션 메커니즘을 스포트라이트라고 생각해보세요. 빛을 비추지만, 빛의 색깔은 어디서나 동일합니다.
  • RoVE의 변화: RoVE는 중심에서 얼마나 멀리 떨어져 있느냐에 따라 스포트라이트의 색상이 변하게 만듭니다.
  • 이점: 이는 "블록-토플리츠(block-Toeplitz)" 구조(저자들이 사용하는 어려운 수학 용어)를 만들어내는데, 저자들은 이 구조가 컴퓨터가 이미지를 보는 방식인 **컨볼루션(convolution)**에서 사용되는 구조와 같다고 말합니다.
    • 쉽게 말해: 이 작업을 통해 모델은 언어를 처리할 때 이미지나 물리적 객체를 처리하는 방식처럼, 위치와 거리가 데이터의 의미를 근본적으로 바꾸는 방식으로 언어를 처리하기 시작합니다.

실험 결과

저자들은 두 가지 크기(소형 및 중형)의 언어 모델로 테스트를 진행했으며, 다음과 같은 결과를 얻었습니다:

  1. 더 나은 기억력: 모델이 긴 거리에서도 더 잘 기억하게 되었습니다 (장기 문맥 검색/long-context retrieval).
  2. 더 나은 추론 능력: 아주 적은 예시만 주어졌을 때 문제를 해결하는 능력(few-shot learning)이 향상되었습니다.
  3. 더 넓은 도달 범위: 학습된 것보다 훨씬 긴 텍식에서도 혼란을 겪지 않고 잘 처리했습니다 (out-of-distribution perplexity).

"공짜" 업그레이드

이 논문에서 가장 흥미로운 점은 RoVE가 추가적인 학습이나 추가적인 메모리를 필요로 하지 않는다는 것입니다.

  • 새로운 "가중치"(파라미터)를 추가하지 않습니다.
  • 컴퓨터의 속도를 크게 늦추지 않습니다.
  • "드롭인(drop-in)" 교체가 가능합니다. 기존 방식을 RoVE로 바꾸기만 하면, 모델은 즉시 거리와 긴 이야기를 다루는 데 더 똑똑해집니다.

요약

이 논문은 언어 모델이 진정으로 이야기를 이해하려면, 단순히 누가 말하고 있는지를 아는 것을 넘어, 화자가 얼마나 멀리 있는지도 알아야 하며 그에 따라 메시지를 조정해야 한다고 주장합니다. RoVE는 메시지(Value)가 자신의 거리를 인지하게 함으로써, 모델을 긴 복잡한 과업에서도 탁월한 능력을 발휘하는 더 견고한 경청자로 만드는 영리하고 비용이 들지 않는 기술입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →