← 최신 논문
🤖 machine learning

Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing

본 논문은 소프트맥스(softmax)와 네 가지 선형 어텐션 아키텍처(DeltaNet, Gated DeltaNet, Kimi Delta Attention, Gated DeltaNet-2)를 350M 파라미터 모델을 사용하여 비교 연구함으로써 이들의 메커니즘, 성능 트레이드오프, 그리고 제안된 크로스 레이어 밸류 라우팅(Cross-Layer Value Routing) 메커니즘의 효용성을 분석하며, Kimi Delta Attention과 Muon의 조합이 가장 낮은 검증 손실을 달성하는 반면 Gated DeltaNet과 AdamW의 조합이 가장 높은 처리량을 제공한다는 것을 밝힌다.

원저자: Tommaso Cerruti, Tim Rieder, George Rowlands, Lingfeng Jin, Imanol Schlag

게시일 2026-07-10
📖 5 분 읽기🧠 심층 분석

원저자: Tommaso Cerruti, Tim Rieder, George Rowlands, Lingfeng Jin, Imanol Schlag

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대한 도서관을 운영하고 있다고 상상해 보십시오. 이곳에서는 새로운 책(토큰)이 들어올 때마다 이전에 들어온 모든 책의 기록을 일일이 대조하여 확인해야 합니다. 이것이 표준 AI 모델이 작동하는 방식이며, 매우 훌륭하지만 동시에 매우 지치는 작업입니다. 도서관이 커질수록 모든 쌍을 확인하는 데 드는 시간은 폭발적으로 늘어나며, 이로 인해 학습 속도가 엄청나게 느려지고 비용이 많이 들게 됩니다.

이 논문은 중요한 세부 사항을 기억하는 능력을 잃지 않으면서도, 더 똑똑하고 빠르게 도서관을 운영할 수 있는 방법을 찾아내는 탐정 이야기와 같습니다. 저자들은 기존의 느린 방식(Softmax Attention)과 네 가지 새로운 "선형 어텐션(linear attention)" 방식인 DeltaNet, Gated DeltaNet, Kimi Delta Attention, 그리고 Gated DeltaNet-2를 비교했습니다.

핵심 아이디어: "오차 수정" 노트

새로운 책이 들어올 때마다 도서관의 메모리에 그 책 전체를 통째로 적어 넣는 대신, 이 새로운 방식들은 영리한 **델타 규칙(delta rule)**을 사용합니다. 다음 책이 무엇을 말할지 이미 예측하고 있는 노트가 있다고 상상해 보십시오. 페이지 전체를 다시 쓰는 대신, 당신은 오직 예측했던 것과 실제로 일어난 일 사이의 *차이(오차)*만을 기록합니다. 이렇게 하면 메모리가 깨끗하게 유지되며, 오래된 기록이 새로운 기록과 충돌하는 것을 방지할 수 있습니다.

그다음 논문은 다음과 같이 질문합니다: 어떻게 하면 이 노트를 더 좋게 만들 수 있을까?

  • DeltaNet은 단순히 차이점을 기록합니다.
  • Gated DeltaNet은 오래되고 먼지 쌓인 기록을 지우기 위한 "망각 버튼"(스칼라 게이트)을 추가합니다.
  • Kimi Delta Attention은 이를 "채널별(channel-wise)" 망각 버튼으로 업그레이드하여, 모델이 특정 유형의 기록은 지우면서도 다른 기록은 유지할 수 있게 합니다.
  • Gated DeltaNet-2는 한 걸음 더 나아가, "지우기" 버튼과 "쓰기" 버튼을 분리함으로써 모델이 무엇을 삭제하고 무엇을 유지할지 완전히 제어할 수 있게 해줍니다.

경주: 속도 vs. 지능

저자들은 3억 5천만 개의 파라미터를 가진 모델로 150억 개의 토큰(엄청난 양의 텍스트)을 대상으로 대규모 실험을 진행했습니다. 그들은 단순히 누가 더 똑똑한지만을 본 것이 아니라, 누가 더 빠른지도 살펴보았습니다.

결과는 다음과 같았습니다:

  • 속도 챔피언: AdamW 옵티마이저로 훈련된 순수한 Gated DeltaNet 스택이 가장 빨랐습니다. 이 모델은 데이터를 매우 효율적으로 처리하여 속도의 기준점(100%)이 되었습니다. 하지만 가장 똑똑하지는 않았습니다. 이 모델의 "검증 손실(validation loss)"(낮을수록 좋은 점수)은 2.433이었습니다.
  • 가장 똑똑한 경쟁자: 가장 낮은 손실(가장 똑똑한 모델)의 타이틀은 "하이브리드" 스택(빠른 선형 레이어와 느린 표준 레이어를 혼합)에서 Muon이라는 다른 옵티마이저를 사용한 Kimi Delta Attention에게 돌아갔습니다. 이 모델은 2.273의 손실에 도달했습니다.
  • 트레이드오프(절충): 논문은 명확한 줄다리기를 보여줍니다. 절대적인 성능을 원한다면 더 느린 표준 어텐션 레이어를 섞은 (하이브리드 스택)을 사용해야 하며, 이는 속도를 늦춥니다. 반대로 순수한 속도를 원한다면 선형 레이어만 고수하면 되지만, 약간의 정확도를 잃을 수 있습니다.

결정적으로, 이 논문은 한 가지 큰 아이디어를 배제합니다: 저자들은 학습률(learning rate)(모델이 얼마나 빨리 배우는지)이 구조 자체만큼 중요하다는 것을 발견했습니다. 모델이 별로인 것처럼 보이는 이유는 설계가 잘못되어서가 아니라, 잘못된 학습률이 주어졌기 때문일 수 있습니다. 예를 들어, Muon은 낮은 학습률(약 3 × 10⁻⁴)을 선호하는 반면, AdamW는 높은 학습률(약 10⁻³)을 선호합니다. 옵티마이저를 바꾼다고 해서 동일한 결과를 기대할 수는 없습니다. 반드시 함께 튜닝해야 합니다.

새로운 기술: 레이어 간 비밀 공유

심층 신경망에는 문제가 하나 있습니다. 정보가 하위 레이어에서 상위 레이어로 이동함에 따라 정보가 "희석"되거나 손실될 수 있다는 것입니다. 저자들은 레이어 사이에 "비밀 통로"를 만들어 하위 레이어가 상위 레이어에 메시지를 전달할 수 있게 함으로써 이를 해결하려고 시도했습니다.

그들은 통로를 통해 무엇을 전달할지에 대해 두 가지 주요 아이디어를 테스트했습니다:

  1. "실수"(오차): 예측된 것과 실제 발생한 것 사이의 오차를 전달합니다.
  2. "목표"(값): 목표 값(모델이 쓰려고 했던 것)을 전달합니다.

놀라운 사실: 논문은 "실수"를 전달하는 것이 최선이라는 생각에 대해 명시적으로 반대합니다. 그들이 오차를 다음 레이어의 목표로 직접 전달했을 때(CLER라고 부르는 방식), 결과는 전혀 도움이 되지 않았습니다. 그것은 마치 새는 파이프를 고치기 위해 옆방에 대고 물이 새는 소리를 외치는 것과 같았으며, 효과가 없었습니다.

해결책: 그들은 목표 값(the "Goal")을 전달하는 것이 약간 더 효과적이라는 것을 발견했습니다. 이를 **교차 레이어 값 라우팅(Cross-Layer Value Routing, CLVR)**이라고 불렀습니다.

  • 3억 5천만 파라미터 실험에서, 이 새로운 방법은 최종 검증 손실을 아주 미세하게(약 0.01) 낮추었습니다.
  • 예를 들어, Gated DeltaNet 모델의 경우 손실이 2.8331에서 2.8228로 떨어졌습니다 (차이는 -0.0103).
  • DeltaNet 모델의 경우, 손실이 2.8469에서 2.8350으로 떨어졌습니다 (차이는 -0.0119).

얼마나 확실한가? 저자들은 신중합니다. 그들은 이 결과가 여러 번의 시도를 평균 낸 것이 아니라 단일 실행(single runs) 결과이며, 따라서 이 이득은 작고 무작위성에 의해 영향을 받을 수 있다고 언급했습니다. 그러나 패턴은 일관적이었습니다: 을 전달하는 것이 항상 오차를 전달하는 것보다 약간 더 나았습니다. 또한 이들을 13억 파라미터 규모의 더 큰 모델에서도 테스트했는데, 여기서 이득은 훨씬 더 작아졌습니다(-0.0019). 이는 모델이 더 커지고 똑똑해질수록 이 혜택이 줄어들 수 있음을 시사합니다.

미래에는 어떻게 될까?

이 논문은 모든 문제를 해결했다고 주장하지 않습니다. 저자들은 이러한 라우팅 기술을 Kimi Delta Attention이나 Gated DeltaNet-2와 같은 다른 아키텍처에는 테스트하지 않았다고 명시적으로 밝혔습니다. 따라서 "값 라우팅" 기술이 거기에서도 작동하는지는 아직 알 수 없습니다. 또한 이 모델들이 읽기(추론) 속도는 얼마나 빠른지에 대해서도 테스트하지 않았으며, 오직 학습(훈련) 속도만을 테스트했습니다.

요약

이 논문은 하나의 "승자"를 선언하는 것이 아닙니다. 대신 하나의 지형도를 그려냅니다.

  • 속도와 긴 문맥(context)이 필요하다면, **순수 선형 스택(pure linear stacks)**이 당신의 친구입니다.
  • 최대 정확도가 필요하고 약간의 느려짐을 감수할 수 있다면, Kimi Delta AttentionMuon을 사용하는 하이브리드 스택이 유망해 보입니다.
  • 레이어를 연결하고 싶다면, 오차를 전달하지 말고, 값을 전달하십시오.

저자들은 이러한 라우팅 기술이 작은 상승을 제공하긴 하지만, 진짜 마법은 옵티마이저, 학습률, 그리고 아키텍처가 어떻게 함께 춤을 추느냐에 달려 있다고 제안합니다. 그것은 단순히 더 빠른 엔진을 만드는 것이 아니라, 자동차 전체를 튜닝하는 과정입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →