← 최신 논문
🤖 machine learning

On Subquadratic Architectures: From Applications to Principles

이 논문은 코드 및 시계열 작업 전반에 걸쳐 주요 준이차(subquadratic) 아키텍처(xLSTM, Mamba-2, Gated DeltaNet)를 평가하며, xLSTM이 더 유연하고 안정적인 메모리 수정 및 상태 추적을 가능하게 하는 게이팅 체계 덕분에 우수한 성능을 달성함을 입증한다.

원저자: Anamaria-Roberta Hartl, Levente Zólyomi, David Stap, Pieter-Jan Hoedt, Niklas Schmidinger, Lukas Hauzenberger, Sebastian Böck, Günter Klambauer, Sepp Hochreiter

게시일 2026-06-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Anamaria-Roberta Hartl, Levente Zólyomi, David Stap, Pieter-Jan Hoedt, Niklas Schmidinger, Lukas Hauzenberger, Sebastian Böck, Günter Klambauer, Sepp Hochreiter

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 엄청나게 두꺼운 책을 읽거나, 복잡한 컴퓨터 코드를 작성하거나, 다음 주 날씨를 예측할 수 있는 초지능형 비서를 만들려고 한다고 상상해 보십시오. 수년 동안 업계의 표준은 **트랜스포머(Transformer)**라고 불리는 특정 유형의 엔진이었습니다. 이 엔진은 매우 강력하지만, 치명적인 결함이 하나 있습니다. 정보의 양(즉, "시퀀스")이 늘어날수록 엔진이 기하급급수적으로 무거워지고 느려진다는 점입니다. 이는 마치 새로운 책을 한 권 추가할 때마다 가방이 이전보다 두 배 더 무거워지는 배낭을 메고 가는 것과 같습니다.

이를 해결하기 위해 과학자들은 **서브쿼드래틱 아키텍처(Subquadratic Architectures)**를 발명했습니다. 이들은 정보의 양에 따라 무게가 선형적으로만 증가하도록 설계된, 더 가볍고 빠른 새로운 엔진 디자인입니다. 하지만 어떤 새로운 엔진이 실제로 가장 뛰어날까요?

이 논문은 세 명의 강력한 후보를 경주에 참여시켰습니다: xLSTM, Mamba-2, 그리고 Gated DeltaNet입니다. 그들은 세 가지 매우 어려운 과업으로 이들을 테스트했습니다:

  1. 코드 작성: 엄격한 규칙과 긴 논리 체인이 가득한 작업입니다.
  2. 선생님으로부터 배우기: 거대하고 똑똑한 AI로부터 기술을 복제하도록 더 작고 빠른 AI를 가르치는 작업입니다.
  3. 시계열 예측: 과거가 미래에 영향을 미치는 주식 가격이나 날씨와 같이 복잡한 패턴을 가진 데이터를 예측하는 작업입니다.

경주 결과

모든 분야에서 xLSTM이 승리했습니다. xLSTM은 특히 복잡하고 긴 사건의 사슬을 기억해야 하는 작업에서 가장 일관되고 정확한 엔진이었습니다. Mamba-2와 Gated DeltaNet도 훌륭했지만, 가장 어려운 부분에서는 종종 실수를 저질렀습니다.

왜 xLSTM이 승리했을까요? ("기억" 비유)

이 이유를 이해하기 위해 저자들은 엔진 내부를 들여다보았습니다. 그들은 이 모든 엔진이 지금까지 본 것들에 대한 "상태(state)" 또는 "기억"을 유지하며 작동한다는 사실을 발견했습니다. 저자들은 각 엔진이 두 가지 핵심적인 기억 기술을 어떻게 처리하는지 비교했습니다:

  1. 누적 (The "Counter"): 장기간에 걸쳐 합계나 횟수를 계속 계산하는 능력 (예: 100페이지 분량의 문서에서 특정 단어가 몇 번 등장하는지 세는 것).
  2. 상태 추적 (The "Tracker"): 특정하고 순서가 있는 세부 사항을 기억하고, 흐름을 놓치지 않고 정확하게 업데이트하는 능력 (예: "A가 발생하면 B가 일어나야 하지만, 만약 C가 먼저 발생했다면 예외이다"라는 규칙을 기억하는 것).

각 엔진이 이 기술들을 다루는 방식은 다음과 같습니다:

  • Mamba-2는 손이 묶인 엄격한 사서와 같습니다. 이 엔진에는 "무언가를 잊어버리면, 새로운 것을 쓰는 것도 멈춰야 한다"라는 규칙이 있습니다. "망각"과 "쓰기" 스위치가 서로 묶여 있기 때문에, 메모리를 유연하게 업데이트하는 데 어려움을 겪습니다. 특정 작업에는 능숙하지만, 종종 숫자를 놓치거나 이야기가 너무 길어지면 혼란에 빠집니다.
  • Gated DeltaNet은 지우개가 달린 화이트보드와 같습니다. 이 엔진은 오래된 정보를 새로운 정보로 교체하는 데 매우 능숙합니다. 새로운 사실이 들어오면 기존의 것을 지워버립니다. 이는 정보 검색(최신 사실을 찾아내는 것)에는 좋지만, 숫자를 세는 데는 최악입니다. 만약 "A + B + C = 10"이라는 것을 기억해야 하는데, 새로운 숫자를 넣기 위해 보드의 기존 숫자를 계속 지워버린다면 전체 합계를 잃어버리게 될 것입니다.
  • xLSTM은 형광펜과 계산기가 있는 스마트한 노트와 같습니다. xLSTM은 기억을 두 부분으로 나눕니다:
    • 한 부분은 아무것도 지우지 않고도 계속해서 합계를 낼 수 있는 계산기(누적) 역할을 합니다.
    • 다른 부분은 특정 상태를 추적하고 유연하게 업데이트할 수 있는 노트(상태 추적) 역할을 합니다.
    • 결정적으로, xLSTM에는 부드러운 지우개 역할을 하는 특별한 "게이트"가 있습니다. 단순히 페이지를 깨끗이 지워버리거나(DeltaNet 방식) 지울 수 없는 것(Mamba 방식)과 달리, 새로운 정보가 더 중요할 경우 기존 정보를 '흐릿하게' 만들거나, 여전히 유효하다면 기존 정보를 그대로 유지할 수 있습니다. 이러한 유연성 덕분에 xLSTM은 누적과 추적을 동시에 완벽하게 수행할 수 있습니다.

증거: "긴 문자열" 테스트

이 이론을 증명하기 위해 저자들은 가상의 작업들로 간단한 테스트를 실시했습니다:

  • 계수 테스트 (Counting Test): AI에게 학습된 길이보다 훨씬 더 긴 리스트의 항목 개수를 세도록 합니다.
  • 추적 테스트 (Tracking Test): AI에게 긴 시퀀스 동안 "홀수"와 "짝수"가 바뀌는 특정 패턴을 기억하도록 합니다.

결과:

  • Mamba-2는 거의 즉시 실패했습니다. 리스트가 길어지자마자 모든 것을 잊어버렸습니다.
  • Gated DeltaNet은 어느 정도 숫자를 셀 수는 있었지만, 추적 작업에서는 혼란을 겪었습니다. 추적 능력을 개선하도록 조정하더라도, 매우 긴 거리의 데이터를 다룰 때는 여전히 어려움을 겪었습니다.
  • xLSTM두 가지 모두를 해낼 수 있는 유일한 엔진이었습니다. xLSTM은 먼 거리에서도 완벽하게 숫자를 셀 수 있었고, 위치를 놓치지 않으면서 복잡한 패턴을 추적할 수 있었습니다.

결론

이 논문은 xLSTM이 복잡한 과업을 수행하는 데 있어 현재 가장 우수한 선택이라고 결론짓습니다. 그 이유는 xLSTM이 두 가지 중 하나를 선택해야 하는 상황에 처하지 않고도, 합계를 유지하는 능력(누적)과 변화하는 세부 사항을 추적하는 능력(상태 추적)을 결합했기 때문입니다. 다른 엔진들이 둘 중 하나에는 능숙할지라도, xLSTM의 유연한 "메모리 교정" 메커니즘은 실제 코드와 데이터에 존재하는 복잡하고 장기적인 의존성을 처리할 수 있게 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →