← 최신 논문
🤖 machine learning

Maglev: Sliding Recurrent Memory

이 논문은 고정된 크기의 메모리, 병렬화 가능한 학습, 그리고 기존의 슬라이딩 윈도우 및 잠재 순환(latent recurrent) 베이스라인보다 우수한 성능을 달성하기 위해 풀 어텐션 프리필러(full-attention prefiller)와 메모리 일관성 손실(memory consistency loss)로 학습된 슬라이딩 윈도우 디코더를 결합한 순환 트랜스포머 아키텍처인 Maglev를 소개한다.

원저자: Bo Liu, Qiang Liu

게시일 2026-08-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Bo Liu, Qiang Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

기억력의 문제: 왜 AI에게 더 나은 공책이 필요한가

당신이 이야기를 쓰고 있다고 상상해 보세요. 그런데 문장을 하나 끝낼 때마다, 이전에 썼던 모든 내용을 잊어버려야 합니다. 이것이 현대의 많은 인공지능 모델들이 겪는 기본적인 어려움입니다. '트랜스포머(Transformer)'라고 불리는 이 모델들은 언어를 이해하는 데는 매우 뛰어나지만, 까다로운 기억 전략을 가지고 있습니다. 이들이 기억하는 가장 '완벽한' 방법은 지금까지 본 모든 단어를 거대한 펼쳐진 공책처럼 눈앞에 두는 것입니다. 이렇게 하면 책의 시작부터 끝까지의 아이디어를 연결할 수 있지만, 이야기가 너무 길어지면 컴퓨터의 에너지가 고갈되고 속도가 느려질 만큼 무거워집니다.

이를 해결하기 위해 엔지니어들은 종종 '슬라이딩 윈도우(sliding window)' 방식을 사용합니다. 이는 AI가 마지막 몇 문장만을 공책에 남겨두고 나머지는 버리는 것을 상상하면 됩니다. 이 방식은 컴퓨터를 빠르고 효율적으로 만들지만, AI가 이야기 초반의 중요한 세부 사항을 기억하는 능력을 상실하게 만듭니다. 반면에, 예전 유형의 AI 모델들은 전체 역사를 아주 작은 단일 요약 노트로 압축하려고 시도했습니다. 이는 빠르지만, 요약본은 종종 지저분해져서 복잡한 줄거리를 이해하는 데 필요한 풍부한 세부 정보를 놓치게 됩니다. 컴퓨터 과학의 이 구석진 곳에 있는 큰 질문은 이것입니다. "슬라이딩 윈도우의 속도를 가지면서도, 전체 공책의 깊고 풍부한 기억력을 갖추되, 과부하에 걸리지 않는 AI를 만들 수 있을까?"

Maglev: 짐 없이도 기억하는 기차

이 논문은 Maglev(자기 부상, Magnetic Levitation의 약자)라고 불리는 새로운 아키텍처를 소개합니다. 이는 마치 무거운 수하물 칸을 실을 필요 없이 궤도 위를 미끄러지듯 달리는 고속 열차와 같습니다. 텍ate 텍사스 대학교 오스틴 캠퍼스의 보 리우(Bo Liu)와 치앙 리우(Qiang Liu) 연구진은 AI가 실제 사용 중에는 적은 양의 정보만 유지하면서도 사물을 완벽하게 기억하는 법을 배울 수 있도록 하는 영리한 2단계 학습 과정을 제안합니다.

학습 과정을 감독과 배우가 함께하는 리허설이라고 생각해 보세요.

  1. 감독 (Prefiller Q): 먼저, 강력한 '감독' 모델이 이야기의 처음부터 끝까지 전체 이야기를 읽습니다. 전체 텍스트에 접근할 수 있기 때문에, 감독은 매 문장마다 완벽한 '기억 노트'를 작성할 수 있습니다. 감독은 다음 대사가 말이 되게 만들기 위해 배우가 무엇을 기억해야 하는지 정확히 알고 있습니다.
  2. 배우 (Decoder P): 다음으로, '슬라이딩 윈도우' 배우가 이야기를 연기합니다. 이 배우는 마지막 몇 문장과 감독이 방금 건네준 기억 노트만을 볼 수 있습니다. 배우는 다음 단어를 예측하려고 노력하며, 결정적으로, 다음 단계를 위한 자신만의 기억 노트를 쓰려고 노력합니다.

여기 마법 같은 기술이 있습니다. 연구진은 배우가 쓰는 노트가 감독이 쓴 완벽한 노트와 일치하도록 가르칩니다. 그들은 '일관성 손실(consistency loss)'을 사용하는데, 이는 기본적으로 "만약 당신의 기억 노트가 감독의 완벽한 노트와 다르게 생겼다면, 점수를 깎겠다"라고 말하는 채점 시스템입니다. 시간이 흐르면서 배우는 감독 없이도 스스로 완벽한 노트를 쓸 수 있도록 학습합니다.

결과는 어떻게 되었을까요?
학습이 끝나면 감독은 해고됩니다. 배우는 무대 위에 홀로 남겨집니다. 이제 배우는 마지막 몇 문장을 읽고, 이전 문장을 위해 자신이 썼던 기억 노트를 사용하여 현재의 문장을 이해하며 쇼를 이끌어갑니다. 이를 통해 AI는 즉각적인 맥락을 위한 '슬라이딩 윈도우'를 가지면서도, 이전에 있었던 모든 것에 대한 풍부하고 압축된 기억을 보유하게 되며, 동시에 기억의 크기를 일정하고 작게 유지하는 루프를 만들어냅니다.

결과: 속도와 지능의 만면

저자들은 이 Maglev 시스템을 435억 2천만 개의 토큰(엄청난 양의 텍テキスト)이라는 거대한 데이터셋으로 테스트했습니다. 그들은 이 모델을 표준 슬라이딩 윈도우 모델 및 다른 고급 메모리 모델들과 비교했습니다.

결과는 Maglev가 강력한 경쟁자임을 시사합니다. 실험에서:

  • Maglev 모델은 **FineWeb-Edu 검증 bits per byte (BPB)**를 표준 슬라이딩 윈도우 베이스라인인 0.7413에서 0.7251로 낮추었습니다. AI의 세계에서 낮은 BPB 점수는 모델이 실수를 덜 하고 텍스트를 더 잘 이해하고 있음을 의미합니다.
  • 또한 다양한 다운스트림 작업(질문에 답하거나 문장을 완성하는 등)에서의 평균 정확도를 **54.1%**에서 **56.4%**로 높였습니다.

가장 놀라운 발견 중 하나는 '감독'과 '배우'가 실제로 대부분의 두뇌 능력(파라미터)을 공유할 수 있다는 점입니다. 연구진은 두 모델이 내부 가중치의 대부분을 공유하더라도 Maglev 시스템이 성능 향상의 대부분을 유지한다는 것을 발견했습니다. 이는 시스템이 두 모델을 완전히 분리하여 운영할 때보다 훨씬 작고 저렴하게 운영될 수 있음을 의미합니다.

이것이 중요한 이유

이 논문은 Maglev가 AI 모델에게 인간이 생각하는 것과 같이 매 단어마다 다시 쓰이고 업데이트될 수 있는 '비선형적(nonlinear)' 기억을 제공하는 실질적인 방법을 제시한다고 설명합니다. 이는 매번 전체 이력을 살펴보는 막대한 계산 비용 없이도 가능합니다. AI가 큰 덩어리로 생각을 멈추거나 기억을 업데이트하기 위해 경직된 수학적 공식을 사용하도록 강요하는 다른 방법들과 달리, Maglev는 모델이 연속적이고 창의적으로 기억을 업데이트할 수 있게 해줍니다.

저자들은 이것이 예비 조사 단계이며, 이를 더 큰 모델로 확장하려면 더 많은 작업이 필요할 것이라고 언급했지만, 핵심 아이디어는 견고합니다. 즉, 학습 중에 '교사'를 병렬로 사용하여 '학생'을 지도함으로써, 우리는 AI가 빠르면서도 깊이 있게 기억하도록 가르칠 수 있다는 것입니다. 이는 학생에게 교실에서 완파한 노트를 작성하는 법을 가르쳐서, 나중에 도서관에 혼자 있을 때도 자신의 약어만 보고 강의 전체를 회상할 수 있게 만드는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →