← 최신 논문
🤖 machine learning

Sparse Delta Memory: Scaling the State of Linear RNNs through Sparsity

이 논문은 고정된 계산 비용과 파라미터 수를 유지하면서도 희소 어드레싱(sparse addressing)을 통해 게이트형 선형 RNN의 은닉 상태 용량을 확장함으로써 장기 문맥 회상(long-context recall) 및 인컨텍스트 학습(in-context learning) 성능을 크게 향상시키는 새로운 아키텍처인 Sparse Delta Memory(SDM)를 소개한다.

원저자: Loïc Cabannes, Pierre-Emmanuel Mazaré, Gergely Szilvasy, Matthijs Douze, Maria Lomeli, Ilze Amanda Auzina, Justin Carpentier, Gabriel Synnaeve, Hervé Jégou

게시일 2026-07-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Loïc Cabannes, Pierre-Emmanuel Mazaré, Gergely Szilvasy, Matthijs Douze, Maria Lomeli, Ilze Amanda Auzina, Justin Carpentier, Gabriel Synnaeve, Hervé Jégou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 100만 단어 길이의 이야기를 기억하려고 노력하고 있다고 상상해 보십시오.

기존의 문제: "서류함" vs "배낭"
현재의 AI 모델(Transformer)은 서류함처럼 작동합니다. 새로운 단어를 읽을 때마다 서류함에 새로운 폴더를 추가하는 방식입니다. 이야기가 짧으면 서류함이 작아서 관리하기 쉽습니다. 하지만 이야기가 100만 단어만큼 길어진다면, 서류함은 거대해지고 무거워지며 검색하기도 느려집니다. 컴퓨터는 이야기의 매 단계마다 이 전체 서류함을 통째로 들고 다녀야 합니다. 이것이 현재의 AI가 매우 긴 문맥을 다룰 때 어려움을 겪는 이유입니다. 공간이 부족해지거나 속도가 너무 느려지기 때문입니다.

다른 모델들(GDN이나 Mamba 같은 선형 RNN)은 더 똑똑하게 행동하려 합니다. 이들은 배낭을 사용합니다. 모든 폴더를 다 들고 다니는 대신, 이야기를 몇 줄의 메모로 요약한 뒤 나머지는 버립니다. 이렇게 하면 이야기가 아무리 길어져도 배낭을 가볍고 빠르게 유지할 수 있습니다. 하지만 문제는 배낭이 너무 작다는 것입니다. 배낭은 아주 작은 요약본만을 담을 수 있기 때문에, AI는 이야기의 끝에 도달할 때쯤이면 이야기 초반의 중요한 세부 사항들을 잊어버리고 맙니다.

새로운 해결책: 희소 델타 메모리 (Sparse Delta Memory, SDM)
이 논문의 저자들은 **희소 델타 메모리(SDM)**라는 새로운 시스템을 소개합니다. 이것을 AI가 즉각적으로 접근할 수 있는 거대하고 마법 같은 도서관이라고 생각하십시오. 다만, AI는 그 순간에 필요한 특정 책들만을 골라서 꺼내 볼 뿐입니다.

작동 방식은 다음과 같습니다 (쉬운 비유를 사용합니다):

  1. 거대한 도서관 (메모리):
    기존의 작은 배낭 대신, SDM은 수백만 개의 선반이 있는 거대한 도서관을 가지고 있습니다. 이는 기존의 배낭에 비해 엄청나게 큰 규모입니다. 이 도서-관은 이야기에 대한 방대한 양의 정보를 담을 수 있습니다.

  2. 똑똑한 사서 (희소 접근 - Sparse Access):
    여러분은 "도서관이 그렇게 크다면, 적절한 책을 찾는 데 시간이 너무 오래 걸리지 않을까?"라고 생각할 수도 있습니다.
    논문은 아니오라고 답합니다. SDM은 희소(sparse) 시스템을 사용합니다. 예를 들어, 사서가 모든 통로를 일일이 걸어 다니는 것이 아니라, 특수한 인덱스 카드 시스템을 가지고 있다고 상상해 보십시오. AI가 정보가 필요할 때, 현재 단어와 가장 관련이 깊은 아주 적은 수의 특정 선반(예를 들어 수백만 개 중 64개)만을 살펴봅니다. 나머지는 무시합니다.

  • 결과: AI는 거대한 메모리(전체 도서관)의 이점을 누리면서도, 에너지는 단 몇 개의 선반을 확인하는 정도만 소비합니다. 이는 마치 엄청난 능력을 갖춘 슈퍼컴퓨터 뇌를 가졌으면서도, 매 순간 가장 중요한 것에만 "집중"하는 것과 같습니다.
  1. "델타" 업데이트 (포스트잇):
    AI가 새로운 것을 배웠을 때, 전체 도서관을 새로 쓰는 것이 아닙니다. SDM은 "델타(Delta)" 규칙을 사용합니다. 이것은 특정 책의 특정 페이지에 포스트잇을 붙이는 것과 같습니다. 기존의 유용한 기억들을 덮어쓰거나 혼란을 주지 않고, 변경이 필요한 부분만을 업데이트합니다. 이를 통해 AI가 기존의 유용한 기억을 "지워버리는" 것을 방지합니다.

  2. "학습된" 시작 (사전 로드된 뇌):
    논문은 또한 SDM이 이야기를 읽기 전부터 지식을 "사전 로드(pre-loaded)"할 수 있다고 언급합니다. 사서가 일을 시작하기 전에 일반 상식(역사, 과학, 상식 등)에 관한 백과사전을 미리 건네주는 것을 상상해 보십시오. 이를 통해 AI는 단순히 현재 읽고 있는 이야기를 암기하는 것을 넘어, 세상을 더 잘 이해할 수 있게 됩니다.

이 논문의 발견
연구진은 이 새로운 "도서관"을 기존의 "배낭"(GDN) 및 무거운 "서류함"(Full Attention)과 비교 테스트했습니다.

  • 메모리 vs 속도: 연구진은 메모리를 수천 배 더 크게 만들어도 컴퓨터가 느려지거나 전기를 더 많이 사용하지 않는다는 것을 증명했습니다.
  • 긴 이야기: 매우 긴 작업(책 한 권 전체를 읽거나 긴 코드 프로젝트를 다루는 일 등)을 테스트했을 때, SDM은 기존의 배낭 모델보다 세부 사항을 훨씬 더 잘 기억했습니다. 무거운 서류함 모델과 거의 대등한 성능을 보이면서도 속도 저하라는 페널티는 없었습니다.
  • 더 똑똑한 사고: 메모리가 매우 크기 때문에, AI는 그 안에 일반적인 지식도 저장할 수 있었습니다. 덕분에 AI는 단순히 이야기를 기억하는 것을 넘어, 추론하고 질문에 답하는 능력이 향로되었습니다.

한계점
논문은 한 가지 제한 사항을 인정합니다. 속도는 빠르지만, 이 거대한 도서관을 위한 저장 공간은 여전히 큽니다. 즉, 모델 자체의 크기와 비슷하게 많은 컴퓨터 메모리(RAM)를 차지합니다. 그러나 저자들은 이것이 더 나은 선택이라고 주장합니다. 왜냐하면 "서류함"(현재의 AI) 방식은 이야기가 너무 길어지면 결국 메모리가 완전히 바닥나 버리기 때문입니다.

요약하자면
SDM은 AI에게 방대한, 무한한 공책을 주는 것과 같습니다. AI는 모든 것을 기록할 수 있지만, 필요한 것을 찾기 위해 단 몇 페이지의 책장만 넘기면 됩니다. 이를 통해 AI는 지치거나 느려지지 않고도 긴 이야기를 완벽하게 기억할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →