← 최신 논문
🤖 machine learning

FlashMemory-DeepSeek-V4: Lightning Index Ultra-Long Context via Lookahead Sparse Attention

이 논문은 백본 프리(backbone-free)로 학습된 룩어헤드 희소 어텐션(Lookahead Sparse Attention) 메커니즘을 활용하여 핵심적인 KV 캐시 청크만을 선제적으로 예측하고 유지함으로써, 초장기 컨텍스트에서 다운스트림 정확도를 유지하거나 약간 향상시키면서도 물리적 메모리 오버헤드를 85% 이상 줄이는 새로운 추론 패러다임인 FlashMemory-DeepSeek-V4를 소개한다.

원저자: Yan Wang, Qifan Zhang, Jiachen Yu, Tian Liang, Dongyang Ma, Xiang Hu, Zibo Lin, Chunyang Li, Zhichao Wang, Jia Li, Yujiu Yang, Haitao Mi, Dong Yu

게시일 2026-06-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yan Wang, Qifan Zhang, Jiachen Yu, Tian Liang, Dongyang Ma, Xiang Hu, Zibo Lin, Chunyang Li, Zhichao Wang, Jia Li, Yujiu Yang, Haitao Mi, Dong Yu

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 거대한 퍼즐을 풀려고 노력하고 있지만, 퍼즐 조각들을 펼쳐 놓을 테이블(컴퓨터의 GPU 메모리)이 매우 작다고 상상해 보세요.

보통 똑똑한 AI(대규모 언어 모델)가 방대한 문서(책 한 권 전체와 같은)를 바탕으로 질문에 답하려고 할 때, AI는 그 책의 모든 페이지를 동시에 테이블 위에 펼쳐 놓으려고 합니다. 책이 길어질수록 테이블은 과부하 상태가 되고, 퍼즐 조각들은 바닥으로 떨어지며, AI는 느려지거나 멈춰버립니다. 이것이 이 논문에서 설명하는 "메모리 병목 현상"입니다.

FlashMemory-DeepSeek-V4는 이 문제를 해결하기 위한 새로운 방법입니다. AI는 책 전체를 펼쳐 놓는 대신, 지금 당장 어떤 페이지를 봐야 하는지 결정하는 똑똑한 사서를 사용합니다.

작동 방식은 다음과 같습니다.

1. 문제점: "수집벽"이 있는 AI

전통적인 AI는 마치 질문을 받았을 때, 답이 단 한 문단에 들어있더라도 역사 책 도서관 전체를 다 읽어야 한다고 고집하는 학생과 같습니다. 이 학생은 모든 페이지를 자신의 "작업 메모리"(GPU)에 계속 유지하려고 합니다.

  • 결과: 만약 이야기가 50만 단어라면, 이 학생에게는 축구장 크기만한 테이블이 필요합니다. 이는 비용이 많이 들고 비효율적입니다.

2. 해결책: "똑똑한 사서" (Lookahead Sparse Attention)

연구진은 **Lookahead Sparse Attention (LSA)**라고 불리는 새로운 시스템을 구축했습니다. 이제 AI 곁에는 매우 효율적인 사서가 서 있다고 상상해 보세요.

  • 비결: AI는 모든 페이지를 테이블 위에 올려두는 대신, 사서가 현재의 질문을 보고 앞으로 몇 문장 동안 필요하게 될 특정 페이지들을 예측합니다.
  • 행동: 사서는 오직 그 특정 페이지들만을 선반(CPU 저장소)에서 꺼내 작은 테이블(GPU 메모리) 위에 올려놓습니다. 나머지 책들은 선반 위에 안전하게 보관되어 방해되지 않도록 합니다.
  • 결과: 테이블은 작게 유지되지만, AI는 여전히 자신이 필요로 하는 정확한 정보에 접근할 수 있습니다.

3. 사서가 학습하는 법 ("디커플링" 훈련)

보통 사서를 훈련시키려면, 거대한 AI 모델(학생)이 사서와 함께 공부해야 합니다. 이는 느리고 거대한 컴퓨터를 필요로 합니다.

  • 혁신: 연구진은 사서를 별도로 훈련시킬 수 있다는 사실을 깨달았습니다. 그들은 AI가 이미 작성해 둔 "노트"(숨겨진 상태, hidden states)를 가져와서 그 노트만을 바탕으로 사서를 훈련시켰습니다.
  • 이점: 사서를 훈련시키기 위해 거대한 AI 모델을 컴퓨터에 로드할 필요가 없었습니다. 이는 도서관 전체 대신 인덱스 카드 한 더미를 가지고 사서를 훈련시키는 것과 같았습니다. 덕분에 훈련 속도가 믿기지 않을 정도로 빠르고 저렴해졌습니다.

4. 결과: "적을수록 좋다 (Less is More)"

연구진은 이 시스템을 64,000단어에서 50만 단어가 넘는 문서를 다루는 세 가지 주요 과제(LongBench-v2, LongMemEval, RULER)로 테스트했습니다.

  • 메모리 절감: 새로운 시스템은 표준 AI가 요구하는 메모리의 단 **13.5%**만을 사용했습니다. 가장 큰 규모(50만 단어)에서는 메모리를 90% 이상 절약했습니다.
  • 성능: 놀랍게도, 관련 없는 페이지들의 "소음"을 제거함으로써 AI는 실제로 표준 AI보다 약간 더 나은(약 0.6% 더 높은 정확도) 성능을 보였습니다. 사서가 "노이즈 필터" 역할을 하여 AI가 중요한 것에 집중할 수 있도록 도왔기 때문입니다.

5. 한계 (제약 사항)

논문은 이 시스템이 어려움을 겪는 부분에 대해서도 솔직하게 밝히고 있습니다:

  • "MRCR" 실패: 만약 작업이 (복잡한 유형의 검색 게임처럼) 책 전체의 모든 세부 사항을 동시에 기억해야 하는 것을 요구한다면, 사서가 가끔 목표를 놓치게 되어 AI의 성능이 크게 떨어집니다.
  • "맥락 부재(Context-Free)" 오류: 만약 AI가 긴 이야기와 아무런 관련이 없는 질문을 받는다면, 사서는 여전히 불필요하게 몇 개의 페이지를 추가로 가져오기도 하지만, 그럼에도 불구하고 전체적으로 많은 메모리를 절약합니다.
  • 길이 제한: 사서는 최대 512,000단어까지의 책을 바탕으로 훈련되었습니다. 만약 이보다 두 배 더 긴 책(100만 단어 이상)을 주면, 사서는 혼란을 느끼기 시작하며 어떤 페이지를 가져올지에 대해 무작위로 추측하게 됩니다.

6. 현재 상태

논문은 이 프로젝트가 조직 개편으로 인해 중단되었다는 메모와 함께 끝을 맺습니다. 수석 연구원이 회사를 떠났기 때문입니다. 하지만 그들은 "FlashMemory" 아이디어가 작동한다는 것을 보여주고 다른 이들이 이 작업을 이어갈 수 있도록 이 보고서를 공개했습니다.

요약하자면:
FlashMemory는 거대한 AI에게 똑똑한 필터를 주는 것과 같습니다. 데이터의 바다에 빠져 허우적거리는 대신, AI는 앞을 내다보며 살아남기에 꼭 필요한 핵심적인 구명조끼만을 집어 들고 나머지는 무시하는 법을 배웁니다. 이를 통해 AI는 거대한 테이블 없이도 방대한 책을 읽을 수 있으며, 많은 경우 소음 때문에 방해받지 않기 때문에 오히려 더 잘 읽을 수 있게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →