← 최신 논문
💬 NLP

SparDA: Sparse Decoupled Attention for Efficient Long-Context LLM Inference

SparDA는 효율적인 룩어헤드(lookahead) 선택과 CPU-GPU 프리페칭의 오버랩을 가능하게 하는 전용 "Forecast" 프로젝션을 갖춘 희소하고 분리된 어텐션 아키텍처를 도입함으로써, KV 캐시 병목 현상을 극복하고 선택 복잡도를 줄여 정확도를 유지하면서도 롱 컨텍스트 LLM 추론을 크게 가속화합니다.

원저자: Yaosheng Fu, Guangxuan Xiao, Xin Dong, Song Han, Oreste Villa

게시일 2026-06-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yaosheng Fu, Guangxuan Xiao, Xin Dong, Song Han, Oreste Villa

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 단 하나의 질문에 답하기 위해 10만 페이지에 달하는 거대한 책을 읽어야 한다고 상상해 보십시오. 당신은 고속 사무실(GPU)에 앉아 있는 매우 똑똑한 AI(거대 언어 모델)이지만, 책이 너무 길어서 책상 위에 다 올려둘 수가 없습니다. 대부분의 책은 복도 건너편의 창고(CPU 메모리)에 두어야 합니다.

매번 새로운 페이지를 읽을 때마다 당신은 다음 과정을 거쳐야 합니다:

  1. 어떤 페이지가 중요한지 찾아보고,
  2. 창고로 달려가 그 페이지들을 가져오고,
  3. 다시 책상으로 달려와서 그것들을 읽어야 합니다.

기존 방식에는 두 가지 문제가 있습니다:

  • "달리는 것"이 느립니다: 복도(PCIe 연결)는 당신의 책상보다 훨씬 느립니다. 매 페이지마다 복도를 왔다 갔다 해야 한다면, 당신은 읽는 시간보다 달리는 데 더 많은 시간을 쓰게 됩니다.
  • "찾아보는 것"이 진 빠집니다: 어떤 페이지를 가져올지 결정하기도 전에, 무엇이 중요한지 결정하기 위해 전체 페이지 목록을 전부 훑어야 합니다. 책이 길어질수록 이 스캐닝 작업은 엄청나게 오래 걸리며, 당신이 달리기도 전에 이미 속도를 늦춰버립니다.

SparDA의 등장: "수정구슬"을 가진 사서

이 논문은 이 과정을 훨씬 빠르게 만들기 위해 설계된 새로운 시스템인 SparDA를 소개합니다. 이 시스템은 "분리된 어텐션(Decoupled Attention)"이라고 불리는 두 가지 비결을 사용합니다.

1. 수정구슬 (예측, The "Forecast")

기존 시스템에서는 현재 페이지를 다 읽은 후에, 다음 문장을 위해 어떤 페이지가 필요할지 전체 목록을 훑어야 했습니다. 이는 항상 한 발짝 뒤처지는 것을 의미했습니다.

SparDA는 당신의 뇌에 특별한 "수정구슬" 투영(Forecast) 기능을 추가합니다. 당신이 현재 100페이지를 읽고 있는 동안, 수정구슬은 이미 앞을 내다보며 다음 101페이지를 위해 어떤 페이지가 필요할지를 알려줍니다.

이것이 중요한 이유: 수정구슬은 당신이 현재의 과업을 마치기도 전에 무엇이 필요한지 미리 알기 때문에, 시스템은 당신이 현재 페이지를 읽는 동안 다음 페이지들을 가져오도록 러너(runner)를 보낼 수 있습니다. 이것을 "오버래핑(overlapping)"이라고 합니다. 당신은 러너를 기다리는 것이 아니라, 당신이 작업하는 동안 러너가 백그라운드에서 작업하고 있는 것입니다.

2. 간소화된 인덱스 (압축된 선택기, The "Compact Selector")

기존 시스템에서 어떤 페이지를 가져올지 결정하는 것은, 어떤 책을 꺼낼지 결정하기 위해 100명의 사서가 동시에 소리를 지르는 것과 같았습니다. 이는 혼란스럽고 느렸습니다(O(T2)O(T^2) 복잡도).

SparDA는 책을 찾는 사람(선택기, Selector)이 텍스트를 읽는 사람(어텐션, Attention)과 동일할 필요가 없다는 점을 깨달았습니다. 그래서 SparDA는 100명의 소리 지르는 사서 대신, 적절한 선반을 가리키기만 하는 한 명의 효율적인 사서(Forecast head)로 대체했습니다.

이것이 중요한 이유: 이는 의사결정 과정을 단순화합니다. 이 과정은 무거운 수학 연산(예: "softmax" 연산)을 제거하여, 책이 아무리 길어져도 "찾아보는" 단계를 믿을 수 없을 정도로 빠르게 만듭니다.

결과: 속도와 지능

저자들은 두 개의 80억 파라미터 AI 모델(매우 똑똑하지만 아직 '슈퍼' 거인은 아닌 수준)을 대상으로 테스트를 진행했습니다. 결과는 다음과 같습니다:

  • 정확도 손실 없음: AI가 "멍청해지지" 않았습니다. 오히려 매우 긴 추론 작업에서는 더 긴 문맥을 혼란 없이 처리할 수 있게 되어 오히려 약간 더 똑똑해졌습니다.
  • 더 빠른 읽기 (Prefill): AI가 긴 문서를 처음 읽으며 준비할 때, 최대 1.25배 더 빨랐습니다.
  • 더 빠른 답변 (Decode): AI가 한 번에 한 단어씩 답변을 생성할 때, 최대 1.7배 더 빨랐습니다.
  • "배치(Batch)" 보너스: 시스템이 매우 효율적이기 때문에, 사무실에 더 많은 "학생들(배치)"을 동시에 수용할 수 있습니다. 어떤 경우에는 SparDA가 이 오프로딩(offloading) 기술을 사용하지 않는 시스템보다 초당 5.3배 더 많은 데이터를 처리할 수 있게 해주었습니다.

핵심 요약

SparDA를 도서관 시스템의 업그레이드로 생각해보십시오. 사서가 읽기를 멈추고, 전체 카탈로그를 훑고, 그 후에 다음 책을 가지러 가는 대신, SparDA는 사서에게 예측 지도단 한 명의 매우 빠른 조수를 제공합니다. 이를 통해 사서는 백그라운드에서 조수가 이미 다음 책들을 가져오는 동안에도 전속력으로 계속 읽을 수 있습니다.

이 논문은 SparDA가 전체 AI 모델을 처음부터 다시 학습시킬 필요 없이, 이 작은 특화된 "수정구슬" 구성 요소를 추가하는 것만으로도 긴 문맥의 AI 추론(긴 텍스트를 읽고 이해하는 것)을 훨씬 더 빠르고 효율적으로 만든다고 주장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →