← 최신 논문
💬 NLP

CompactAttention: Accelerating Chunked Prefill with Block-Union KV Selection

CompactAttention 은 2 차원 블록 희소 마스크를 GQA 인지형 그룹별 KV 블록 테이블로 변환하는 블록-연합 KV 선택 메커니즘을 도입하여 명시적 압축 없이도 인플레이스 메모리 접근을 가능하게 함으로써 긴 컨텍스트 대규모 언어 모델에서 청크화된 프리필을 가속화하며, 이는 근접한 밀도 정확도를 유지하면서 최대 2.72 배의 속도 향상을 달성합니다.

원저자: Jiwon Song, Dongwon Jo, Beomseok Kang, Jae-Joon Kim

게시일 2026-05-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jiwon Song, Dongwon Jo, Beomseok Kang, Jae-Joon Kim

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대한 도서관 (컨텍스트) 을 바탕으로 질문에 답하려는 사서 (AI) 라고 상상해 보세요. 과거에는 거대한 도서관이 있다면 올바른 답을 찾기 위해 모든 책을 하나씩 읽어야 했으므로 시간이 무한히 걸렸습니다. 이를 가속화하기 위해 연구자들은 '조각화된 프리필 (chunked prefill)' 시스템을 발명했습니다. 이는 도서관 전체를 한 번에 읽는 대신 작은 배치 (조각) 단위로 읽고, 진행 과정에서 메모장 (KV 캐시) 에 메모를 추가하는 방식입니다.

그러나 새로운 문제가 발생했습니다: 새로운 질문 배치를 받을 때마다 매번 모든 것을 다시 읽지 않고도 메모장에서 올바른 페이지를 어떻게 빠르게 찾을 수 있을까요?

이 논문은 이 문제를 해결하는 새로운 방법인 CompactAttention을 소개합니다. 간단한 비유를 통해 작동 방식을 설명하겠습니다:

기존 방법의 문제점

이 논문은 사람들이 이 문제를 해결하려 했던 두 가지 주요 방식과 그 실패 원인을 지적합니다:

  1. "희소 커널 (Sparse Kernel)" 접근법 (비효율적인 스캐너):

    • 아이디어: 중요한 책들만 빨간 점으로 표시된 도서관 지도를 가지고 있다고 상상해 보세요. 흰 공간은 건너뛰고 빨간 점만 보려고 시도합니다.
    • 실패: 거대한 도서관 (긴 컨텍스트) 을 읽는데 아주 작은 질문 (작은 조각) 만 할 때, 이 방식은 느려집니다. 이는 전체 텍스트 벽을 스캔하는 데는 훌륭한 스캐너가 있지만, 문장 하나만 있을 때는 설정과 보정에 너무 많은 시간이 걸리는 것과 같습니다. 흰 공간을 '건너뛰는' 오버헤드가 실제로는 모든 것을 읽는 것보다 더 느리게 만듭니다.
  2. "쿼리 하위 샘플링 (Query-Subsampled)" 접근법 (게으른 사서):

    • 아이디어: 모든 질문을 확인하는 대신 배치에서 무작위로 몇 가지 질문만 골라, 그 질문들에 중요한 책들을 찾고, 그 책들이 모두에게 중요하다고 가정합니다.
    • 실패: 이는 위험합니다. 잘못된 몇 가지 질문을 고르면, 오직 한 가지 특정 질문만 필요로 했던 중요한 책을 놓칠 수 있습니다. 또한, 그 책들을 고르면 읽기 전에 선반에서 특수 테이블로 물리적으로 운반해야 합니다. 이 '운반 (데이터 복사)'은 많은 시간과 에너지를 소모합니다.

해결책: CompactAttention

CompactAttention은 책을 찾는 것책을 읽는 것을 분리함으로써 게임의 규칙을 바꿉니다.

단계 1: "유니온 (Union)" 전략 (검색 그룹화)

복잡한 '스킵 리스트 (희소 커널)'를 실행하거나 몇 가지 질문을 기반으로 추측하는 대신, CompactAttention은 지능적인 그룹화 트릭을 사용합니다:

  • 사건을 수사하는 형사들 (쿼리 헤드) 팀이 있다고 상상해 보세요. 각 형사는 자신이 중요하다고 생각하는 '용의자 (KV 블록)' 목록을 가지고 있습니다.
  • 각 형사가 혼자 일하게 두는 대신, CompactAttention은 이렇게 말합니다: "전 팀의 용의자들을 하나의 마스터 목록으로 합쳐 봅시다."
  • 이는 두 단계로 수행됩니다:
    1. Q-블록 유니온: 현재 배치의 모든 질문에 대한 목록을 결합합니다.
    2. 그룹 내 유니온: 함께 일하는 형사들의 목록을 결합합니다.
  • 결과: 모든 사람의 필요를 충족시키는 단일하고 최소한의 '마스터 목록'을 얻게 됩니다. 누구든 필요로 한다면 그 책이 목록에 포함되므로 중요한 책은 하나도 남지 않습니다.

단계 2: "제로-카피 (Zero-Copy)" 실행 (제자리에서 읽기)

이것이 마법 같은 부분입니다.

  • 기존 방식: 마스터 목록을 얻으면 빠르게 읽을 수 있도록 그 책들을 선반에서 특수 테이블로 물리적으로 옮겨야 합니다. 이 '이동'은 시간이 걸립니다.
  • CompactAttention 방식: 책들을 전혀 이동하지 않습니다. 대신 사서에게 "A 선반 3 열 5 번째 책; 그다음 B 선반 1 열 2 번째 책"이라고 말하는 **지도 (메타데이터)**만 건네줍니다.
  • 사서 (컴퓨터 커널) 는 선반의 그 자리로 직접 가서 읽습니다. 이를 **제로-카피 페이지드 어텐션 (Zero-Copy Paged Attention)**이라고 합니다. 데이터를 이동시키는 데 드는 모든 시간과 에너지를 절약합니다.

왜 이것이 중요한가

이 논문은 128,000 단어의 컨텍스트 (매우 긴 문서) 를 가진 거대한 AI 모델 (LLaMA-3.1-8B) 에서 이를 테스트했습니다.

  • 정확도: 도서관 전체를 읽는 것 (Dense Attention) 과 똑똑했습니다. 중요한 세부 사항을 놓치지 않았습니다.
  • 속도: 표준 방식보다 최대 2.72 배 빨랐습니다.

핵심 교훈

CompactAttention을 도서관을 재배열하려 하지 않고 완벽한 결합된 색인 카드만 사용하는 똑똑한 사서로 생각하세요.

'검색 (중요한 블록 찾기)'과 '실행 (그것들을 읽기)'이 분리되어야 한다는 점과, '그룹화' 트릭을 사용하여 아무것도 놓치지 않도록 함으로써, 그들은 지능을 잃지 않으면서 긴 문서 AI 처리를 훨씬 더 빠르게 만들었습니다. 그들은 병목 현상이 단순히 어떤 책을 선택할 것인지가 아니라, 어떻게 그 책을 집어 올리는지에 있었다는 것을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →