← 최신 논문
💬 NLP

LazyAttention: Efficient Retrieval-Augmented Generation with Deferred Positional Encoding

LazyAttention은 지연된 위치 인코딩(deferred positional encoding)을 커널화하여 KV 캐시의 제로 카피 및 위치 불가지론적 재사용을 가능하게 함으로써, 출력 품질을 저하시키지 않으면서도 RAG와 같은 롱 컨텍스트 애플리케이션에서 추론 처리량과 첫 번째 토큰 생성 시간(time-to-first-token)을 크게 향상시키는 새로운 어텐션 메커니즘을 도입합니다.

원저자: Haocheng Xia, Mihir Pamnani, Hanxi Fang, Supawit Chockchowwat, Yongjoo Park

게시일 2026-06-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Haocheng Xia, Mihir Pamnani, Hanxi Fang, Supawit Chockchowwat, Yongjoo Park

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 바쁜 레스토랑을 운영하는 셰프(AI 모델)라고 상상해 보세요. 고객(사용자)들은 당신이 가진 식재료(문서)라는 메뉴를 바탕으로 요리를 주문합니다.

문제점: "끈적거리는" 레시피 북

일반적인 주방에서는 특정 식재로 요리를 할 때, 다음에 처음부터 다시 시작하지 않도록 그 단계를 노트(KV 캐시)에 적어둡니다.

하지만 현재의 노트 작성 방식에는 이상한 규칙이 있습니다: 노트가 특정 페이지 번호에 붙어 있다는 점입니다.

  • 만약 당신이 1페이지에서 "토마토"를 사용했다면, 다음 고객이 1페이지에서 "토마토"를 요청할 때만 그 노트를 재사용할 수 있습니다.
  • 만약 다음 고객이 50페이지에서 "토마토"를 원한다면, 기존의 노트는 쓸모가 없습니다. 당신은 50페이지를 위한 새로운 노트를 다시 작성해야 하고, 처음부터 다시 요리를 시작해야 합니다.

이것은 엄청난 낭비입니다. 실제 레스토랑(RAG 시스템과 같은)에서는 동일한 인기 식재료(문서)가 반복해서 사용되지만, 이 식재료들은 순서에 따라 서로 다른 위치에 나타납니다. 주방은 중복된 노트들로 가득 차게 되고, 셰프는 요리를 하는 시간보다 노트를 쓰는 데 더 많은 시간을 소비하게 됩니다.

해결책: LazyAttention (더 "마법 같은 오버레이")

이 논문의 저자들은 LazyAttention을 통해 주방을 관리하는 아주 영리한 새로운 방법을 제안합니다. 노트에 페이지 번호를 직접 적는 대신, 노트를 페이지와 무관하게(page-agnostic) 유지하는 것입니다.

작동 방식은 다음과 같습니다:

  1. 노트 작성: 당신은 페이지 번호를 언급하지 않고 "토마토"의 순수한 풍미만을 적습니다. 그리고 이 단 하나의 보편적인 노트를 식료품 저장실에 보관합니다.
  2. 마법 같은 오버레이: 고객이 50페이지에서 "토마토"를 주문하면, 당신은 노트를 다시 쓰는 대신 투명하고 마법 같은 오버레이를 그 노트 위에 얹습니다. 이 오버레이는 셰프에게 즉각적으로 "이 토마토를 50페이지에 있는 것처럼 취급하라"고 알려줍니다.
  3. 결-과: 당신은 1페이지, 50페이지, 혹은 100페이지를 위해서도 정확히 동일한 물리적 노트를 재사용합니다. 노트를 다시 쓰거나 식료품 선반을 복사할 필요가 없습니다.

이것이 왜 중요한가

논문은 이 간단한 기술이 두 가지 주요 골칫거리를 해결한다고 주장합니다:

  • 속도 (첫 번째 토큰 생성 시간 - Time-to-First-Token): 셰프가 매번 노트를 다시 쓰거나 새로운 식재료를 찾을 필요가 없기 때문에, 첫 한 입의 요리가 훨씬 빠르게 나옵니다. 논문에 따르면 이는 현재 최고의 방식보다 1.37배 더 빠릅니다.
  • 공간 (메모리): 모든 가능한 페이지마다 "토마토" 노트를 20개씩 보관하는 것이 아니므로, 선반 공간을 대폭 절약할 수 있습니다. 덕着 주방은 더 많은 고유한 식재료를 보유할 수 있습니다. 논문은 이 방식이 기존 방식보다 "적중률(hit rate, 필요한 것을 찾아내는 빈도)"을 7.5배 개선했다고 보여줍니다.

왜 "Lazy(게으른)"인가?

그 오버레이를 얹는 작업이 추가적인 시간을 잡아먹지는 않을지 의문이 생길 수 있습니다.
저자들은 아니라고 말합니다. 왜냐하면 그들이 오버레이를 매우 효율적으로 만들었기 때문입니다.

  • 기존 방식: 전체 노트를 다시 쓰고, 그 다음 옮깁니다. (느리고 비용이 많이 듭니다).
  • LazyAttention 방식: 이미 요리를 하고 있는 도중에 아주 작고 즉각적인 수학적 수정 사항을 적용하기만 하면 됩니다. 이는 마치 전체 소금 배합을 미리 섞어두는 것이 아니라, 냄비를 젓는 바로 그 순간에 소금 한 꼬집을 넣는 것과 같습니다.

핵심 요약

LazyAttention은 AI가 무언가를 기억하는 새로운 방식입니다. 정보가 다른 곳에 나타난다는 이유만으로 동일한 정보를 여러 번 저장하여 메모리를 낭비하는 것을 방지합니다. 대신, 정보를 한 번만 저장하고, 실제로 사용될 때만 "게으르게(lazily)" 문맥을 조정합니다.

결과:

  • 더 빠른 답변: 고객은 1.37배 더 빨리 음식을 받습니다.
  • 더 많은 용량: 주방은 동시에 1.40배 더 많은 고객을 처리할 수 있습니다.
  • 동일한 맛: 음식의 맛(답변의 품질)은 똑같이 유지됩니다.

이 논문은 표준적인 질의응답 작업(예: 이야기를 읽고 질문에 답하기)을 통해 테스트를 진행했으며, 이 방식이 완벽하게 작동함을 확인했습니다. 이는 긴 대화와 복잡한 검색을 훨씬 더 매끄럽고 저렴하게 만들어 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →