← 최신 논문
💬 NLP

AsyncTLS: Efficient Generative LLM Inference with Asynchronous Two-level Sparse Attention

AsyncTLS 는 블록 필터링과 토큰 선택을 결합한 계층적 희소 어텐션과 비동기 오프로딩 엔진을 통해 긴 컨텍스트 LLM 추론 시 정확도를 유지하면서 연산 속도와 처리량을 획기적으로 개선합니다.

원저자: Yuxuan Hu, Jianchao Tan, Jiaqi Zhang, Wen Zan, Pingwei Sun, Yifan Lu, Yerui Sun, Yuchen Xie, Xunliang Cai, Jing Zhang

게시일 2026-04-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yuxuan Hu, Jianchao Tan, Jiaqi Zhang, Wen Zan, Pingwei Sun, Yifan Lu, Yerui Sun, Yuchen Xie, Xunliang Cai, Jing Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🚀 문제: "방대한 도서관"과 "작은 책상"의 딜레마

인공지능이 긴 글을 읽을 때, 그 모든 내용을 기억하려면 엄청난 메모리 (KV 캐시) 가 필요합니다. 하지만 컴퓨터의 메모리는 한정되어 있습니다.

  • 기존의 방법 1 (모두 읽기): 도서관에 있는 모든 책 (문장) 을 책상 위에 다 펼쳐놓고 읽습니다. 정확하지만 책상이 너무 커서 (메모리 부족) 책상 밖으로 내보내야 하고, 다시 가져오느라 시간이 너무 오래 걸립니다.
  • 기존의 방법 2 (조각조각 읽기): 책상 위에 몇 권만 올려두고 나머지는 창고에 둡니다. 하지만 '어떤 책이 중요한지'를 매번 정밀하게 고르느라 (토큰 단위 선택) 시간이 너무 걸립니다.
  • 기존의 방법 3 (뭉텅이로 읽기): 책 전체를 '장 (Chapter)' 단위로 묶어서 고릅니다. 빠르지만, 중요한 내용이 섞인 장 전체를 가져오거나, 정작 중요한 한 문장이 있는 장을 놓칠 수 있어 정확도가 떨어집니다.

✨ 해결책: AsyncTLS (비동기 2 단계 스파스 어텐션)

AsyncTLS 는 이 모든 단점을 해결하기 위해 **"2 단계 필터링"**과 **"비동기 작업"**을 결합했습니다.

1. 2 단계 필터링: "도서관 사서"와 "전문가"의 협업

이 기술은 중요한 정보를 찾을 때 두 단계를 거칩니다.

  • 1 단계 (거친 필터링 - 블록 단위):
    먼저 도서관 사서가 "어떤 **장 (Block)**에 중요한 내용이 있을지" 대략적으로 빠르게 훑어봅니다. (예: "3 장과 5 장에 핵심 내용이 있겠구나.")
    • 비유: 도서관 전체를 다 뒤지지 않고, 관련 있는 '장'만 골라냅니다.
  • 2 단계 (정밀 필터링 - 토큰 단위):
    이제 전문가가 골라낸 '장' 안으로 들어가서, **정말 중요한 '문장 (Token)'**만 딱 집어냅니다.
    • 비유: 3 장과 5 장만 가져와서, 그 안에서 핵심 문장 3 개만 뽑아냅니다.

결과: '모든 책을 다 보는 것'보다 빠르고, '뭉텅이로만 보는 것'보다 정확합니다.

2. 비동기 오프로딩 엔진: "요리사와 배달부"의 동시 작업

메모리가 부족해서 데이터를 컴퓨터 (GPU) 와 외부 저장소 (CPU) 사이에서 오갈 때, 기다리는 시간이 문제입니다. AsyncTLS 는 이 시간을 아끼기 위해 동시 작업을 합니다.

  • 상황: 요리사 (계산) 가 요리를 하고 있는데, 재료가 떨어지면 배달부 (데이터 전송) 가 와서 재료를 가져와야 합니다. 보통은 요리사가 멈추고 기다려야 합니다.
  • AsyncTLS 의 방식:
    1. 요리사가 지금 요리를 하는 동안, 배달부는 다음 요리에 필요한 재료를 미리 준비해 옵니다.
    2. 그리고 지금 필요한 재료는 이미 준비되어 있으니 바로 사용합니다.
    3. 또한, 매번 재료를 통째로 가져오지 않고, 변화된 부분만 가져옵니다. (예: "이전엔 소금 1 개, 이번엔 소금 2 개 필요" → 소금 1 개만 더 가져옴)

결과: 요리사 (계산) 가 멈추는 시간이 거의 없어져서 전체 속도가 매우 빨라집니다.


🏆 이 기술의 성과 (실제 결과)

이 기술을 적용한 실험 결과, 다음과 같은 놀라운 성과를 거두었습니다.

  1. 정확도: 모든 책을 다 읽는 것과 거의 똑같은 정확도를 냅니다. (지능이 떨어지지 않음)
  2. 속도:
    • 연산 속도가 기존 방법보다 1.2 배에서 10 배까지 빨라졌습니다.
    • 전체 처리량 ( throughput ) 은 1.3 배에서 4.7 배 증가했습니다.
  3. 적용: 다양한 최신 AI 모델 (Qwen3, GLM-4.7 등) 과 긴 문서 (32,000~96,000 단어) 에서 모두 잘 작동했습니다.

💡 한 줄 요약

AsyncTLS는 "긴 글을 읽을 때, 먼저 관련 있는 장을 빠르게 골라낸 뒤 (1 단계), 그 안에서 핵심 문장만 정밀하게 뽑아내고 (2 단계), 동시에 다음 재료를 미리 준비하는 (비동기) 방식으로, 정확성은 유지하면서 속도는 폭발적으로 높인 새로운 AI 기술입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →