← 최신 논문
🤖 machine learning

An Efficient Hybrid Sparse Attention with CPU-GPU Parallelism for Long-Context Inference

Fluxion 은 CPU 에 상주하는 KV 캐시의 한계를 극복하기 위해 출력 인식 KV 예산 할당, 헤드별 희소 구성, 그리고 크로스 디바이스 조정 실행을 함께 설계하여 긴 컨텍스트 추론에서 높은 정확도와 상당한 속도 향상을 동시에 달성하는 하이브리드 희소 어텐션 프레임워크입니다.

원저자: Feiyu Yao, Zhixiong Niu, Xiaqing Li, Yongqiang Xiong, Juan Fang, Qian Wang

게시일 2026-05-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Feiyu Yao, Zhixiong Niu, Xiaqing Li, Yongqiang Xiong, Juan Fang, Qian Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

만약 단일 질문에 답하기 위해 10 만 페이지에 달하는 거대한 소설을 읽으려 한다고 상상해 보세요. 당신의 뇌 (즉, GPU) 는 정보를 처리하는 속도가 매우 빠르지만, 한 번에 '작업 메모리'에 보관할 수 있는 페이지 수는 몇 장에 불과합니다. 책의 나머지 부분은 바로 옆 방의 선반 (즉, CPU 메모리) 에 놓여 있습니다.

질문에 답하기 위해 당신의 뇌는 특정 페이지를 가져오기 위해 선반과 작업 공간 사이를 끊임없이 왕복해야 합니다. 이 왕복은 느리고 피곤합니다. AI 세계에서는 이를 장문맥 추론 (Long-Context Inference) 이라고 부릅니다.

이 논문은 이러한 문제를 해결하기 위해 Fluxion이라는 새로운 시스템을 소개합니다. 작동 원리를 간단한 개념으로 나누어 설명하면 다음과 같습니다:

문제: "러너" 대 "사서"

현재 이를 처리하는 두 가지 주요 방식이 있습니다:

  1. "올인원" 러너: 당신의 뇌는 선반에서 필요한 모든 것을 한꺼번에 가져와서 되돌려온 뒤, 모두 한 번에 처리하려 합니다. 하지만 복도 (CPU 와 GPU 간의 연결부) 가 좁고, 너무 많은 것을 나르면 교통 체증이 발생하기 때문에 이는 느립니다.
  2. "게으른" 사서: 당신의 뇌는 올바른 페이지를 찾아달라고 사서 (CPU) 에게 요청을 보냅니다. 사서는 책 전체를 읽어 관련 부분을 찾아 답만 보내줍니다. 이는 복도 교통량을 줄여주지만, 사서가 작업을 끝낼 때까지 당신의 뇌는 기다리며 유휴 상태에 머뭅니다.

두 방법 모두 시간을 낭비합니다. 논문은 가장 큰 병목 현상이 페이지를 찾는 것뿐만 아니라, 사서 (CPU) 가 작업하는 동안 러너 (GPU) 가 종종 아무것도 하지 않고 서 있는 데 있다고 밝혔습니다.

해결책: Fluxion 의 세 가지 똑똑한 전략

Fluxion 은 당신의 뇌와 사서를 위한 초효율 팀 매니저처럼 작동하는 새로운 시스템입니다. 이는 세 가지 주요 전략을 사용합니다:

1. "스마트 예산" (출력 인식 할당)

과거의 방식: 사서는 페이지가 얼마나 "시끄럽거나" "명확한지" (Attention Scores) 에 기반하여 페이지를 가져왔습니다. 하지만 때로는 페이지가 매우 시끄럽더라도 최종 답변과 실제로 관련이 없는 반면, 조용한 페이지가 핵심을 담고 있기도 합니다.
Fluxion 의 방식: Fluxion 은 "이 페이지가 최종 답변을 실제로 얼마나 바꾸는가?"라고 묻습니다. 시끄럽지만 쓸모없는 페이지는 무시하고, 정말로 중요한 페이지에만 집중합니다.

  • 비유: 여행을 준비한다고 상상해 보세요. 과거의 방식은 반짝이는 것이라면 모두 챙기는 것이었습니다. Fluxion 은 "그 반짝이는 돌은 필요 없어요. 대신 이 조용하지만 무거운 도구는 필요해요"라고 말하는 스마트한 packing list 와 같습니다. 이는 공간과 시간을 절약해 줍니다.

2. "전문 팀" (헤드별 구성)

과거의 방식: 시스템은 뇌의 모든 부분을 동일하게 취급했습니다. 뇌가 묻는 모든 질문에 대해 페이지를 검색하려 했으며, 심지어 일부 질문은 쉬웠음에도 불구하고요.
Fluxion 의 방식: Fluxion 은 뇌의 일부는 "스트리머 (Streamers)" (가장 최근의 페이지만 필요로 함) 이고, 다른 일부는 "리트리버 (Retrievers)" (과거를 깊이 파헤쳐야 함) 라는 점을 깨닫습니다.

  • 비유: 뉴스룸을 생각해 보세요. 일부 기자 (스트리머) 는 최신 속보만 필요하므로 TV 를 그냥 봅니다. 다른 기자들 (리트리버) 은 옛 아카이브를 파헤쳐야 합니다. Fluxion 은 "TV 시청자"들이 아카이브를 파헤치는 시간을 낭비하지 않고 제자리에 머물도록 하고, "아키비스트"들에게 무거운 작업을 맡깁니다.

3. "교통 경찰" (우선순위 기반 스케줄링)

과거의 방식: CPU 와 GPU 는 엄격한 순서대로 작동했습니다. CPU 가 작업을 끝내면 GPU 가 시작했습니다. 이로 인해 GPU 는 복도에서 기다리게 되었습니다.
Fluxion 의 방식: Fluxion 은 교통 경찰처럼 행동합니다. 작업 목록을 보고 "이봐요, GPU 가 비어 있어요! 지금 바로 크고 무거운 작업을 주세요. 그 사이 CPU 는 배경에서 작고 빠른 작업을 처리할 수 있어요"라고 말합니다.

  • 비유: 레스토랑 주방을 상상해 보세요. 요리사 (GPU) 가 준비 요리사 (CPU) 가 모든 것을 다 다질 때까지 기다렸다가 요리를 시작하는 대신, 요리사는 스테이크 (큰 작업) 를 굽는 동안 준비 요리사는 양파 (작은 작업) 를 동시에 다집니다. 그들은 병렬로 작업하여 모두 바쁘게 유지합니다.

결과: 더 빠르고 똑똑해짐

이 논문은 Llama 와 Qwen 과 같은 두 가지 인기 있는 AI 모델을 대상으로 최대 128,000 단어에 달하는 방대한 양의 텍스트로 Fluxion 을 테스트했습니다.

  • 속도: Fluxion 은 기존 최선 방법보다 AI 를 1.5 배에서 3.7 배까지 더 빠르게 만들었습니다.
  • 품질: AI 가 "바보가" 된 것은 아닙니다. 오히려 아무것도 건너뛰지 않고 책 전체를 읽는 것과 거의 비슷했습니다. 답변 품질의 차이는 미미했습니다 (테스트에서 0.3 점 미만).
  • 효율성: "GPU 유휴 시간" (뇌가 기다린 시간) 은 일부 경우 약 70% 에서 45% 로 크게 감소했습니다.

요약

Fluxion 은 혼란스러운 도서관 시스템을 매우 조직적이고 똑똑한 팀으로 업그레이드하는 것과 같습니다. 이는 관련 없는 페이지에 시간을 낭비하는 것을 막고, 올바른 작업자에게 올바른 작업을 할당하며, 빠른 작업자와 느린 작업자가 항상 동시에 바쁘게 일하도록 보장합니다. 이를 통해 AI 는 좋은 답변을 제공하는 능력을 잃지 않고도 거대한 문서를 빠르게 읽고 이해할 수 있게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →