← 최신 논문
🤖 machine learning

Requests of a Feather Must Flock Together: Batch Size vs. Prefix Homogeneity in LLM Inference

본 논문은 경량화된 Chunked Hash Tree를 활용하여 배치 크기와 접두사 동질성 간의 균형을 최적화하는 강화 학습 기반의 접두사 인식 스케줄러인 Feather를 소개하며, 기존 최첨단 스케줄러 대비 KV 캐시 접근 오버헤드를 줄여 LLM 추론 처리량을 2~10 배 향상시킵니다.

원저자: Saksham Rathi, Preeti, Mythili Vutukuru

게시일 2026-05-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Saksham Rathi, Preeti, Mythili Vutukuru

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 한 명의 사서 (GPU) 가 동시에 수천 명의 다른 사람들 (요청) 로부터 질문을 받아야 하는 매우 바쁘고 고속의 도서관을 운영한다고 가정해 봅시다.

대형 언어 모델 (LLM) 세계에서는 사서가 생성하는 단어 하나하나마다 거대한 '문맥' (Key-Value 캐시) 책을 읽어야 합니다. 이 논문은 현재 질문을 조직하는 방식이 비효율적이라고 주장합니다. 왜냐하면 이 방식이 사서가 한 번에 몇 개의 질문을 처리하는지에 얼마나 집중하는지보다, 그 질문들이 얼마나 유사한지에 더 초점을 맞추기 때문입니다.

이들이 제시한 해결책인 Feather의 이야기를 간단한 개념으로 나누어 설명해 보겠습니다.

1. 문제: '북적거리는 버스' vs '가족 단체'

현재 대부분의 시스템은 여행을 효율적으로 만들기 위해 가능한 한 많은 사람을 버스 (배치) 에 태우려고 합니다. 그들은 '선착순' 규칙을 사용합니다.

  • 문제점: 만약 500 명의 낯선 사람들을 버스에 태우면, 그들은 모두 500 개의 서로 다른 목적지를 원합니다. 운전자는 500 개의 서로 다른 정류장에 멈춰야 하며, 끊임없이 방향을 바꿔야 합니다. 이는 혼란스럽고 느립니다.
  • 발견: 저자들은 같은 거리에 사는 (공통된 '접두어'를 가진) 100 명의 작은 그룹을 태우면 운전자가 멈추지 않고 그 거리를 곧장 달려갈 수 있음을 발견했습니다. 버스가 꽉 차지는 않았더라도, 운전자가 핸들을 계속 돌릴 필요가 없기 때문에 여행이 훨씬 빨라집니다.

핵심 통찰: 서로 다른 곳으로 가는 거대한 무리보다, 같은 곳으로 가는 작은 무리가 더 낫습니다. 이를 **접두어 동질성 (Prefix Homogeneity)**이라고 합니다.

2. 구식 방식: '나무 등반가'

기존 시스템 (SGLang 등) 은 거대하고 복잡한 가족 나무 (Radix Tree) 를 살펴봄으로써 누가 같은 조상을 공유하는지 확인하여 이러한 그룹을 찾으려 합니다.

  • 문제점: 이 나무를 타고 올라가서 일치하는 대상을 찾는 것은 컴퓨터의 '뇌' (CPU) 에 많은 시간과 에너지를 소모합니다. 실제로 나무를 타고 올라가는 데 걸린 시간이 사서가 실제로 질문에 답하는 데 걸린 시간과 거의 비슷할 때도 있었습니다. 마치 10 분 동안 운전하기 위해 승객들을 정리하는 데 10 분을 쓰는 것과 같습니다.

3. 해결책: 'Feather'

저자들은 두 가지 문제 모두를 해결하는 새로운 스케줄러인 Feather를 구축했습니다.

Part A: '조각화된 해시 트리 (CHT)' – 똑똑한 체크리스트

거대한 가족 나무를 타고 올라가는 대신, Feather 는 교묘한 단축경을 사용합니다.

  • 유추: 사람의 이름의 모든 글자를 확인하는 대신, 주소의 처음 몇 개의 '조각'만 확인한다고 상상해 보세요.
  • 작동 원리: Feather 는 긴 텍스트를 작은 블록 (조각) 으로 나누고 각 블록에 고유한 '지문' (해시) 을 부여합니다. 그리고 현재 사용 중인 지문의 간단한 목록을 유지합니다.
  • 장점: Feather 는 즉시 "아, 이 새로운 요청은 이미 버스에 타고 있는 그룹과 같은 지문을 가지고 있군"이라고 파악할 수 있습니다. 이는 매우 빨라 CPU '뇌'가 거의 땀 한 방울 흘리지 않습니다. 티켓을 확인하기 위해 책 전체를 읽는 대신 바코드 스캐너를 사용하는 것과 같습니다.

Part B: '강화 학습 (RL)' – 똑똑한 지휘자

Feather 는 유사한 그룹을 찾는 것뿐만 아니라, 언제 사람을 더 태우는 것을 멈출지 학습합니다.

  • 딜레마: 버스에 계속 사람을 태우다 보면, 결국 다른 거리에 사는 사람을 태워야 할지도 모릅니다. 만약 그 사람을 태우면 전체 그룹이 엉망이 되어 속도가 떨어집니다.
  • 학습: Feather 는 시행착오를 통해 배운 똑똑한 지휘자처럼 행동합니다. "내가 한 명 더 태우면 우리가 속도를 잃을지도 모른다. 지금 버스를 보내고 다음 그룹을 기다리는 게 낫겠다."
  • 결과: 이는 버스가 가득 차는 것과 모두 같은 거리에 있는 것 사이에서 균형을 맞추며, 배치를 시작할 완벽한 순간을 동적으로 결정합니다.

4. 결과: 도서관 속도 향상

저자들이 Feather 를 테스트했을 때:

  • 속도: 사람들이 유사한 질문을 할 때, 기존 최선 방법보다 시스템이 2 배에서 10 배까지 빨라졌습니다.
  • 안전성: 질문들이 모두 완전히 다르면 (공통된 거리가 없으면), Feather 는 혼란스러워하지 않았습니다. 그저 기존 방법과 똑같이 잘 수행했을 뿐입니다.
  • 효율성: 컴퓨터 메모리 내의 '교통 체증'을 줄여, 사서가 책 페이지를 가져오기 위해 오가야 하는 횟수가 줄어들었습니다.

요약

Feather는 AI 요청을 조직하는 새로운 방법입니다. 가능한 한 많은 요청을 단일 배치에 밀어 넣는 대신, 유사한 요청들을 그룹화합니다 (같은 목적지로 가는 가족처럼) 그리고 이러한 그룹을 찾기 위해 초고속이고 저에너지인 방법을 사용합니다. 이동이 매끄럽고 빨라지도록 그룹에 사람을 더 추가할 때를 정확히 언제 멈출지 학습합니다.

이 논문은 이 접근 방식이 비싼 새로운 하드웨어가 필요 없이 단순히 '교통'을 더 똑똑하게 조직함으로써 AI 응답 시간을 크게 단축한다고 주장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →