← 최신 논문
⚡ electrical engineering

StarSD: One-for-Many Speculative Decoding

StarSD는 스타 토폴로지를 활용하여 분산된 노드 간의 초안 작성(drafting)과 검증(verification)을 분리함으로써, 하나의 초안 모델이 여러 타겟 모델을 효율적으로 서비스할 수 있도록 하여 이기종 LLM 추론 클러스터에서의 자원 활용도와 지연 시간을 개선하는 확장 가능한 일대다(one-for-many) 투기적 디코딩 프레임워크입니다.

원저자: Junhao He, Feiran You, Hongyang Du

게시일 2026-01-30
📖 4 분 읽기☕ 가벼운 읽기

원저자: Junhao He, Feiran You, Hongyang Du

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 복잡하고 고급스러운 요리를 제공하는 고급 레스토랑(타겟 모델)을 운영하고 있다고 상상해 보세요. 서비스 속도를 높이기 위해, 당신은 더 빠르지만 경험은 적은 수셰프(드래프트 모델)를 고용했습니다. 수셰프는 다음 몇 가지 재료가 무엇일지 추측하여 메모장에 적어둡니다. 그러면 헤드 셰프가 이 추측이 맞는지 빠르게 확인합니다. 추측이 맞으면 헤드 셰프는 이를 승인하고 다음 단계로 넘어가고, 틀리면 헤드 셰프가 이를 수정합니다.

과거에 이 팀은 매우 특정한 방식으로 일했습니다. 수셰프와 헤드 셰프는 같은 작은 주방 안에 갇혀 있었습니다. 그들은 제한된 조리대 공간(메모리)을 공유해야 했습니다. 만약 헤드 셰프가 목록을 확인하느라 바쁘면, 수셰프는 헤드 셰프가 끝날 때까지 아무것도 하지 못한 채 서서 기다려야 했습니다. 이는 주방이 완전히 생산적이지 못한 "유휴 시간(dead time)"을 만들어냈습니다.

StarSD는 이 두 가지 큰 문제를 해결하는 새로운 주방 조직 방식입니다: 바로 조리대 공간이 부족해지는 문제와 기다리는 동안 시간을 낭비하는 문제입니다.

문제점: "일대일(One-to-One)" 병목 현상

전통적으로, 모든 헤드 셰프에게는 각자의 전담 수셰프가 배정되었습니다.

  1. 공간 문제: 현대적인 레스토랑에서 헤드 셰프들은 덩치가 커서 많은 조리 공간을 필요로 합니다. 따라서 그 옆에 전담 수셰프가 서 있을 공간이 부족한 경우가 많습니다.
  2. 유휴 시간: 헤드 셰프가 목록을 확인하는 동안 수셰프는 가만히 앉아 있습니다. 반대로 수셰프가 적는 동안 헤드 셰프는 가만히 앉아 있습니다. 그들은 서로 번갈아 가며 일하기 때문에, 전체 시간의 절반은 주방이 절반만 가동되는 상태로 남겨집니다.

StarSD의 솔루션: "일대다(One-for-Many)" 스타 구조

StarSD는 레이아웃을 변경합니다. 모든 헤드 셰프가 각자의 수셰프를 갖는 대신, 한 명의 초효율적인 수셰프가 동시에 여러 명의 헤드 셰프를 보좌합니다.

논문에 근거하여 작동 방식은 다음과 같습니다:

1. 스타 토폴로지 (허브 앤 스포크)
수셰프가 주방 중앙의 중심 허브라고 상상해 보세요. 헤드 셰프들은 방 곳곳(다른 조리대나 심지어 다른 방)에 흩어져 있습니다.

  • 헤드 셰프들은 현재의 주문(검증된 접두사, verified prefix)을 외칩니다.
  • 중앙의 수셰프는 이들의 목소리를 모두 듣습니다. 한 명의 헤드 셰프가 준비되는 즉시, 수셰프는 곧바로 그 셰프를 위한 다음 몇 가지 재료를 추측하기 시작합니다.
  • 수셰프가 A 셰프를 위해 재료를 추측하는 동안, B 셰프는 A 셰프의 목록을 확인하고 있을 수 있습니다. 동시에 C 셰프는 새로운 추측을 받을 준비가 되어 있을 수도 있습니다. 수셰프는 누군가 항상 추측을 기다리고 있기 때문에 결코 일을 멈추지 않습니다.

2. "유휴 간극(Idle Gaps)" 제거
기존 시스템에서는 헤드 셰프가 목록을 확인하는 데 10초가 걸리면, 수셰프는 10초 동안 아무것도 하지 않고 기다려야 했습니다.
StarSD에서는 수셰프가 기다리지 않습니다. A 셰프가 확인하는 동안, 수셰프는 즉시 B 셰프, 그다음 C 셰프로 눈을 돌립니다. A 셰프가 확인을 마칠 때쯤이면, 수셰프는 이미 B와 C를 위한 추측을 다 적어 놓은 상태가 됩니다. 수셰프는 "작업 보존적(work-conserving)"이 됩니다. 즉, 끊임없이 바쁘게 움직여 주방 전체를 훨씬 더 빠르게 돌아가게 만듭니다.

3. "일대다(One-for-Many)"의 마법
논문은 이를 "One-for-Many"라고 부릅니다. 하나의 드래프트 모델(수셰프)이 여러 개의 타겟 모델(헤드 셰프)을 보좌합니다.

  • 메모리 절약: 모든 헤드 셰프의 주방마다 수셰프를 끼워 넣을 필요가 없습니다. 단 하나의 중앙 수셰프 스테이션만 있으면 됩니다. 이는 더 많은 헤드 셰프가 일할 수 있는 공간을 확보해 줍니다.
  • 속도: 수셰프가 기다림 없이 계속해서 작업하기 때문에, "추측" 과정이 훨씬 더 매끄럽고 빨라집니다.

성능의 두 단계

논문은 이 시스템이 얼마나 바쁜지에 따라 두 가지 방식으로 작동한다고 설명합니다:

  • 단계 1: "저부하(Under-loaded)" 단계 (셰프가 적을 때)
    만약 헤드 셰프가 2명 또는 3명뿐이라면, 셰프들이 주문을 충분히 빨리 외치지 못해 중앙 수셰프가 여전히 조금 기다려야 할 수도 있습니다. 주방은 돌아가고 있지만, 최고 속도는 아닙니다. 셰프를 더 추가하면 이 간극을 채울 수 있습니다.
  • 단계 2: "풀부하(Fully-loaded)" 단계 (셰프가 많을 때)
    헤드 셰프가 충분히 많아지면(논문에서는 테스트 결과 약 4명 이상이라고 제안함), 수셰프는 너무 바빠서 결코 멈추지 않습니다. 주방은 최대 효율로 돌아갑니다. 셰프를 더 많이 추가한다고 해서 수셰프가 더 빨라지지는 않지만(이미 최대치에 도달했으므로), 팀 전체가 제공하는 총 요리의 수는 증가합니다.

주의할 점: "이동 시간(Travel Time)"

헤드 셰프와 수셰프가 다른 방(다른 컴퓨터나 서버)에 있을 수 있으므로, 주문을 외치고 답변을 받는 데 약간의 지연(통신 시간)이 발생합니다.

  • 논문은 이 지연 시간이 작기 때문에, "One-for-Many" 시스템이 통신 시간에도 불구하고 기존의 "One-to-One" 시스템보다 훨씬 빠르다는 것을 발견했습니다.
  • 하지만 셰프를 너무 많이 추가하면, 수셰프와 대화하기 위해 줄을 서서 기다리기 시작합니다. 논문은 수셰프를 계속 바쁘게 유지하면서도 교통 체증에 걸리지 않는 "스윗 스팟(sweet spot)"을 제안합니다.

요약

StarSD는 한 명의 초효율적인 중앙 조수가 전문가 팀 전체를 돕는 것과 같습니다.

  • 기존 방식: 모든 전문가에게 각자의 조수가 있지만, 조리 공간이 부족해지고 조수는 시간의 절반을 놀면서 보냅니다.
  • StarSD 방식: 한 명의 조수가 돌아다니며 모두를 돕습니다. 누군가를 도와야 할 사람이 항상 있기 때문에 조수는 절대 쉬지 않습니다. 이는 공간을 절약하고, 조수를 계속 일하게 만들며, 설령 조수가 책상 사이를 이동해야 하더라도 전체적인 업무량을 늘려줍니다.

이 논문은 실제 컴퓨터 하드웨어(GPU)에서 이 방식이 작동함을 증명하며, "레시피(AI 모델)" 자체를 바꾸지 않고도 어떻게 더 많은 요청을 더 빠르게 처리할 수 있는지 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →