← Nieuwste papers
🤖 machine learning

BlendServe: Optimizing Offline Inference for Auto-regressive Large Models with Resource-aware Batching

BlendServe is een systeem dat offline autoregressieve grote modelinferentie optimaliseert door een resource-bewuste prefixboom te introduceren om resource-overlapping en prefix-sharing effectief te combineren, waardoor een doorvoersnelheid van tot liefst 1,44x wordt bereikt ten opzichte van industriestandaarden zoals vLLM en SGLang.

Oorspronkelijke auteurs: Yilong Zhao, Shuo Yang, Kan Zhu, Lianmin Zheng, Baris Kasikci, Yang Zhou, Jiarong Xing, Ion Stoica

Gepubliceerd 2026-06-09
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yilong Zhao, Shuo Yang, Kan Zhu, Lianmin Zheng, Baris Kasikci, Yang Zhou, Jiarong Xing, Ion Stoica

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, razendsnelle fabriek runt die op maat gemaakte robots bouwt (dit zijn de AI-modellen). Jouw taak is om duizenden orders (verzoeken) te verwerken om deze robots te bouwen.

In het verleden moest je, als je robots snel wilde bouwen, kiezen tussen twee soorten orders:

  1. De "Zware Til"-orders: Deze vereisen veel spierkracht (rekenkracht/compute) maar zeer weinig opslagruimte. Denk aan orders voor het bouwen van een robot met een supersterke arm, maar zonder opslagcompartimenten.
  2. De "Zware Opslag"-orders: Deze vereisen zeer weinig spierkracht, maar een enorme hoeveelheid opslagruimte. Denk aan orders voor het bouwen van een robot met een piepkleine arm, maar een gigantisch magazijn van binnen.

Het Probleem: De Flessehals op de Fabrieksvloer

Jouw fabriek heeft twee hoofdhulpmiddelen:

  • Spier-machines (Compute): Deze zijn snel, maar raken uitgeput als ze moeten wachten.
  • Opslagplanken (Geheugen): Deze zijn enorm, maar raken verstopt als ze niet efficiënt worden gebruikt.

De Oude Manier (Naïeve Batching):
Voorheen verwerkten fabrieken orders simpelweg in de volgorde waarin ze binnenkwamen. Als je een rij van 10 "Zware Til"-orders had, werkten je Spier-machines overuren, maar bleven je Opslagplanken leeg en nutteloos staan. Als de volgende 10 orders dan "Zware Opslag"-orders waren, waren je Opslagplanken vol, maar zaten je Spier-machines niks te doen, met de duimen aan het draaien.

Dit is als het proberen te vullen van een vrachtwagen met alleen maar stenen, en dan alleen maar veren. Je kunt niet zoveel als mogelijk meenemen als je ze niet mengt. De vrachtwagen (je computerchip) is de helft van de tijd halfleeg.

Het Nieuwe Probleem:
Er was ook nog een truc die fabrieken gebruikten genaamd "Prefix Sharing" (Prefix Delen). Stel je voor dat veel orders exact dezelfde eerste stap hebben (zoals "Schilder de robot blauw"). Als je deze orders één na elkaar doet, voer je de stap "Schilder blauw" slechts één keer uit en hergebruik je dat resultaat. Dat bespaart enorm veel tijd.

Echter, de "beste" volgorde voor het delen (het samen uitvoeren van alle "Schilder Blauw"-orders) betekende vaak dat je alle "Zware Til"-orders bij elkaar groepeerde en alle "Zware Opslag"-orders bij elkaar. Dit verpest de "meng"-strategie, waardoor je machines weer de helft van de tijd leeg blijven staan.

De Oplossing: BlendServe

De auteurs van dit paper hebben een systeem ontwikkeld genaamd BlendServe. Denk aan een superintelligente fabrieksmanager die de volgorde van het werk kan herorganiseren om het beste van beide werelden te krijgen.

1. De "Resource-Aware" Boom:
In plaats van een simpele lijn, organiseert BlendServe alle orders in een gigantische stamboom.

  • Takken: Groepen orders die dezelfde beginstappen delen (Prefix Sharing).
  • Labels: Elke tak wordt gelabeld met hoeveel "Spierkracht" versus "Opslag" deze nodig heeft.

2. Het "Dual Scanner" Algoritme:
Dit is de magische truc. De manager loopt niet gewoon een rondje langs de lijn. De manager staat op beide kanten van de boom tegelijkertijd:

  • Hij pakt een "Zware Til"-order van de linkerkant.
  • Hij pakt een "Zware Opslag"-order van de rechterkant.
  • Hij stopt ze samen in dezelfde batch.

Het Resultaat:
Nu, wanneer de fabriek draait, werken de Spier-machines hard terwijl de Opslagplanken worden gevuld. Ze helpen elkaar. De vrachtwagen wordt volledig geladen met een perfecte mix van stenen en veren.

Waarom dit ertoe doet

Het paper beweert dat BlendServe, door deze slimme menging terwijl de "gedeelde stappen" toch bij elkaar worden gehouden, kan:

  • De fabriek tot wel 44% versnellen vergeleken met huidige top-systemen (zo zoals vLLM en SGLang).
  • 90% van de theoretisch "perfecte" snelheid bereiken. Stel je voor dat de perfecte snelheid 100 mph is; BlendServe haalt je naar 90 mph, terwijl andere systemen misschien slechts 60 of 70 mph halen.

De Addertjes onder het gras (en hoe ze dit oplosten)

Het paper geeft toe dat het voorspellen van hoe lang een "Zware Opslag"-order precies zal duren lastig is, omdat AI tekst woord voor woord genereert. Om dit op te lossen, doet BlendServe een snelle "proefloop" op een kleine steekproef van de orders om te raden hoe lang ze zullen duren, en gebruikt vervolgens die schattingen om de perfecte mix samen te stellen. Zelfs als de schatting iets afwijkt, is het systeem robuust genoeg om dit on the fly aan te passen.

Kortom: BlendServe is een slimme scheduler die voorkomt dat je computer stilstaat. Het mengt verschillende soorten AI-taken samen, zodat de hersenen en het geheugen van je computer in perfecte harmonie werken, wat offline AI-verwerking veel sneller en goedkoper maakt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →