← Nieuwste papers
💻 computer science

AiFlow: Token-Native Reactive Orchestration with Bounded Backpressure for Streaming LLM Applications

Dit artikel introduceert AiFlow, een token-native reactief orchestratieframework dat de verschillen tussen LLM-providers normaliseert naar getypeerde events binnen een gerichte stroomgrafiek, waarbij gebruik wordt gemaakt van Node Guardians om gebonden backpressure en lokale concurrency af te dwingen, waardoor de tijd tot het eerste gedeeltelijke token (time-to-first-partial-token) en de wachtrijdiepte van applicaties aanzienlijk worden verminderd in vergelijking met bestaande aggregatiegebaseerde benaderingen.

Oorspronkelijke auteurs: Qunhui Zhang

Gepubliceerd 2026-08-04
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Qunhui Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een drukke, high-tech keuken runt waar een magische chef (het Large Language Model) een complex gerecht bereidt, woord voor woord. In de oude dagen wachtte het keukenpersoneel tot de chef het volledige maaltijd klaar had voordat ze begonnen met opmaken, proeven of controleren op allergenen. Dit betekende dat de klant een lange tijd moest wachten op de eerste hap. Maar nu serveert de chef het eten terwijl het wordt bereid, één woord tegelijk. Het probleem is dat het keukenpersoneel (de andere onderdelen van de app) niet klaar is voor dit snelle tempo. Sommige personeelsleden zijn super snel, terwijl anderen, zoals degene die controleert op pittige ingrediënten of degene die het eten omzet in spraak, veel langzamer zijn. Als het snelle personeel de borden sneller op het aanrecht blijft stapelen dan het langzame personeel ze kan wegwerken, loopt het aanrecht over, wordt de keuken chaotisch en crasht het hele systeem. Dit is de wereld van "streaming" AI-applicaties, waar het doel is om informatie te verwerken op het moment dat deze arriveert, terwijl de uitdaging erin bestaat om de flow georganiseerd te houden zonder dat de keuken ontploft.

Maak kennis met AiFlow, een nieuw systeem ontworpen om de ultieme keukenmanager te zijn voor deze magische chefs. In plaats van het personeel zelf te laten uitzoeken hoe ze de drukte moeten afhandelen met slordige, ad-hoc regels, zet AiFlow vanaf het begin een strikt, slim lopend band-systeem op. Het behandelt elk woord (of "token") dat de chef uitspuugt als een speciaal, gelabeld pakketje dat over een gerichte baan reist. De paper introduceert een "Node Guardian" voor elke station op de band—een kleine, superstrikte uitsmijter die precies beslist hoeveel pakketjes er kunnen wachten, hoeveel werkers er tegelijkertijd aan de slag kunnen, en wat te doen als de rij te lang wordt (zoals het oudste item laten vallen of de chef pauzeren). De onderzoekers ontdekten dat door dit systeem te gebruiken, de tijd die het duurt voordat het eerste verwerkte woord de klant bereikt, drastisch daalt—met ongeveer 71% tot 95% vergeleken met de oude "wachten tot het einde"-methode. Ze benadrukken echter heel duidelijk dat AiFlow de chef niet sneller laat koken; het zorgt er alleen voor dat de keuken zo soepel draait dat het eten veel sneller aan tafel staat.

Het Probleem: De Keukenchaos

Stel je voor dat je een robotassistent bouwt die met je praat. Wanneer je hem een vraag stelt, geeft hij niet alleen een definitief antwoord; hij "denkt" hardop door woorden één voor één te genereren. In een moderne app wil je misschien verschillende dingen met deze woorden doen terwijl ze verschijnen:

  1. Classificeren: Is dit deel van de redenering van de robot of van het uiteindelijke antwoord?
  2. Filteren: Zit er iets onveiligs in dit woord?
  3. Versturen naar een speaker: Zet de tekst direct om in stem.
  4. Loggen: Sla de redenering op voor later gebruik.

In het verleden moesten ontwikkelaars slordige, aangepaste code schrijven om deze stappen met elkaar te verbinden. Ze moesten handmatig "wachtrijen" (queues) creëren tussen de stappen, beslissen hoeveel werkers ze voor elke stap zouden aannemen, en bedenken wat te doen als de speaker te traag was om het bij te houden. Als ze een fout maakten, groeiden de wachtrijen oneindig groot, wat al het geheugen van de computer opslokte, of raakten de woorden door elkaar. Het was alsoals proberen een chaotische keuken te beheren waar iedereen instructies naar elkaar schreeuwde zonder een centraal plan.

De Oplossing: AiFlow en de "Node Guardian"

De auteur van deze paper heeft AiFlow gecreëerd, een systeem dat deze chaos omzet in een goed georganiseerde assemblageband. Zie AiFlow als een blauwdruk voor een fabriek waar elke machine een specifiek regelboek heeft.

1. Token-Native Orchestration:
In plaats van te wachten tot de hele zin voltooid is, behandelt AiFlow elk woord als een "first-class citizen". Zododien de magische chef een woord genereert, krijgt het een label (zoals "Redenering" of "Antwoord") en wordt het onmiddellijk via het juiste pad gestuurd. Dit betekent dat de "Antwoord"-tak al kan beginnen met werken aan het eerste woord, terwijl de chef nog bezig is met het genereren van het 50ste woord.

2. De Node Guardian:
Dit is de ster van de show. Elk station op de assemblageband heeft een "Node Guardian". Deze guardian is een strikte manager die de door de ontwerper opgelegde regels handhaaft:

  • Queue Bounds: "Er mogen maximaal 8 items wachten in deze rij." Als de rij vol is, stopt de guardian de machine stroomopwaarts met het verzenden van meer items. Dit wordt backpressure genoemd. Het voorkomt dat het systeem crasht door geheugenoverbelasting.
  • Worker Count: "We hebben 3 werkers voor dit station."
  • Overflow Policy: "Als de rij vol is, laat het oudste item dan vallen" of "Stop en wacht."
  • Ordering: "Zorg ervoor dat de woorden in de exacte volgorde naar buiten komen waarin ze zijn gemaakt."

De paper bewijst wiskundig dat als je deze regels instelt, het geheugengebruik van het systeem nooit zal exploderen. Het blijft binnen een veilige, voorspelbare limiet.

Wat ze vonden: De Resultaten

De onderzoekers testten AiFlow met een combinatie van gesimuleerde tests en real-world data van een model genaamd DeepSeek. Ze vergeleken AiFlow met drie andere manieren om de data te verwerken:

  • Aggregate: Wachten op het volledige antwoord voordat er iets gebeurt (de oude, trage manier).
  • Stream Callback: Woorden verwerken terwijl ze binnenkomen, maar zonder strikte regels (de "slordige" manier).
  • LangGraph: Een populaire bestaande tool die streaming afhandelt, maar vertrouwt op ontwikkelaars om handmatig de wachtrijen te beheren.

Dit zijn de cijfers die naar voren kwamen:

  • Snelheid: AiFlow maakte het model niet sneller in het genereren van woorden (de "Model TTFT" bleef in de tests constant op ongeveer 101ms). Echter, het maakte de applicatie veel sneller in het leveren van het eerste verwerkte resultaat. Vergeleken met de "Aggregate"-methode verminderde AiFlow de tijd tot het bereiken van het eerste verwerkte token met 70,9% tot 94,7%. In één test daalde de tijd bijvoorbeeld van meer dan 10 seconden naar slechts 210 milliseconden.
  • Geheugenveiligheid: Dit is de grote winst. Wanneer de "trage" delen van het systeem (zoals het omzetten van tekst naar spraak) het niet bijhielden, lieten de "No Backpressure"-systemen hun wachtrijen groeien tot meer dan 231 items, wat een crash riskeerde. AiFlow, met zijn Node Guardians, hield de rij strikt op 8 items, waardoor geheugenoverloop werd voorkomen.
  • Betrouwbaarheid: Zelfs toen ze testten met echte, onvoorspelbare internetsnelheden en verschillende modellen (zoals Ollama), hield AiFlow het geheugengebruik laag en de snelheid hoog.

Wat dit voor jou betekent

De paper beweert niet dat ze een snellere computerchip of een slimmere AI-hersenen hebben uitgevonden. In plaats daarvan hebben ze het "verkeersopstopping"-probleem opgelost. Ze hebben aangetoond dat door de regels voor de datastroom voordat het programma draait te definiëren (met een eenvoudige taal of een JSON-bestand), ontwikkelaars AI-apps kunnen bouen die sneller, veiliger en gemakkelijker te repareren zijn.

Als je een ontwikkelaar bent, betekent dit dat je niet langer complexe code hoeft te schrijven om wachtrijen en werkers te beheren; je definieert gewoon de regels, en de "Node Guardians" doen de rest. Als je een gebruiker bent, betekent dit dat je AI-chatbot bijna direct kan beginnen met praten tegen je, zijn eigen woorden kan filteren en ze hardop kan uitspreken, zonder dat de app bevriest of zonder geheugen tekort komt wanneer het gesprek lang wordt. Het systeem is ontworpen om robuust te zijn, wat ervoor zorgt dat zelfs als de AI erg praatgraag is en de gebruiker traag leest, de keuken schoon blijft en het eten blijft komen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →