← Nieuwste papers
💻 computer science

Dynamic Mixed-Precision Routing for Efficient Multi-step LLM Interaction

Dit artikel stelt Dynamic Mixed-Precision Routing (DMR) voor, een raamwerk dat op elk beslissingsstap adaptief kiest tussen LLM's met hoge en lage precisie aan de hand van een trainingspijplijn in twee fasen om een optimale afweging tussen nauwkeurigheid en kosten te bereiken bij taken met lange horizon en meerdere stappen.

Oorspronkelijke auteurs: Yuanzhe Li, Jianing Deng, Jingtong Hu, Tianlong Chen, Song Wang, Huanrui Yang

Gepubliceerd 2026-05-15
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yuanzhe Li, Jianing Deng, Jingtong Hu, Tianlong Chen, Song Wang, Huanrui Yang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een team detectives huurt om een complex, meerstaps mysterie op te lossen (zoals het vinden van een specifiek item in een enorme online winkel of het navigeren door een virtueel huis).

In de wereld van Kunstmatige Intelligentie zijn deze "detectives" Large Language Models (LLM's). Om de beste resultaten te behalen, huur je meestal de duurste, hoogopgeleide senior detective (het Hoog-Precisie Model). Ze zijn briljant, maar traag en het kost een fortuin om ze te laten draaien. Als alternatief kun je een team van snelle, goedkope, junior detectives huren (de Laag-Precisie/Gequantiseerde Modellen). Ze zijn snel en goedkoop, maar ze maken soms domme fouten of missen cruciale aanwijzingen.

Het probleem is dat lange, complexe taken veel stappen vereisen. Als je voor elke enkele stap de dure senior detective huurt, zijn de kosten te hoog. Als je voor elke stap de goedkope junior detectives huurt, kunnen ze de zaak falen omdat ze in de lastige delen in de war raken.

Dit paper introduceert een slimme oplossing genaamd Dynamic Mixed-Precision Routing (DMR). Denk hierbij aan een Super-Intelligente Dispatcher die de detectives beheert.

Hoe de Dispatcher Werkt

In plaats van slechts één type detective voor de hele klus te huren, ziet de Dispatcher de onderzoeksvoortgang in real-time en neemt bij elke stap een split-second beslissing:

  1. De Eenvoudige Stappen: Wanneer de taak rechttoe rechtaan is (zoals "kijk naar de deur" of "zoek naar een rood shirt"), stuurt de Dispatcher het werk naar de goedkope, snelle junior detectives. Ze doen het snel en nauwkeurig genoeg.
  2. De Kritieke Stappen: Wanneer de taak een "valstrik" of een complex raadsel bereikt (zoals "bepaal welke sleutel de vergrendelde kist opent" of "onderhandel de uiteindelijke prijs"), schakelt de Dispatcher direct over naar de duurste, senior detective om te zorgen dat het werk goed wordt afgehandeld.

Het doel is om de dure detective alleen te gebruiken wanneer het absoluut noodzakelijk is, waardoor geld en tijd worden bespaard terwijl het mysterie toch succesvol wordt opgelost.

Hoe de Dispatcher Leert

Het paper beschrijft een tweestaps trainingsproces om deze Dispatcher te leren hoe hij de "kritieke stappen" moet herkennen:

  • Stap 1: De "Shadowing"-fase (KL-Divergentie):
    Stel je voor dat de Dispatcher de senior detective en de junior detective naast elkaar aan dezelfde zaak ziet werken. Meestal zijn ze het eens over wat ze moeten doen. Maar af en toe raakt de junior detective in de war en stelt een verkeerde zet voor. De Dispatcher leert deze specifieke momenten te herkennen waarop de twee detectives het oneens zijn. Hij leert: "Ah, zodra de junior detective begint te wankelen, moet ik de senior detective erbij halen."

  • Stap 2: De "Oefenronde"-fase (Versterkend Leren):
    Zodra de Dispatcher de basis onder de knie heeft, gaat hij echte oefenrondes doen. Hij probeert verschillende strategieën: "Wat als ik hier de senior detective erbij haal? Wat als ik wacht?" Hij krijgt een score op basis van twee dingen: Hebben we de zaak opgelost? en Hoeveel tijd/geld hebben we uitgegeven? Na verloop van tijd leert hij de perfecte balans om de meeste zaken op te lossen met de minste kosten.

De Resultaten

De onderzoekers hebben dit systeem getest op twee real-world scenario's:

  1. WebShop: Een agent die probeert een specifiek item online te kopen door te zoeken en te klikken.
  2. ALFWorld: Een agent die probeert een virtuele kamer op te ruimen door objecten op te rapen en neer te zetten.

De bevindingen waren duidelijk:

  • De "Altijd Goedkoop"-aanpak: Snel, maar faalde vaak de taak omdat de junior detectives vastliepen op moeilijke stappen.
  • De "Altijd Duur"-aanpak: Zeer succesvol, maar ongelooflijk traag en duur.
  • De "Dispatcher" (DMR)-aanpak: Het behaalde succespercentages die bijna identiek waren aan die van de dure senior detective, maar deed dit veel sneller en goedkoper. In veel gevallen was het bijna net zo goed als de senior detective, maar gebruikte het de goedkope junior detectives voor ongeveer 60–80% van het werk.

De Conclusie

Dit paper toont aan dat je niet hoeft te kiezen tussen "duur en slim" of "goedkoop en dom". Door een slimme router te gebruiken die dynamisch schakelt tussen de twee op basis van de moeilijkheidsgraad van de huidige stap, kun je het beste van twee werelden krijgen: hoge succespercentages met aanzienlijk lagere kosten. Het is alsof je een team hebt waar het junior personeel het routineuze werk doet, en de expert alleen ingrijpt wanneer de situatie echt lastig wordt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →