← Nieuwste papers
💬 NLP

AsymSpec: Context-Asymmetric Speculative Decoding for Agentic LLMs

AsymSpec is een asymmetrisch speculatief decodeerframework dat een lichtgewicht drafter in staat stelt om toegang te krijgen tot de volledige inputcontext, terwijl een grote verifier werkt op een gecomprimeerd beeld, waardoor de balans tussen inferentiesnelheid en nauwkeurigheid voor agentische LLM's effectief wordt bereikt door prestaties die bijna gelijk zijn aan de volledige context te behalen tegen aanzienlijk lagere computekosten.

Oorspronkelijke auteurs: Sheng Liang, Yongyue Zhang, Nathanael Brian, Hang Lv, Hao Wang, Chen Zhang, Yong Liu

Gepubliceerd 2026-08-27
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Sheng Liang, Yongyue Zhang, Nathanael Brian, Hang Lv, Hao Wang, Chen Zhang, Yong Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Moderne kunstmatige intelligentiesystemen treden steeds vaker op als autonome agenten, die in staat zijn om documenten op te halen, softwaretools te gebruiken en meerzaalgesprekken te voeren om complexe problemen op te lossen. Terwijl deze agenten werken, bouwen ze een groeiende geschiedenis van informatie op: zoekresultaten, outputs van tools en eerdere berichten. Om deze systemen snel genoeg te maken voor echt gebruik, comprimeren ingenieurs deze geschiedenis vaak, waarbij lange documenten worden samengevat tot korte zinnen of gedetailleerde afbeeldingen worden weggestreept om tijd te besparen. Echter, deze compressie gaat gepaard met een hoge prijs: de AI verliest de fijnmazige details die nodig zijn voor nauwkeurige redenering, wat le leidt tot een moeilijke keuze tussen snelheid en intelligentie. Een standaardtechniek genaamd speculative decoding, waarbij een klein, snel model raadt wat een groot, traag model zal zeggen, is de standaardoplossing geweest om AI te versnellen. Toch loopt deze traditionele methode tegen een muur aan in agentische omgevingen, omdat zowel de kleine gokker als de grote verifieerder exact dezelfde informatie moet zien. Als de informatie wordt gecomprimeerd om tijd te besparen, verliest de gokker dezelfde cruciale details als de verifieerder, wat betekent dat de snelheidswinst de verloren nauwkeurigheid niet kan herstellen.

Onderzoekers van Huawei Technologies en de University of Science and Technology of China hebben een nieuwe aanpak voorgesteld genaamd ASYMSPEC, die deze impasse doorbreekt door de twee modellen verschillende versies van hetzelfde verhaal te laten zien. In hun systeem werkt het grote, krachtige model dat de uiteindelijke beslissing neemt, alleen op de gecomprimeerde, snelle versie van de input om de latentie laag te houden. Ondertussen leest een veel kleiner, lichtgewicht model de volledige, ongecomprimeerde geschiedenis op de achtergrond. Dit kleine model fungeert als een gids, die precies identificeert welke informatie verloren is gegaan tijdens de compressie en de voorspellingen van het grote model subtiel bijstuurt om die ontbrekende details op te nemen. De onderzoekers ontdekten dat deze asymmetrische opzet het systeem in staat stelt om bijna alle nauwkeurigheid van een analyse met volledige context te behouden, terwijl het opereert op de snelheid van een gecomprimeerde versie. In tests over vier verschillende agentische capaciteiten, waaronder complexe meerstapsvragen en het gebruik van tools, herstelde de methode ongeveer 90 procent van de nauwkeurigheid van de volledige context, terwijl het slechts 20 tot 30 procent van de rekenkracht gebruikte.

De kerninnovatie ligt in de manier waarop de twee modellen communiceren. In plaats van simpelweg de kleine model te laten gokken en te hopen dat het grote model het ermee eens is, vergelijkt het systeem de reactie van het kleine model op de volledige tekst met de reactie op de gecomprimeerde tekst. Het verschil tussen deze twee reacties onthult precies wat de compressie heeft verwijderd. Het systeem gebruikt vervolgens dit specifieke signaal om de output van het grote model aan te passen, waardoor de hiaten effectief worden opgevuld zonder dat het grote model zelf de zware, volledige data hoeft te verwerken. Een slim gatekeeper-mechanisme zorgt ervoor dat deze begeleiding alleen wordt toegepast wanneer dat nodig is, om te voorkomen dat het systeem in de war raakt wanneer de compressie mild is. Deze aanpak werkt zelfs wanneer de input verschillende soorten media omvat; bijvoorbeeld kan een klein model naar een ruwe afbeelding kijken terwijl het grote model alleen een tekstuele beschrijving ziet, waarbij het kleine model het grote model stuurt om de visuele details te begrijpen die het zelf niet kan zien.

De onderzoekers testten deze methode op real-world agenttaken, zoals het beantwoorden van vragen die vereisen dat er door meerdere documenten wordt gezocht, het opvolgen van instructies met meerdere stappen en het gebruiken van softwaretools. Ze vergeleken hun systeem met standaardmethoden die ofwel alles traag verwerken, ofwel alles snel comprimeren. De resultaten toonden aan dat traditionele speculative decoding de door compressie verloren gegane nauwkeurigheid niet kon herstellen; het versnelde simpelweg het verlieslatende proces. In contrast hiermee slaagde de nieuwe asymmetrische methode erin de kloof te overbruggen, waarbij het een prestatie leverde die dicht bij het trage, volledige-context-ideaal lag, maar tegen een fractie van de tijd. Op specifieke benchmarks die lange documenten betreffen, bereikte het systeem snelheidsverbeteringen van 1,3 tot 1,7 keer ten opzichte van de ongecomprimeerde baseline, terwijl het de benodigde rekenkracht terugbracht naar ongeveer een vijfde. De studie suggereert dat deze techniek bijzonder waardevol is wanneer de compressie ernstig is, aangezien het vermogen van het systeem om verloren informatie te herstellen direct schaalt met hoeveel detail er aanvankelijk is weggehaald.

Dit werk demonstreert dat de afruil tussen snelheid en nauwkeurigheid in AI-agenten niet rigide hoeft te zijn. Door te ontkoppelen wat het snelle model ziet van wat het trage model ziet, en door een lichtgewicht gids te gebruiken om cruciale inzichten over te dragen, is het mogelijk om zowel efficiëntie als hoogwaardige redenering te hebben. De bevindingen wijzen erop dat voor taken waarbij de context zwaar is en details gemakkelijk verloren gaan, een klein model dat het volledige plaatje ziet, effectief een groot model kan sturen dat werkt met een samenvatting. Deze aanpak biedt een praktisch pad voor het in productie brengen van geavanceerde AI-agenten, waar latentie en kosten kritieke beperkingen zijn, zonder de betrouwbaarheid op te offeren die nodig is voor complexe besluitvorming.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →