Building Interactive Real-Time Agents with Asynchronous I/O and Speculative Tool Calling
Dit artikel stelt een raamwerk voor dat Asynchrone I/O en Speculatieve Tooloproepen combineert om real-time, laag-latentie interacties met agenten mogelijk te maken met complexe multi-turn tooloproepen, waarbij aanzienlijke snelheidswinst wordt behaald voor zowel cloud- als edge-schaalmodellen terwijl aanvaardbare nauwkeurigheid wordt behouden.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een complexe reeks instructies probeert te geven aan een zeer slimme, maar iets trage assistent. Op de oude manier (de "standaard" methode) zou je moeten wachten tot je je volledige zin hebt uitgesproken voordat de assistent zelfs maar kan beginnen na te denken over wat hij moet doen. Als de assistent vervolgens een telefoonnummer moest opzoeken of een bericht moest sturen, zou hij stoppen met praten, die taak uitvoeren, wachten op het resultaat en dan pas terugkomen om je te vertellen wat er gebeurd is. Dit heen-en-weer creëert veel stilte en wachttijd, waardoor het gesprek onhandig en onnatuurlijk aanvoelt.
Dit artikel introduceert een nieuwe manier voor AI-agenten om te werken die veel meer voelt als een real-time menselijk gesprek. Ze noemen hun methode Asynchrone I/O en Speculatieve Tool-aanroepen. Hier is hoe het werkt met eenvoudige analogieën:
1. De "Multitaskende Chef" (Asynchrone I/O)
Stel je een standaard AI-agent voor als een chef die maar één ding tegelijk kan doen: hij wacht tot je je bestelling hebt uitgesproken, hakkt dan groenten, wacht dan tot het fornuis heet is, en kookt dan pas.
De nieuwe methode verandert de AI in een multitaskende chef.
- Terwijl je nog praat: De chef begint groenten te hakken op basis van de eerste paar woorden die je zegt. Hij wacht niet tot je de zin hebt afgerond.
- Terwijl het fornuis opwarmt: Als de chef moet wachten tot een tool (zoals een database-opzoekactie) klaar is, staat hij niet gewoon naar de muur te staren. Hij gebruikt die wachttijd om de volgende stap te plannen of zelfs de volgende ingrediënt voor te bereiden.
In technische termen betekent dit dat de AI haar denken "ontkoppelt" van jouw spreken. Ze blijft werken terwijl ze wacht op informatie van jou of van de buitenwereld, in plaats van bevriezen.
2. De "Gokker met een Veiligheidsnet" (Speculatieve Tool-aanroepen)
Soms moet de AI een gok wagen. Stel je voor dat je zegt: "Bel Joe..." en de AI weet dat hij iemand moet bellen, maar hij weet nog niet welke Joe.
- De Oude Manier: De AI zou zeggen: "Wacht, welke Joe?" en alles stoppen totdat je verduidelijkt.
- De Nieuwe Manier: De AI doet een speculatieve zet. Hij zegt: "Oké, ik ga 'Joe Smith' opzoeken voor het geval dat." Hij start het proces direct.
Het Veiligheidsnet:
Het artikel maakt een cruciaal onderscheid tussen "veilige" en "onveilige" gissen:
- Veilige Tools (Alleen-lezen): Als de AI alleen een telefoonnummer opzoekt, kan hij dit direct doen. Als je later zegt: "Eigenlijk bedoelde ik Joe Jones", kan de AI gewoon het nummer verwisselen. Er is niets ergs gebeurd.
- Onveilige Tools (Alleen-schrijven): Als de AI op het punt staat een bericht te sturen of een bestand te verwijderen, kan hij niet zomaar gokken. Hij houdt die actie in een "in behandeling"-vakje. Hij bereidt het bericht voor, maar wacht op een definitief "groen licht" (bevestiging dat je klaar bent met spreken) voordat hij daadwerkelijk op "Versturen" drukt.
Als de AI verkeerd gokt en je bedenkt je, kan hij de in behandeling zijnde actie gewoon annuleren voordat deze ooit gebeurt. Dit is als een chef die begint met het hakken van een ui, maar direct stopt als je zegt: "Eigenlijk ben ik vandaag vegetariër", voordat het mes het snijbord raakt.
3. De "Klok-gebaseerde Training"
Om de AI dit te leren, hebben de onderzoekers haar niet zomaar verteld om "sneller" te zijn. Ze bouwden een speciale trainingsgym met een klok.
- In deze gym wordt de AI getraind om te verwachten dat informatie (zoals je stem of het antwoord van een tool) op specifieke, vertraagde momenten arriveert.
- De AI leert om tijdens die vertragingen door te werken.
- Ze creëerden ook nep-"fouten" in de trainingsdata waar de AI te vroeg verkeerd gokte, waardoor hij moest leren hoe hij die fouten later kon herstellen zonder in paniek te raken.
De Resultaten
Het artikel testte dit op twee soorten AI:
- Grote Cloud-modellen: Bij het gebruik van krachtige bestaande AI-API's (zoals die van OpenAI) maakte deze methode ze 1,3 tot 1,7 keer sneller met slechts een kleine daling in nauwkeurigheid.
- Kleine Edge-modellen: Toen ze kleinere AI-modellen (zoals die die op een laptop kunnen draaien) trainden met hun speciale "klok"-methode, werden deze modellen 1,6 tot 2,2 keer sneller terwijl ze een hoge nauwkeurigheid behielden.
Samenvattend: Het artikel laat zien hoe AI-agenten kunnen stoppen met "pauzeren" terwijl ze denken of wachten. Door hen te laten werken terwijl ze wachten, en door hen veilige gissen te laten doen die later gecorrigeerd kunnen worden, kunnen ze in real-time met mensen interageren, waardoor spraakassistenten veel natuurlijker en responsiever aanvoelen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.