AsyncTool: Evaluating the Asynchronous Function Calling Capability under Multi-Task Scenarios
Het artikel introduceert AsyncTool, een nieuw benchmarkontwerp om de asynchrone tool-aanroepcapaciteiten van op LLM gebaseerde agenten te evalueren in multi-task scenario's met gesimuleerde latentie, waarbij wordt aangetoond dat huidige modellen moeite hebben met temporele coördinatie en efficiëntie bij het verwerken van vertraagde tool-responsen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Idee: Het "Drukke Barista"-Probleem
Stel je voor dat je een meesterbarista (de AI-agent) bent die werkt in een drukke koffiezaak. Je hebt een lijst met bestellingen:
- Bestelling A: Een complexe espresso zetten (duurt 30 seconden).
- Bestelling B: Bonen malen voor een latte (duurt 5 seconden).
- Bestelling C: Het aanrecht afvegen (duurt 2 seconden).
De Oude Manier (Synchroon):
In het verleden keken de meeste tests voor AI-barista's alleen na of ze één drankje perfect konden maken. Als ze Bestelling A startten, stonden ze daar naar de espressomachine te staren en deden ze absoluut niets anders, totdat de 30 seconden voorbij waren. Pas daarna gingen ze naar Bestelling B. Dit is ontzettend inefficiënt.
De Nieuwe Realiteit (Asynchroon):
In de echte wereld sta je niet stil. Terwijl de espresso zet, pakt een slimme barista de bonen voor Bestelling B en veegt hij het aanrecht af voor Bestelling C. Ze schakelen direct terug naar de espresso zodra deze klaar is. Dit heet Asynchrone Tool-aanroep.
Wat is AsyncTool?
De auteurs van dit paper realiseerden zich dat de huidige AI-tests lijken op de "Oude Manier". Ze controleren of een AI tools kan gebruiken (zoals zoeken op het web of code uitvoeren), maar ze doen alsof de tools direct antwoorden geven. In werkelijkheid duurt het even voordat tools reageren.
AsyncTool is een nieuw "examen" dat is ontworpen om te zien of een AI het Drukke Barista-scenario aankan. Het test drie specifieke vaardigheden:
- Wachten: Kan de AI beseffen dat een tool "aan het denken" is en niet zomaar het antwoord raden?
- Schakelen: Kan de AI Taak A pauzeren, overschakelen naar Taak B, en vervolgens onthouden om terug te keren naar Taak A zodra het antwoord binnenkomt?
- Volgen: Kan de AI bijhouden welke tool bij welke taak hoort zonder in de war te raken?
Hoe Ze De Test Bouwden (Het Recept)
Om dit examen te creëren, verzonnen de onderzoekers niet zomaar willekeurige vragen. Ze volgden een zorgvuldig recept:
- Ingrediënten Verzamelen: Ze namen bestaande, hoogwaardige data voor single-taken (zoals "zoek een vlucht") uit andere benchmarks.
- Het Pad Reconstrueren: Ze gebruikten een krachtige AI (Gemini 2.5 Pro) om deze taken te herschrijven, zodat ze duidelijke, stap-voor-stap instructies hadden.
- Menselijke Correctie: Mensen controleerden het werk om ervoor te zorgen dat de stappen daadwerkelijk logisch waren en niet gebroken.
- De "Mix": Ze combineerden deze single-taken in groepen. Soms gaven ze de AI twee vergelijkbare taken (zoals twee vluchtzoekopdrachten), en soms twee heel verschillende taken (zoals een vluchtzoekopdracht en een bestandsbeheerstaak).
- De Vertraging Simuleren: Ze programmeerden de test zo dat wanneer de AI een vraag stelde, de "tool" zou zeggen: "Ik werk eraan, wacht even", voordat het antwoord werd gegeven.
Hoe Ze De AI Beoordeelden
Ze keken niet alleen naar het eindresultaat. Ze beoordeelden de AI op drie niveaus, zoals een leraar een leerling beoordeelt:
- Stap-niveau: Stelde de AI de juiste vraag met de juiste woorden? (Bijvoorbeeld: Spelde het de naam van de tool correct?)
- Sub-taak-niveau: Voltooide het één klein onderdeel van de klus correct? (Bijvoorbeeld: Vond het de vlucht succesvol?)
- Taak-niveau: Voltooide het de hele opdracht, inclusief alle verschillende bestellingen die het moest managen?
Ze voegden ook een speciale "Efficiëntiescore" toe. Deze mat hoe vaak de AI tussen taken schakelde. Een goede score betekent dat de AI vaak genoeg schakelde om efficiënt te zijn, maar niet zo vaak dat het in de war raakte.
Wat Ze Vonden (De Resultaten)
De onderzoekers testten 19 verschillende AI-modellen (zowel grote commerciële modellen zoals GPT-4.1 als open-source modellen). Dit was wat er gebeurde:
- De "Tijd"-Schok: Toen de tools vertraagd waren, presteerde bijna elke AI aanzienlijk slechter. Het was alsof je een toets maakt terwijl iemand je blijft tikken op je schouder.
- De "Hallucinatie"-Valstrik: Veel zwakkere AIs konden niet wachten. Wanneer ze een tool om data vroegen, wachtten ze niet op het antwoord. In plaats daarvan gisten ze het antwoord en gingen ze gewoon door. Dit leidde tot fouten.
- Het "Vergeten"-Probleem: Sommige AIs begonnen Taak A, schakelden over naar Taak B, en vergeten vervolgens volledig dat Taak A bestond. Ze voltooiden Taak B en zeiden: "Klaar!", terwijl Taak A nog steeds wachtte.
- De Winnaars: De beste modellen (zoals GPT-4.1) waren degene die konden juggelen. Ze wisten precies wanneer ze moesten schakelen en wanneer ze moesten wachten. Ze schakelden niet zomaar willekeurig; ze schakelden strategisch.
De Belangrijkste Conclusie
Het paper concludeert dat goed zijn in het gebruik van tools niet alleen gaat over het weten welke tool je moet gebruiken. Het gaat om timing.
Om een echt effectieve AI-agent te zijn in de echte wereld, moet het een goede projectmanager zijn. Het moet weten:
- "Ik wacht op dit resultaat, dus ik doe dit andere ding terwijl ik wacht."
- "Oh, het resultaat is terug! Ik moet stoppen met wat ik doe en die eerste taak afmaken."
Het paper betoogt dat toekomstige AI-systemen beter moeten worden in deze "temporale coördinatie" (het managen van tijd en wachten) om echt nuttig te zijn in complexe, multi-task omgevingen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.