← Nieuwste papers
💻 computer science

Benchmarking LLM Tool-Use in the Wild

Dit paper introduceert WildToolBench, een nieuw benchmark dat gebaseerd is op echte gebruikersinteracties en aantoont dat huidige grote taalmodellen nog geen 15% nauwkeurigheid halen bij het gebruik van tools in complexe, 'wilde' scenario's, wat wijst op een aanzienlijke kloof in hun agentic vermogen.

Oorspronkelijke auteurs: Peijie Yu, Wei Liu, Yifan Yang, Jinjian Li, Zelong Zhang, Xiao Feng, Feng Zhang

Gepubliceerd 2026-04-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Peijie Yu, Wei Liu, Yifan Yang, Jinjian Li, Zelong Zhang, Xiao Feng, Feng Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De Kernboodschap: Van "Robot in een Vakje" naar "Agent in de Chaos"

Stel je voor dat je een superintelligente robot hebt die alles kan doen: boeken kopen, weerberichten checken, en vliegtickets boeken. Tot nu toe hebben onderzoekers deze robots getest in een strakke, voorspelbare omgeving. Het was alsof je de robot vroeg: "Ga nu naar stap 1, doe stap 2, en stop." De robot deed dit perfect.

Maar in het echte leven is niemand zo strak. Mensen zijn rommelig, vergeten details, en wisselen van onderwerp alsof ze in een druk café zitten.

Dit paper introduceert WildToolBench. Dit is geen test in een laboratorium, maar een test in de "wildernis". Het meet hoe goed AI-agenten presteren als de gebruiker een echte, onvoorspelbare mens is.


De Drie Grote Uitdagingen (De "Wild" Factoren)

De auteurs ontdekten drie manieren waarop echte mensen AI gebruiken die de huidige tests missen. Laten we ze vergelijken met een chauffeur die door een drukke stad rijdt:

1. Samengestelde Taken (Compositional Tasks)

  • De situatie: Een gebruiker zegt niet: "Check het weer." Maar wel: "Ik wil dit weekend weg. Check het weer in Chicago, maar als het regent, check dan ook Los Angeles en Las Vegas. En vertel me welke stad de beste live-muziek heeft."
  • De analogie: Dit is alsof de chauffeur niet alleen naar een bestemming moet rijden, maar ook onderweg moet beslissen: "Als het regent, neem ik een andere route, en als ik die route neem, moet ik ook nog even een tankstation bezoeken."
  • Het probleem: De AI moet een complex stramien (een boom van beslissingen) maken, niet alleen een rechte lijn. Veel AI's raken hierin de weg kwijt en doen dingen in de verkeerde volgorde of missen stappen.

2. Verborgen Intenties (Hidden Intent)

  • De situatie:
    • Gebruiker: "Check het weer in Parijs."
    • AI: "Het is 20 graden."
    • Gebruiker: "En in Londen?"
    • AI: "Het is 15 graden."
    • Gebruiker: "Wat is er met die ene plek?" (Zonder te zeggen welke plek).
  • De analogie: Je bent aan het praten met een vriend. Als je zegt "Die ene", weet je vriend precies waar je het over hebt omdat jullie net over een specifieke plek hebben gepraat. Maar een AI heeft vaak een kort geheugen. Ze moet raden wat "die ene plek" is op basis van eerdere zinnen.
  • Het probleem: AI's moeten lezen tussen de regels en context uit het verleden halen. In dit paper bleek dat AI's hier heel slecht in zijn, vooral als de verwijzing ver weg ligt in het gesprek.

3. Willekeurige Wisselingen (Instruction Transition)

  • De situatie: Een gesprek ziet er zo uit:
    1. "Boek een hotel." (Taak)
    2. "Oh, wacht, wat is de beste tijd om te reizen?" (Vraag)
    3. "Eigenlijk, vertel me eens een grappig verhaal over Parijs." (Kletsen)
    4. "Oké, nu boek die kamer toch." (Terug naar taak)
  • De analogie: Stel je voor dat je een taxichauffeur hebt. Je vraagt om naar het station te rijden. Dan vraag je plotseling of hij een liedje kan zingen. Dan vraag je of hij sneller kan rijden. Dan wil je weer naar het station.
  • Het probleem: De AI moet constant van "hoofdstand" wisselen: van planner naar klets-machine naar vragensteller. Veel AI's blijven vastzitten in de vorige modus (bijvoorbeeld: ze blijven doorgaan met het boeken van een hotel terwijl de gebruiker juist een grapje wil horen).

Wat zijn de resultaten? (De "Wakker Worden" Moment)

De auteurs hebben 57 verschillende AI-modellen (zoals GPT-4, Claude, Gemini, en vele open-source modellen) getest op deze nieuwe, realistische manier.

  • Het slechte nieuws: Geen enkel model haalde een score van meer dan 15% op het voltooien van een heel gesprek (sessie) zonder fouten.
  • De vergelijking: In de oude, saaie tests (het "laboratorium") haalden deze modellen vaak scores van 60% tot 80%.
  • De conclusie: De AI's lijken slim in een rustige kamer, maar in de "wildernis" van een echt gesprek raken ze volledig in paniek. Ze zijn niet robuust genoeg.

Waarom is dit belangrijk?

Het paper zegt eigenlijk: "We hebben de verkeerde manier van testen."

Het is alsof we een piloot testen op een simulator met alleen rechte lijnen en geen wind, en dan denken dat hij klaar is om een vliegtuig te vliegen tijdens een storm.

De les voor de toekomst:
Om echte "agenten" (AI's die zelfstandig taken doen) te bouwen, moeten we niet alleen zorgen dat ze meer rekenkracht hebben. We moeten ze leren menselijk gedrag te begrijpen:

  • Hoe mensen praten (vaak onduidelijk).
  • Hoe mensen van onderwerp wisselen.
  • Hoe mensen context gebruiken zonder alles te zeggen.

Zonder deze vaardigheden zullen AI's nooit echt betrouwbaar zijn in het echte leven, waar alles rommelig en onvoorspelbaar is.

Kortom: De AI's zijn nog niet klaar voor de echte wereld. Ze moeten nog veel leren over hoe wij, mensen, eigenlijk praten en denken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →