← Nieuwste papers
💬 NLP

Scaling Enterprise Agent Routing: Degradation, Diagnosis, and Recovery

Dit artikel onderzoekt hoe de routeringsnauwkeurigheid in enterprise LLM-assistenten afneemt wanneer de toolcatalogi schalen van 10 naar 110 agenten, waarbij het identificeren van retrieval- en verwarringskloven als primaire oorzaken van falen en het aantonen dat op embeddings gebaseerde shortlist-methoden effectief een aanzienlijk deel van de F1-prestaties herstellen over meerdere frontiermodellen.

Oorspronkelijke auteurs: Kellen Gillespie, Robyn Perry

Gepubliceerd 2026-06-17
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Kellen Gillespie, Robyn Perry

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je de manager bent van een enorm, druk kantoor. Je hebt een team van 110 gespecialiseerde werknemers (agenten) en 584 specifieke vaardigheden (tools) die ze kunnen gebruiken. Jouw taak is om een verzoek van een klant te ontvangen (zoals "Ik moet een e-mail sturen") en direct de juiste werknemer uit te kiezen om het af te handelen.

Dit papier is een rapport over wat er gebeurt als dat kantoor te groot wordt, en hoe de manager (een AI) fouten begint te maken.

Hier is de uitsplitsing van hun bevindingen met behulp van eenvoudige analogieën:

1. Het Probleem: De "Te Veel Keuzes" Valstrik

Toen het kantoor klein was (bijvoorbeeld 10 werknemers), was de manager erg goed in het kiezen van de juiste persoon. Maar naarmate ze meer mensen toevoegden, raakte de manager in de war.

  • De Analogie: Stel je voor dat je een specifieke naald in een hooiberg probeert te vinden. Wanneer de hooiberg klein is, is dat makkelijk. Wanneer de hooiberg groeit tot de omvang van een berg, begin je naalden te missen die je eigenlijk had moeten vinden.
  • Het Resultaat: Naarmate de catalogus van tools groeide van 10 naar 110, daalde het vermogen van de AI om de juiste tool te vinden aanzienlijk (met ongeveer 16–23%). Het was niet zo dat de AI vaker de verkeerde tools begon te kiezen; het was dat de AI de juiste tools volledig begon te missen.

2. Waarom het faalde: Twee soorten fouten

De onderzoekers deelden de mislukking op in twee duidelijke problemen, zoals twee verschillende redenen waarom een detective een zaak niet zou kunnen oplossen:

  • De "Retrieval Gap" (Het Bibliothecaris-probleem): De AI kon de juiste tool niet eens zien in de lijst. Het was alsof een bibliothecaris het boek in de kast niet kon vinden omdat de bibliotheek te groot en rommelig was. Dit is het deel dat de onderzoekers konden oplossen.
  • De "Confusion Gap" (Het Tweeling-probleem): Zelfs als de AI de juiste tool wél zag, raakte het nog steeds in de war. Waarom? Omdat het kantoor veel "tweelingen" heeft.
    • Voorbeeld: Je hebt Gmail, Outlook en Yahoo Mail. Je hebt "Verbeteren", "Parafraseren" en "Controleren" tools. Ze doen bijna allemaal hetzelfde. Zelfs met een perfecte lijst, worstelde de AI om te beslissen welke "tweeling" de beste match was. Deze verwarring veroorzaakte een permanente daling in de prestaties die niet kon worden opgelost door de tools simpelweg beter te vermelden.

3. De Oplossing: De "Shortlist" Filter

De onderzoekers testten een eenvoudige oplossing: Laat de AI niet de hele lijst van 584 tools zien. Gebruik in plaats daarvan een snelle filter (zoals een slimme zoekbalk) om eerst de 20 meest waarschijnlijke kandidaten te vinden, en vraag de AI daarna om de winnaar te kiezen uit die kleine groep.

  • De Analogie: In plaats van een rechter te vragen om een winnaar te kiezen uit 584 deelnemers, laat je eerst een scout de top 20 kiezen. Daarna kiest de rechter de winnaar uit alleen die 20.
  • Het Resultaat: Deze "Shortlisting"-methode werkte als magie. Het herstelde ongeveer 10–17% van de verloren prestaties. Het loste het "Tweeling-probleem" (verwarring) niet op, maar het loste het "Bibliothecaris-probleem" (het missen van de juiste tool) volledig op.

4. Wat niet werkte (en wat wel)

Het team probeerde verschillende manieren om deze "scout" (de filter) te bouwen:

  • De Winnaar: Het gebruik van Embeddings (een type AI dat de betekenis van woorden begrijpt, niet alleen de spelling). Dit was de beste methode. Het begreep dat "een bericht sturen" en "het team mailen" vergelijkbaar zijn, zelfs als de woorden verschillend zijn.
  • De Verliezer: Keyword Search (zoeken naar exacte woordovereenkomsten). Dit faalde jammerlijk omdat iedereen in een groot kantoor dezelfde woorden gebruikt (zoals "e-mail" of "planning"), dus hielp het zoeken naar die woorden niet om de verschillende tools te onderscheiden.
  • De "Pack" Aanpak: Het groeperen van tools in categorieën (zoals "E-mail Tools" versus "Schrijftools") en eerst een categorie kiezen, werkte niet zo goed als het direct kiezen van individuele tools.

5. Testen in de echte wereld

De onderzoekers gebruikten niet alleen door computers gegenereerde testvragen. Ze testten dit ook op 1.435 echte verzoeken van werkelijke gebruikers.

  • Echte gebruikers zijn rommelig: ze spellen woorden verkeerd, gebruiken straattaal en zeggen niet precies wat ze bedoelen.
  • De resultaten hielden stand: Zelfs met rommelige echte gegevens verbeterde de "Shortlist"-methode de prestaties nog steeds aanzienlijk, wat bewijst dat dit geen laboratoriumtruc is—het werkt in de echte wereld.

De Kern van de zaak

Wanneer je een AI-systeem opschaalt met te veel tools, raakt het overweldigd en begint het de juiste antwoorden te missen.

  • De Fix: Laat de AI niet alles tegelijk bekijken. Gebruik een slimme filter om het eerst terug te brengen naar een shortlist van 20 opties.
  • De Limiet: Zelfs met een shortlist zal de AI in de war raken door tools die zeer vergelijkbare functies hebben (zoals verschillende e-mailapps). Dat deel is moeilijker op te lossen, maar de "Shortlist"-methode lost het grootste deel van het probleem op.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →