← Nieuwste papers
💻 computer science

How Many Tools Should an LLM Agent See? A Chance-Corrected Answer

Dit artikel introduceert een op kans gecorrigeerde metriek genaamd Bits-over-Random (BoR) om het aantal hulpmiddelen dat aan LLM-agenten wordt gepresenteerd dynamisch te optimaliseren, en toont via versterkingslering aan dat adaptieve shortlists de nauwkeurigheid en dekking van hulpmiddelselectie aanzienlijk verbeteren ten opzichte van benaderingen met vaste grootte over diverse benchmarks.

Oorspronkelijke auteurs: Vyzantinos Repantis, Ameya Gawde, Harshvardhan Singh, Joey Blackwell II

Gepubliceerd 2026-05-26
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Vyzantinos Repantis, Ameya Gawde, Harshvardhan Singh, Joey Blackwell II

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een chef bent (het AI-agent) die probeert een specifiek gerecht te bereiden (een vraag van een gebruiker beantwoorden). Je hebt een enorme voorraadkast (de tool-registry) met duizenden ingrediënten (tools). Voordat je kunt beginnen met koken, moet een sous-chef (het retrieval-systeem) beslissen welke ingrediënten hij aan je geeft.

De grote vraag die dit artikel stelt is: Hoeveel ingrediënten moet de sous-chef op je aanrecht leggen?

  • Als ze je te veel geven: Je raakt overweldigd, verward en grijpt misschien de verkeerde specerij.
  • Als ze je te weinig geven: Misschien heb je niet het ene specifieke ingrediënt dat je eigenlijk nodig hebt, en lukt het gerecht niet.

De meeste keukens vandaag de dag gebruiken een vaste regel: "Geef de chef altijd precies 5 ingrediënten", ongeacht hoe makkelijk of moeilijk het recept is. Dit artikel stelt dat dit een slecht idee is en stelt een slimmer, zelfaanpassend systeem voor.

Hier is de uitleg van hun oplossing met eenvoudige analogieën:

1. Het probleem met "vaste regels"

Stel je een bibliotheek voor waar je één specifiek boek moet vinden.

  • De vaste regel: De bibliothecaris geeft je altijd een stapel van 5 boeken.
    • Eenvoudige vraag: Je had een boek nodig over "Appels". De bibliothecaris geeft je 5 boeken, en het eerste gaat over Appels. Geweldig! Maar je hebt tijd verspild met het lezen van de andere 4.
    • Moeilijke vraag: Je had een boek nodig over "18e-eeuwse zeldzame schimmels". De bibliothecaris geeft je 5 boeken, maar het juiste boek is het 12e boek in de bibliotheek. Je krijgt 0 juiste boeken.

Het artikel zegt dat we een manier nodig hebben om te meten of de bibliothecaris het goed doet, niet alleen aan de hand van hoeveel boeken ze je geven, maar door hoeveel beter ze zijn dan als ze gewoon willekeurig boeken zouden pakken.

2. De oplossing: "Bits-over-Random" (BoR)

De auteurs introduceren een maatstaf genaamd Bits-over-Random (BoR). Denk hierbij aan een "gelukscore".

  • De willekeurige basislijn: Als de bibliothecaris gewoon blindelings boeken van het plankje pakt, wat zijn dan de kansen dat ze het juiste boek vinden?
  • De BoR-score: Dit meet hoeveel beter de bibliothecaris het doet vergeleken met dat blinde geluk.
    • Als de bibliothecaris je 1 boek geeft en het is het juiste boek, is dat een grote winst (want willekeurige kans zou zelden het juiste boek vinden met slechts 1 poging).
    • Als de bibliothecaris je 100 boeken geeft en het juiste boek zit er tussen, is dat een kleinere winst (want willekeurige kans zou het waarschijnlijk toch hebben gevonden met 100 pogingen).

De magische truc: Het artikel gebruikt deze "gelukscore" als beloning voor een lerende robot (een RL-agent).

  • Als de robot vroegtijdig stopt en de tool vindt, krijgt hij een grote beloning (omdat hij de kansen makkelijk heeft overtroffen).
  • Als de robot blijft doorgaan met het toevoegen van meer tools aan de lijst, krimpt de beloning vanzelf (omdat het vinden van de tool in een enorme stapel minder indrukwekkend is; het is makkelijker om geluk te hebben).

Dit betekent dat de robot leert stoppen met het toevoegen van tools zodra hij zeker is dat hij de juiste heeft, zonder dat een mens hem hoeft te zeggen: "Stop bij 5!"

3. De resultaten: De slimme sous-chef

De onderzoekers hebben deze "Slimme Sous-chef" getest tegen de "Vaste regel" (altijd 5 tools) in drie verschillende testkeukens:

  • De kleine keuken (BFCL - 370 tools):

    • Vaste regel: Toont altijd 50 tools om op zeker te spelen. Het vindt de juiste tool 90,8% van de tijd.
    • Slimme chef: Toont gemiddeld slechts 7 tools. Het vindt de juiste tool nog steeds 90,3% van de tijd.
    • Resultaat: De slimme chef bespaart een enorme hoeveelheid "aanrechtplek" (tokens) met bijna geen verlies aan succes.
  • Het gigantische magazijn (ToolBench - 3.251 tools):

    • Vaste regel: Toont altijd 5 tools. Het vindt de juiste tool 64,7% van de tijd.
    • Slimme chef: Toont gemiddeld ongeveer 4,4 tools. Het vindt de tool 61,9% van de tijd.
    • De draai: Bij de echt moeilijke vragen (waar de juiste tool diep in het magazijn begraven ligt), vindt de vaste regel 0% van hen. De slimme chef, beseffend dat de eerste paar tools niet werken, graaft iets dieper (door 5,7 tools te tonen) en vindt 16,7% van die moeilijke vragen. De vaste regel geeft te vroeg op.

4. Waarom minder meer is (het "rommel"-effect)

Het artikel testte ook wat er gebeurt wanneer de AI daadwerkelijk probeert de tool te kiezen.

  • De bevinding: Wanneer de AI een enorme lijst met tools wordt getoond (zoals 50), raakt hij in de war en kiest hij vaker de verkeerde.
  • De analogie: Als je een vriend vraagt: "Welke van deze 50 foto's is mijn hond?", kan hij verkeerd raden omdat er te veel opties zijn. Als je ze slechts 2 foto's toont, is de kans veel groter dat ze de juiste kiezen.
  • Het bewijs: Wanneer de slimme chef minder tools toonde, koos de AI de juiste tool 93,1% van de tijd. Wanneer hij gedwongen werd om naar 5 tools te kijken (de vaste regel), koos hij slechts 87,1% van de tijd correct.

Samenvatting

Dit artikel bewijst dat we geen "één maat voor iedereen"-nummer nodig hebben voor hoeveel tools er aan een AI moeten worden getoond.

  • Oude manier: "Toon 5 tools." (Te weinig voor moeilijke taken, te veel voor gemakkelijke).
  • Nieuwe manier: Gebruik een "gelukscore" (BoR) om het systeem te leren stoppen met het toevoegen van tools zodra het een goede kans op succes heeft.
  • Voordeel: Het bespaart rekenkracht, vermindert verwarring voor de AI en helpt de AI daadwerkelijk het juiste antwoord te vinden bij moeilijke vragen die vaste regels missen.

De auteurs bouwden een simpele "sonde"-robot om dit idee te testen, geen volledig productiesysteem, maar de resultaten suggereren dat het de AI laten beslissen hoeveel hij moet bekijken veel slimmer is dan hem te dwingen om een vast aantal te bekijken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →