← Nieuwste papers
💻 computer science

Uncertainty Quantification for LLM Function-Calling

Dit artikel biedt de eerste evaluatie van methoden voor onzekerheidsmeting (Uncertainty Quantification) bij het aanroepen van functies door LLM's en stelt verbeteringen voor door de specifieke structuur van deze aanroepen te benutten.

Oorspronkelijke auteurs: Zihuiwen Ye, Lukas Aichberger, Michael Kirchhof, Sinead Williamson, Luca Zappella, Yarin Gal, Arno Blaas, Adam Golinski

Gepubliceerd 2026-04-28
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zihuiwen Ye, Lukas Aichberger, Michael Kirchhof, Sinead Williamson, Luca Zappella, Yarin Gal, Arno Blaas, Adam Golinski

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een super-intelligente robotassistent hebt. Je kunt tegen hem zeggen: "Bestel een pizza voor me" of "Maak 50 euro over naar mijn oma." De robot is razendsnel, maar hij is ook een beetje een 'overmoedige beginner'. Soms denkt hij dat hij precies weet wat hij moet doen, terwijl hij eigenlijk een enorme fout maakt. Als hij per ongeluk 500 euro naar een vreemde overmaakt in plaats van naar je oma, is de schade niet te herstellen.

Dit wetenschappelijke artikel gaat over één cruciale vraag: Hoe weten we of de robot écht zeker weet wat hij doet, of dat hij maar wat aan het gokken is?

Hier is de uitleg in begrijpelijke taal:

1. Het probleem: De "Ik-weet-het-zeker"-valstrik

In de wereld van AI noemen we dit Function Calling. De AI gebruikt 'gereedschap' (zoals je bank-app of een database) om taken uit te voeren. Het probleem is dat AI-modellen vaak heel zelfverzekerd klinken, zelfs als ze onzin uitkramen.

De onderzoekers wilden een soort "digitale twijfelmeter" (Uncertainty Quantification) bouwen. Een meter die zegt: "Ho even, ik ben maar voor 40% zeker van deze actie, vraag het even aan een mens voordat je op 'verzend' drukt."

2. De ontdekking: De "Eén-keer-vragen"-methode wint

Er zijn twee manieren om die twijfel te meten:

  • De 'Meerdere-opties'-methode: Je vraagt de robot tien keer achter elkaar hetzelfde. Als hij tien keer een ander antwoord geeft, weet je dat hij twijfelt. Dit is heel nauwkeurig, maar het kost enorm veel tijd en rekenkracht (alsof je een ober tien keer hetzelfde vraagt om zeker te weten dat hij het begrijpt).
  • De 'Eén-keer-kijken'-methode: Je kijkt naar hoe 'twijfelachtig' de robot is bij het kiezen van elk lettertje van zijn antwoord. Dit is supersnel.

De verrassing: De onderzoekers ontdekten dat voor dit specifieke werk (het gebruiken van gereedschap) de snelle methode bijna net zo goed werkt als de trage, dure methode. De robot is bij het maken van een code-opdracht vaak óf heel zeker, óf hij maakt een foutje in een heel specifiek detail. Je hoeft hem dus niet tien keer te ondervragen om te zien of hij het snapt.

3. De oplossing: De "Focus op de belangrijke woorden"-truc

De onderzoekers merkten iets interessants op. Als een robot een opdracht uitvoert, gebruikt hij veel "vulwoorden" (zoals haakjes, komma's en spaties) die hij eigenlijk altijd op dezelfde manier doet. Die woorden zeggen niets over zijn twijfel.

Stel je voor dat je een recept leest: "Pak 2 eieren en meng ze in een kom."
Als de robot twijfelt over het woord "en", zegt dat niets over het recept. Maar als hij twijfelt over het woord "2", dan is dat een groot probleem!

De onderzoekers hebben een slimme truc bedacht: De SMT-methode. Ze hebben de "twijfelmeter" zo geprogrammeerd dat hij de saaie, technische tekentjes negeert en alleen heel goed oplet bij de echt belangrijke woorden (zoals de naam van de functie, het bedrag, of de naam van de persoon).

De conclusie in een notendop

De onderzoekers hebben bewezen dat we AI-robots veiliger kunnen maken zonder dat ze traag worden. Door de robot niet te laten twijfelen over de "grammatica", maar hem alleen te laten focussen op de "inhoud", kunnen we een heel betrouwbare waarschuwingslamp installeren.

Het resultaat? Een assistent die zegt: "Ik denk dat ik weet hoe ik die pizza moet bestellen, maar ik twijfel over de toppings, dus ik vraag het je even voor de zekerheid." Dat is precies de veiligheid die we nodig hebben voor de toekomst.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →