← Nieuwste papers
🤖 machine learning

Functional-level Uncertainty Quantification for Calibrated Fine-tuning on LLMs

Het artikel stelt UQ4CT voor, een fine-tuning-framework op basis van een mixture-of-experts dat een kalibratieverlies over functionele ruimte integreert om de Expected Calibration Error aanzienlijk te verminderen en de betrouwbaarheid van PEFT-gebaseerde LLM's te verbeteren onder zowel standaard als verschoven verdelingen.

Oorspronkelijke auteurs: Ruijia Niu, Dongxia Wu, Rose Yu, Yi-An Ma

Gepubliceerd 2026-05-15
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Ruijia Niu, Dongxia Wu, Rose Yu, Yi-An Ma

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante, goed gelezen bibliothecaris hebt (het Large Language Model, of LLM). Deze bibliothecaris heeft bijna alles ter wereld gelezen, maar wanneer je hen een specifieke, lastige vraag stelt, gokken ze soms met 100% zekerheid, zelfs als ze fout zijn. Dit heet overmoed, en het is gevaarlijk omdat gebruikers een fout antwoord kunnen vertrouwen alleen maar omdat de bibliothecaris zeker klinkt.

Het artikel introduceert een nieuwe methode genaamd UQ4CT om dit op te lossen. Denk hierbij aan een manier om de bibliothecaris te leren zeggen: "Ik ben vrij zeker", alleen wanneer ze dat ook echt zijn, en "Ik ben niet zeker", wanneer ze gokken.

Hier is hoe het werkt, opgesplitst met eenvoudige analogieën:

1. Het Probleem: De "Eén-maat-past-voor-alles"-afstemming

Meestal, wanneer we willen dat een bibliothecaris zich specialiseert in een nieuw onderwerp (zoals klimaatwetenschap), "fine-tunen" we hen.

  • De Oude Manier: Stel je voor dat je de bibliothecaris een enkel nieuw paar brillen geeft (genaamd LoRA) om hen te helpen het nieuwe onderwerp beter te zien. Maar als de bibliothecaris niet genoeg oefenboeken (data) heeft, kunnen ze deze brillen opzetten en worden ze te zeker, zelfs als de brillen een beetje wazig zijn. Ze kunnen het onderscheid niet maken tussen "Ik weet dit" en "Ik gok het".
  • Het Probleem: Bestaande methoden proberen de zekerheid van de bibliothecaris te controleren nadat ze de brillen hebben opgezet. Maar het artikel stelt dat we de brillen moeten repareren terwijl de bibliothecaris leert.

2. De Oplossing: Het "Panel van Experts" (Mixture of Experts)

In plaats van de bibliothecaris slechts één paar brillen te geven, geeft UQ4CT hen een panel van 8 verschillende experts (een "Mixture of Experts" of MoE).

  • De Opstelling: Stel je een kamer voor met 8 verschillende specialisten. Wanneer je een vraag stelt, kijkt een "Router" (zoals een slimme receptionist) naar je vraag en beslist welke 2 specialisten het beste geschikt zijn om het te beantwoorden.
  • De Magie: Omdat er meerdere experts zijn, kan het systeem zien of de experts het eens of oneens zijn. Als de Router twee experts kiest die heel verschillende antwoorden geven, weet het systeem dat er onzekerheid is. Als de Router twee experts kiest die perfect met elkaar overeenkomen, weet het systeem dat er zekerheid is.

3. De "Calibratieverlies": De Eerlijkheidstrainer

De grootste innovatie van het artikel is een speciale "trainer" die de Router tijdens het leerproces traint.

  • De Regel van de Trainer: De trainer houdt de experts in de gaten.
    • Als de experts het juiste antwoord kiezen, zegt de trainer tegen de Router: "Goed gedaan! Wees zeer zeker van deze keuze."
    • Als de experts het foute antwoord kiezen, zegt de trainer tegen de Router: "Je was te zeker van jezelf! Je had minder zeker moeten zijn of andere experts moeten kiezen."
  • Het Resultaat: Na verloop van tijd leert de Router zijn "zekerheidsniveau" af te stemmen op het werkelijke "waarheidsniveau". Hij stopt met doen alsof hij een expert is wanneer hij slechts gokt.

4. Waarom Dit Beter Is Dan Andere Methoden

  • Geen Vertraging: Sommige andere methoden proberen de bibliothecaris dezelfde vraag 10 keer te stellen om te zien of ze verschillende antwoorden krijgen (zoals een vriend 10 keer om advies vragen). Dit is traag en duur. UQ4CT doet het werk in één enkele doorgang omdat het "panel van experts" direct in het systeem is ingebouwd.
  • Betere Generalisatie: Het artikel testte dit op vragen over gezond verstand en specifieke gebieden zoals klimaatwetenschap. Zelfs wanneer de bibliothecaris werd gevraagd over onderwerpen die ze nog niet eerder hadden gezien (een "distribution shift"), bleef UQ4CT kalm. Het werd niet overmoedig bij nieuwe, vreemde vragen; het gaf correct aan dat het het niet zeker wist.

De Conclusie

Het artikel beweert dat door deze "Panel van Experts"-benadering te gebruiken en het systeem te trainen om zijn zekerheid af te stemmen op de waarheid tijdens de leerfase, ze de "Verwachte Calibratiefout" (een maatstaf voor hoe verkeerd de zekerheid is) met meer dan 25% hebben verlaagd.

Cruciaal is dat ze dit deden zonder de bibliothecaris trager te maken of minder accuraat in het beantwoorden van vragen. De bibliothecaris krijgt nog steeds de juiste antwoorden, maar is nu veel beter in het weten wanneer ze gelijk hebben en wanneer ze slechts gokken.

Kortom: UQ4CT verandert een zelfverzekerd maar vaak fout AI in een nederig maar accuraat AI dat de grenzen van zijn eigen kennis kent.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →