← Nieuwste papers
📊 statistics

Evaluating the Quality of the Quantified Uncertainty for (Re)Calibration of Data-Driven Regression Models

Deze studie toont aan dat bestaande kalibratiemetrics voor regressiemodellen vaak tegenstrijdige resultaten opleveren, waardoor de selectie van betrouwbare metrics zoals ENCE en CWC cruciaal is voor een eerlijke evaluatie van onzekerheidsschattingen.

Oorspronkelijke auteurs: Jelke Wibbeke, Nico Schönfisch, Sebastian Rohjans, Andreas Rauh

Gepubliceerd 2026-04-23
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jelke Wibbeke, Nico Schönfisch, Sebastian Rohjans, Andreas Rauh

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De Kern: Het Probleem met "Onzekerheid"

Stel je voor dat je een voorspelling doet, bijvoorbeeld: "Morgen wordt het 20 graden."
In de wereld van kunstmatige intelligentie (AI) is het niet genoeg om alleen het getal 20 te noemen. Je moet ook zeggen hoe zeker je bent.

  • Optie A: "Ik ben 100% zeker dat het 20 graden wordt." (Dit is een voorspelling zonder onzekerheid).
  • Optie B: "Ik denk dat het 20 graden wordt, maar het kan ook 18 of 22 zijn." (Dit is een voorspelling met een onzekerheidsmarge).

In gevaarlijke situaties, zoals bij een zelfrijdende auto, is optie B cruciaal. Als de auto een obstakel ziet, moet hij niet alleen weten waar het is, maar ook: "Hoe zeker ben ik dat dit een muur is en niet een schaduw?" Als hij te zeker is (en het is een schaduw), rijdt hij er tegenop. Als hij te onzeker is, remt hij te vaak en blokkeert hij het verkeer.

De kwaliteit van deze "onzekerheidsmarge" noemen onderzoekers calibratie. Een goed gekalibreerd model zegt: "Ik ben 90% zeker," en in 90% van de gevallen klopt het ook echt.

Het Probleem: Teveel Meetlatjes

Het probleem waar dit papier over gaat, is dat er veel verschillende meetlatjes (metrieken) zijn om te controleren of die onzekerheidsmarge wel goed is.

Stel je voor dat je een bakker wilt beoordelen op de kwaliteit van zijn brood.

  • Meetlatje 1: "Hoe zwaar is het brood?"
  • Meetlatje 2: "Hoe knapperig is de korst?"
  • Meetlatje 3: "Hoeveel luchtbelletjes zitten erin?"
  • Meetlatje 4: "Hoeveel calorieën heeft het?"

Als je de bakker beoordeelt, kan het gebeuren dat hij volgens gewicht een 10 haalt, maar volgens korst een 2. De onderzoekers van dit papier hebben gekeken naar alle bestaande meetlatjes voor AI-onzekerheid en ontdekten een groot probleem: Ze geven vaak tegenstrijdige resultaten.

Soms zegt meetlatje A: "Deze AI is perfect gekalibreerd!"
Terwijl meetlatje B zegt: "Deze AI is volkomen onbetrouwbaar!"

Dit is gevaarlijk. Het betekent dat iemand die een AI-model wil verkopen, de "slechte" meetlatjes kan negeren en alleen de "goede" kan laten zien om te bewijzen dat hun model geweldig is. Dit noemen ze cherry-picking (kersen plukken).

Wat hebben de onderzoekers gedaan?

De onderzoekers (Jelke Wibbeke en collega's) hebben een enorme test uitgevoerd. Ze hebben:

  1. Alle bekende meetlatjes verzameld (er waren er 13).
  2. Ze hebben deze getest op echte data (zoals weersvoorspellingen) en op nep-data (waar ze precies wisten hoe het moest zijn).
  3. Ze hebben gekeken of de meetlatjes het met elkaar eens waren.

De conclusie was schokkend: De meetlatjes waren het er vaak niet over eens. Ze bewogen in verschillende richtingen. Wat als "goed" werd gezien door de ene maatstaf, werd als "slecht" gezien door de andere.

De Winnaars: Welke meetlatjes kun je vertrouwen?

Na al die tests hebben de onderzoekers twee "helden" gevonden die het meest betrouwbaar lijken:

  1. ENCE (De "Realiteitstest"):

    • Vergelijking: Stel je voor dat je een wekker instelt. Als je zegt "Ik word wakker om 7 uur", en je wordt om 7 uur wakker, is je wekker goed. Als je zegt "7 uur" maar je wordt om 9 uur wakker, is je wekker slecht.
    • De ENCE kijkt naar de relatie tussen hoe groot de AI denkt dat zijn foutmarge is, en hoe groot de fout echt is. Als de AI zegt "Ik heb een marge van 2 graden", en de temperatuur zit er inderdaad 2 graden naast, is de ENCE blij. Het is een zeer eerlijke, onafhankelijke test.
  2. CWC (De "Breedte-Controle"):

    • Vergelijking: Stel je wilt een vis vangen met een net.
      • Als je een heel klein netje gebruikt, vang je misschien de vis, maar als je net te klein is, loopt hij erdoorheen (te zeker).
      • Als je een gigantisch visnet gebruikt dat de hele oceaan bedekt, vang je de vis altijd, maar dat is niet slim (te onzeker).
    • De CWC kijkt naar twee dingen tegelijk: Zit de vis in het net? (De dekking) én Is het net niet onnodig groot? (De breedte). Het straft modellen die "veilig spelen" door een te groot net te gebruiken.

Wat betekent dit voor de toekomst?

De boodschap van dit papier is duidelijk:

  • Wees sceptisch: Als iemand zegt "Onze AI is perfect gekalibreerd", vraag dan: "Met welke meetlat?"
  • Gebruik de juiste tools: Gebruik bij voorkeur de ENCE of CWC. Deze geven de eerlijkste indruk van hoe betrouwbaar een AI-model is.
  • Pas op met kleine datasets: Als je niet genoeg data hebt (minder dan 500-1000 voorbeelden), zijn al deze meetlatjes onbetrouwbaar. Het is als proberen het weer van een heel land te voorspellen op basis van één dag meting in één stad.

Kortom: In de wereld van AI is het niet genoeg om alleen te kijken of een model de juiste antwoorden geeft. We moeten ook kijken of het model weet hoe zeker het is. En om dat te testen, moeten we stoppen met het willekeurig kiezen van meetlatjes en gaan vertrouwen op de beste, eerlijkste meetinstrumenten die we hebben gevonden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →