← Nieuwste papers
📊 statistics

Conformal Selective Prediction with General Risk Control

Dit paper introduceert SCoRE, een nieuw raamwerk dat conformale inferentie en e-waarden combineert om voor elke getrainde AI-model en elke gedefinieerde risicomaatstaf strikte, eindige-steekproef foutcontrole te garanderen bij selectieve voorspelling, zelfs onder distributieveranderingen.

Oorspronkelijke auteurs: Tian Bai, Ying Jin

Gepubliceerd 2026-03-27
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Tian Bai, Ying Jin

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

SCoRE: De Slimme "Twijfel-Check" voor AI

Stel je voor dat je een zeer slimme, maar soms onzekere assistent hebt. Deze assistent (de AI) kan je helpen bij het vinden van nieuwe medicijnen, het voorspellen van ziektes of het schrijven van medische rapporten. Maar er is een probleem: soms is de assistent niet zeker van zijn antwoord. Als hij toch een fout maakt, kan dat duur of zelfs gevaarlijk zijn.

Vroeger hadden we twee opties:

  1. Alles doen: De AI doet het werk, maar we hopen maar dat hij niet te vaak fouten maakt.
  2. Alles stoppen: We vertrouwen de AI nergens op en doen alles zelf.

Dit nieuwe onderzoek, genaamd SCoRE, introduceert een derde, slimme optie: Selectief Vertrouwen. Het is alsof je een slimme filter hebt die zegt: "Ik vertrouw deze specifieke voorspelling, want ik ben er zeker van. Maar bij die andere? Dan zeg ik: 'Nee, ik ga dit niet doen, te riskant'."

Hier is hoe het werkt, vertaald in alledaagse termen:

1. Het Probleem: De "Gok" in de Ziekenzaal

Stel je een dokter voor die een AI gebruikt om te voorspellen hoe lang een patiënt in het ziekenhuis moet blijven.

  • Als de AI zegt: "Deze patiënt blijft 3 dagen," en dat klopt, is dat geweldig.
  • Maar als de AI zegt: "Deze patiënt blijft 3 dagen," terwijl hij eigenlijk 3 weken moet blijven, is dat een ramp voor de planning.

De AI maakt soms fouten. De kunst is om te weten wanneer je de AI mag vertrouwen en wanneer je moet zeggen: "Ik twijfel, ik ga dit niet gebruiken."

2. De Oplossing: Een "Risico-Compass"

SCoRE is als een super-nauwkeurig kompas dat voor elke nieuwe situatie een risico-score berekent.

  • De Score: De AI kijkt naar de data en zegt: "Ik denk dat het risico op een fout hier laag is."
  • De Beslissing: Als de score laag genoeg is, zegt SCoRE: "JA, gebruik de AI!" Als de score te hoog is (te veel twijfel), zegt hij: "NEE, wacht even, doe het niet."

Het mooie is: SCoRE garandeert dat als je de AI wel gebruikt, het gemiddelde aantal fouten nooit boven een bepaalde grens komt. Het is alsof je zegt: "Ik mag 5% fouten maken, maar alleen als ik zeker weet dat ik niet meer dan dat doe."

3. Twee Manieren om te Kijken (MDR en SDR)

De auteurs van het paper beschrijven twee manieren om dit risico te meten, afhankelijk van wat je belangrijk vindt:

  • De "Totaal-Budget" Methode (MDR):
    Stel je hebt een budget van €100 voor fouten. Je wilt niet dat je totaal meer dan €100 aan fouten maakt, ongeacht hoeveel keer je de AI gebruikt.

    • Voorbeeld: In een ziekenhuis wil je misschien weten: "Hoeveel extra kosten veroorzaken al onze AI-fouten samen?" Als het totaal onder de limiet blijft, is het goed.
  • De "Gemiddelde Kwaliteit" Methode (SDR):
    Hierbij kijkt je naar de gemiddelde kwaliteit van elke keer dat je de AI gebruikt. Je wilt dat elke keer dat je de AI inschakelt, de kans op een fout klein is.

    • Voorbeeld: Bij het zoeken naar nieuwe medicijnen wil je niet dat je 100 keer een fout maakt, maar dat je gemiddeld per geselecteerd medicijn maar heel weinig tijd en geld verspil aan slechte kandidaten.

4. Hoe werkt de "Magie" eigenlijk? (De E-Waarden)

De wetenschappers gebruiken een wiskundig trucje genaamd "E-waarden".

  • De Analogie: Stel je voor dat je een dobbelsteen gooit. Een "E-waarde" is als een slimme weddenschap. Als de AI een goede voorspelling doet, is de "E-waarde" hoog. Als de AI een slechte voorspelling doet, is de "E-waarde" laag.
  • De Regel: SCoRE gebruikt deze E-waarden om te checken of de AI eerlijk speelt. Het is alsof je een onafhankelijke rechter hebt die zegt: "Ik heb gekeken naar de data van de afgelopen tijd. Als je nu deze AI-voorspelling accepteert, is de kans dat je een fout maakt klein genoeg om te mogen."

Het slimme aan SCoRE is dat het geen aannames hoeft te maken over hoe de AI precies werkt. Het maakt niet uit of de AI een ingewikkeld neurale netwerk is of een simpele formule; SCoRE werkt voor allemaal.

5. Waarvoor is dit goed? (Voorbeelden uit de echte wereld)

De paper toont aan dat dit werkt in drie belangrijke gebieden:

  1. Medicijnen Ontwikkelen:
    Chemici gebruiken AI om duizenden moleculen te testen. Veel daarvan zijn nutteloos. SCoRE helpt hen om alleen die moleculen te testen die waarschijnlijk werken. Dit bespaart miljoenen aan kosten voor het testen van "verkeerde" medicijnen.

  2. Ziekenhuisplanning:
    Als een AI voorspelt hoe lang een patiënt in de intensive care moet blijven, wil het ziekenhuis zeker weten dat dit klopt. SCoRE zorgt ervoor dat ze alleen op de AI vertrouwen als de voorspelling zeer betrouwbaar is, zodat ze niet per ongeluk te weinig of te veel bedden reserveren.

  3. AI die Medische Rapporten Schrijft:
    AI kan nu röntgenfoto's bekijken en verslagen schrijven. Maar als de AI een tumor mist, is dat gevaarlijk. SCoRE helpt om alleen die rapporten te gebruiken die de AI met hoge zekerheid heeft geschreven. Bij twijfel schrijft de AI: "Ik weet het niet zeker, vraag een menselijke arts."

Conclusie

SCoRE is een veiligheidsnet voor AI. Het zorgt ervoor dat we AI kunnen gebruiken om sneller en slimmer te werken, zonder bang te hoeven zijn voor grote fouten. Het geeft ons de vrijheid om te zeggen: "Ik vertrouw je op dit punt, maar niet op dat punt."

Het is de sleutel tot betrouwbare AI: niet perfect, maar precies goed genoeg om veilig te gebruiken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →