← Nieuwste papers
🤖 machine learning

Online Conformal Prediction Beyond Feedback

Dit artikel introduceert Online Conformal Prediction with Queries (OCPQ), een nieuw raamwerk voor onzekerheidskwantificering in niet-i.i.d. datastromen dat opereert zonder directe feedback van uitgerolde voorspellingen door strategisch labels op te vragen, waardoor het sublineaire regret en hoge dekking garandeert terwijl de kosten voor het opvragen van queries worden geminimaliseerd.

Oorspronkelijke auteurs: Joar Skalse, Edoardo Pona, Osvaldo Simeone, Nicola Paoletti

Gepubliceerd 2026-08-10
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Joar Skalse, Edoardo Pona, Osvaldo Simeone, Nicola Paoletti

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren hoe hij door een donker, mistig doolhof moet navigeren. Je wilt dat de robot zelfverzekerd genoeg is om naar voren te bewegen, maar voorzichtig genoeg om geen muren te raken. In de wereld van kunstmatige intelligentie wordt dit "onzekerheidskwantificatie" genoemd. Het is het verschil tussen een robot die zegt: "Ik ben vrij zeker dat dat een muur is," en "Ik heb geen idee, maar ik gok het maar gewoon." Een populaire manier om deze voorzichtigheid aan te leren is "conformal prediction", een methode die niet alleen één antwoord geeft (zoals "dat is een kat"), maar een veiligheidsnet van mogelijke antwoorden biedt (zoals "het is een kat, een hond of een vos") dat wiskundig gegarandeerd de meeste tijd de waarheid bevat.

Normaal gesproken krijgt de robot om hier beter in te worden feedback. De robot doet een gok, en iemand (of een sensor) vertelt het hem: "Ja, dat was juist," of "Nee, dat was fout." De robot gebruikt deze feedback om zijn veiligheidsnet voor de volgende ronde aan te passen. Maar wat als de robot zich in een situatie bevindt waarin hij nooit feedback kan krijgen op zijn gokken? Stel je een beveiligingsbeambte voor die moet beslissen of iemand een dreiging vormt. Als de beambte gokt "Dreiging", kan hij ernaast zitten, maar hij kan de persoon niet vragen: "Was je eigenlijk een dreiging?" want dat zou het doel van de beveiligingscontrole tenietdoen. De beambte krijgt alleen de kans om naar het "echte antwoord" te vragen als hij besluit in te grijpen en versterking op te roepen, maar dat kan hij niet elke keer doen. Dit is het lastige "beyond feedback"-probleem: hoe leer je veilig te zijn wanneer je je werk niet kunt controleren?

Dit artikel introduceert een slimme nieuwe methode genaamd OCPQ (Online Conformal Prediction with Queries) om precies dat puzzelstukje op te lossen. De onderzoekers behandelen het probleem als een spel met hoge inzet waarbij de speler op elke beurt twee keuzes heeft: ofwel een voorspelling doen (en helemaal geen feedback krijgen) ofwel een "query" (opvraag) stellen om het juiste antwoord te zien (maar voor die beurt geen voorspelling krijgen). Het is als het spelen van een videogame waarbij je ofwel een schot lost en hoopt het doel te raken, ofwel het spel pauzeert om op de kaart te kijken, maar je kunt niet beide tegelijk doen.

Het team ontdekte dat door willekeurig te kiezen om "de game te pauzeren en op de kaart te kijken" (query) slechts een heel klein deel van de tijd—specifiek ongeveer één keer per T1/3T^{1/3} rondes, waarbij TT het totaal aantal rondes is—ze nog steeds genoeg kunnen leren om ongelooflijk nauwkeurig te zijn. Ze hebben wiskundig bewezen dat zelfs met deze kleine hoeveelheid "stiekem kijken", de methode garandeert dat het ware antwoord bijna net zo vaak in het veiligheidsnet van de robot zit als de gebruiker wenst (een door de gebruiker gedefinieerde frequentie β\beta). De "kost" van deze strategie is dat het veiligheidsnet iets groter kan zijn dan wanneer de robot perfecte feedback zou hebben, maar het verschil krimpt naarmate het spel vordert.

In hun experimenten hebben de onderzoekers dit getest op echte gegevens, waaronder afbeeldingen van handgeschreven cijfers en tekstprompts voor grote taalmodellen. Ze ontdekten dat zelfs wanneer de gegevens onverwacht veranderden (zoals een robot die getraind is op zonnige dagen en nu door de regen moet navigeren) of wanneer de gegevens opzettelijk lastig waren (adversarial attacks), OCPQ het veiligheidsnet betrouwbaar hield. Ze lieten zien dat gebruikers door één enkele knop genaamd β\beta tegelijk te draaien, konden beslissen hoeveel ze wilden prioriteit geven aan veilig zijn versus precisie. De resultaten suggereren dat je niet constant je werk hoeft te controleren om veilig te zijn; soms is het controleren van af en toe genoeg om het hele systeem eerlijk te houden, zelfs wanneer de wereld probeert je te misleiden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →