Tackling Fake Forgetting through Uncertainty Quantification
Dit artikel identificeert het fenomeen van "nepvergeten", waarbij de onthullingsnauwkeurigheid gefaalde informatie detecteert die behouden blijft, en stelt een nieuwe metriek (CR) en een raamwerk (CPU) voor op basis van conformale voorspelling om ervoor te zorgen dat het grondwaarheid-label effectief uit de onzekerheidsset van het model wordt verwijderd.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een zeer slimme student voor die een omvangrijk handboek uit zijn hoofd heeft geleerd. Stel nu dat een specifieke pagina in dat handboek een geheim bevat dat voorgoed moet worden gewist (misschien vanwege privacywetgeving). Je vraagt de student om die pagina te "vergeten".
Het probleem: de illusie van "nep-vergeten"
Traditioneel controleren we of de student het heeft vergeten door hem een vraag te stellen over die specifieke pagina. Als hij het antwoord fout heeft, zeggen we: "Geweldig! Hij heeft het vergeten."
Maar dit artikel betoogt dat deze test gebrekkig is. Het is alsof je een student vraagt de hoofdstad van een land te noemen dat hij moest vergeten. Als hij "Parijs" zegt in plaats van "Londen", denken we dat hij het heeft vergeten. Maar wat als hij diep van binnen nog steeds weet dat het Londen is, maar door de vraag in de war is geraakt? Of erger: wat als hij het juiste antwoord nog steeds kan raden als je hem een hint geeft?
De auteurs noemen dit "nep-vergeten". De student lijkt het te hebben vergeten omdat hij de eenvoudige test niet haalde, maar de informatie blijft sluimeren in zijn brein, klaar om te worden opgehaald.
De oplossing: het "Zekerheidsnet"
Om dit nep-vergeten op te sporen, introduceren de auteurs een nieuw instrument dat gebaseerd is op iets dat Conformale Voorspelling heet.
Stel je Conformale Voorspelling voor als een veiligheidsnet of een radenkring. In plaats van de student om één enkel antwoord te vragen, vraag je hem een cirkel te trekken rond alle antwoorden die hij denkt dat misschien goed zijn.
- Als de student het geheim echt heeft vergeten, zou zijn cirkel breed en rommelig moeten zijn, en zou hij het echte antwoord helemaal niet moeten bevatten.
- Als hij het alleen maar "neppeert", zal zijn cirkel nog steeds strak zijn, en zal het echte antwoord zich erin verstoppen, zelfs als hij het niet als zijn beste gok heeft gekozen.
De nieuwe maatstaf: de "Zekerheidsratio" (CR)
De auteurs hebben een nieuwe score ontwikkeld, genaamd CR (Conformal Ratio), om dit te meten.
- Oude score (UA): Controleerde alleen of de student het enkele antwoord fout had. (Makkelijk te neppen).
- Nieuwe score (CR): Controleert of het echte antwoord zich nog steeds verbergt binnen het "veiligheidsnet" van mogelijke antwoorden van de student. Als het echte antwoord nog in het net zit, zegt de score: "Je hebt het nog niet echt vergeten."
Het nieuwe kader: "CPU"
Om het probleem op te lossen, hebben de auteurs een nieuwe trainingsmethode ontwikkeld, genaamd CPU (Conformal Prediction Unlearning).
Stel je voor dat je de student leert vergeten.
- Oude manier: Je zegt gewoon: "Zeg 'Londen' niet."
- CPU-methode: Je zegt: "Zeg niet alleen 'Londen' niet, maar zorg ervoor dat 'Londen' zo ver weg staat van je lijst met mogelijke gissingen dat het volledig buiten je veiligheidsnet valt."
Ze hebben dit bereikt door een techniek uit de cybersecurity (de C&W-aanval) te lenen en aan te passen. In plaats van alleen te proberen het vertrouwen in het verkeerde antwoord te verlagen, duwen ze het juiste antwoord actief uit de voorspellingcirkel.
De resultaten
Toen ze dit testten op taken voor beeldherkenning (zoals het identificeren van foto's van honden of auto's):
- Vonden ze dat veel bestaande methoden inderdaad "nep-vergeten" simuleerden. De modellen zouden de afbeelding verkeerd classificeren, maar het juiste label verbleef nog steeds verborgen in hun voorspellingcirkel.
- Hun nieuwe CR-score slaagde erin deze nepvergeten te vangen.
- Hun nieuwe CPU-kader dwong de modellen daadwerkelijk het juiste antwoord uit de cirkel te duwen, wat resulteerde in veel betrouwbaarder en echt vergeten, zonder het vermogen van het model om andere dingen te herkennen te saboteren.
In het kort
Dit artikel zegt: "Controleer niet alleen of een model het antwoord fout heeft; controleer of het antwoord zich nog steeds verbergt in zijn veiligheidsnet. Als dat zo is, is het niet echt vergeten. We hebben een nieuwe manier ontwikkeld om dit te meten en een nieuwe trainingsmethode om ervoor te zorgen dat de data daadwerkelijk weg is."
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.