← Nieuwste papers
🤖 machine learning

Proper Dataset Valuation by Pointwise Mutual Information

Dit artikel stelt een informatietheoretisch kader voor om methoden voor datacuratie te evalueren door de kwaliteit van datasets te kwantificeren via de wederzijdse informatie tussen gecureerde en testdata, waardoor de beperkingen van traditionele op testscores gebaseerde metrieken worden overwonnen die overfitting kunnen stimuleren en er niet in slagen de werkelijke informatieve waarde te vatten.

Oorspronkelijke auteurs: Rui Ray Chen, Xuan Qi, Yuxin Chen, Yongchan Kwon, James Zou, Shuran Zheng

Gepubliceerd 2026-09-09
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Rui Ray Chen, Xuan Qi, Yuxin Chen, Yongchan Kwon, James Zou, Shuran Zheng

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In het moderne tijdperk van kunstmatige intelligentie is de kwaliteit van de data die wordt gebruikt om machines te trainen net zo cruciaal geworden als de complexiteit van de machines zelf. Jarenlang was de heersende wijsheid dat meer data beter was, wat leidde tot enorme collecties tekst en afbeeldingen. Echter, naarmate deze systemen groter worden, hebben onderzoekers beseft dat het simpelweg toevoegen van volume niet genoeg is; de data moet worden gecureerd, gefilterd en verfijnd om echt nuttig te zijn. De centrale uitdaging in dit veld is weten welke methoden voor het opschonen en selecteren van data het vermogen van een model om te leren daadwerkelijk verbeteren, en welke methoden het systeem slechts voor de gek houden door het slim te laten lijken op een specifieke test zonder de wereld echt te begrijpen. Dit is een probleem van meting: als u een methode voor dataselectie uitsluitend beoordeelt op basis van hoe goed het resulterende model presteert op een bekende examen, riskeert u strategieën aan te moedigen die de examenvragen memoriseren in plaats van de onderliggende lessen te leren.

Een team van onderzoekers van de Tsinghua Universiteit, Stanford Universiteit en Together AI heeft een nieuwe manier voorgesteld om deze datacuratie-methoden te evalueren, een manier die voorbij de uiteindelijke testscore kijkt om de werkelijke informatie te meten die een dataset biedt. Zij stellen dat een goede dataset een dataset is die de onzekerheid over de ware regels die een taak beheersen vermindert, een concept dat zij formaliseren met een raamwerk dat ervoor zorgt dat meer informatieve data leidt tot betere, beter generaliseerbare modellen. Om dit te doen, hebben zij een methode ontwikkeld om te berekenen hoeveel de gecureerde dataset ons vertelt over een aparte testdataset, gebruikmakend van een wiskundig concept dat bekend staat als wederzijdse informatie (mutual information). Hun werk demonstreert dat traditioneel testen vaak strategieën beloont die de trainingsdata verdacht veel op de testdata laten lijken, een praktijk die de capaciteit van een model kan verslechteren om met nieuwe, ongeziene situaties om te gaan. In contrast hiermee identificeert hun nieuwe scoringsysteem correct wanneer een dataset is beroofd van zijn ware leerwaarde, zelfs als de testscores van het model lijken te verbeteren.

De onderzoekers begonnen met het identificeren van een gebrek in de manier waarop de industrie momenteel de datakwaliteit beoordeelt. De standaardbenadering is om een dataset te nemen, deze te reinigen met een nieuwe techniek, een model erop te trainen en te kijken hoe goed dat model presteert op een benchmarktest. Hoewel dit logisch lijkt, creëert het een gevaarlijke prikkel. Als een datacurator precies weet hoe de test eruitziet, kan hij de trainingsdata perfect aanpassen aan de distributie van de test. Dit kan de score op dat specifieke examen een boost geven, maar het betekent vaak dat het model heeft geleerd de specifieke patronen van de test te herkennen in plaats van de algemene principes van de taak. De onderzoekers noemen dit "strategische" curatie. Het is een vorm van manipulatie van het systeem waarbij de data minder informatief wordt over de ware aard van het probleem, ook al zien de testresultaten er beter uit. Om dit op te lossen, hadden zij een manier nodig om de "informativiteit" van een dataset direct te meten, onafhankelijk van hoe goed een model toevallig scoort op een specifieke set vragen.

Ze wenden zich tot een concept uit de informatietheorie genaamd de Blackwell-ordening, die een rigoureuze manier biedt om te vergelijken hoeveel informatie verschillende datasets bevatten over een onbekende waarheid. In eenvoudige termen: als één dataset u in staat stelt betere beslissingen te nemen over een verborgen waarheid dan een andere, dan wordt deze als informatiever beschouwd. De onderzoekers toonden aan dat als een datacuratiemethode een dataset minder informatief maakt volgens deze ordening, het een strategische methode is die gestraft moet worden. Om deze informativiteit in de praktijk te meten, stelden zij voor om de wederzijdse informatie tussen de gecureerde trainingsdata en de testdata te berekenen. Wederzijdse informatie is een maatstaf voor hoeveel weten over het ene iets vertelt over het andere. Als de trainingsdata en de testdata zeer informatief over elkaar zijn, suggereert dit dat de trainingsdata de ware onderliggende structuur van het probleem vastlegt. Als een curatiemethode deze verbinding vermindert, is het waarschijnlijk dat de werkelijke leerprocessen worden verwijderd.

De uitdaging was dat het berekenen van deze wederzijdse informatie voor grote, complexe datasets berucht moeilijk is. Bestaande methoden werken goed voor kleine, eenvoudige paren datapunten, maar breken ineen wanneer ze worden geconfronteerd met de hoogdimensionale complexiteit van duizenden afbeeldingen of tekstdocumenten. Om dit te overwinnen, bedachten het team een vernieuwende aanpak die de dataset behandelt als een instrument voor het trainen van een machine learning-model. In plaats van te proberen de ruwe datapunten direct te vergelijken, trainden zij een Bayesiaans model — een type model dat de waarschijnlijkheid van verschillende uitkomsten schat — op de trainingsdata en vervolgens op de testdata. Door te analyseren hoe de overtuigingen van het model over de wereld veranderden toen het de trainingsdata zag versus de testdata, konden zij een precieze score afleiden voor hoeveel informatie de trainingsset bood. Deze score, die zij de Pointwise Mutual Information (PMI) score noemen, fungeert als een waarheidsspreker voor datakwaliteit.

De onderzoekers testten hun methode in verschillende realistische scenario's, variërend van beeldclassificatietaken tot de training van grote taalmodellen. In een reeks experimenten creëerden zij datasets waarin de trainingsdata zowel essentiële kenmerken (zoals de vorm van een cijfer) als niet-essentiële kenmerken (zoals de achtergrondkleur) bevatte. Vervolgens pasten zij twee verschillende curatiestrategieën toe: één die foutieve labels verwijderde om de kwaliteit te verbeteren, en een andere die data verwijderde op basis van enkel de niet-essentiële achtergrondkleur om de trainingsset meer op de testset te laten lijken. De resultaten waren treffend. De traditionele testscore-methode gaf een hogere score aan de strategie die data verwijderde op basis van de achtergrondkleur, wat ten onrechte suggereerde dat het een betere aanpak was. In werkelijkheid had deze strategie de capaciteit van de dataset verminderd om het model iets te leren over de werkelijke vormen van de cijfers. De nieuwe PMI-score kende echter correct een lagere score toe aan deze strategische verwijdering, waarbij werd erkend dat het de data van zijn ware leerwaarde had beroofd.

Verdere experimenten met grote taalmodellen bevestigden deze bevindingen. Het team gebruikte datasets die ontworpen waren om te testen hoe goed modellen kunnen generaliseren naar nieuwe, ongeziene soorten vragen. Zij vergeleken drie manieren om trainingsdata te selecteren: één die diversiteit maximaliseerde, één die willekeurig was, en één die zich richtte op zeer gelijkaardige, redundante voorbeelden. De standaard testnauwkeurigheid op de eigen distributie van de trainingsdata bevoordeelde de redundante, laag-diverse selectie en gaf deze de hoogste score. Echter, wanneer deze modellen werden getest op een volledig andere, real-world dataset, presteerde het model dat getraind was op de redundante data het slechtst. De PMI-score daarentegen rangschikte de diverse, hoogwaardige data als de beste, wat perfect overeenkwam met het werkelijke vermogen van het model om te generaliseren. Dit bevestigde dat de nieuwe metriek succesvol onderscheid maakt tussen data die een model echt iets leert en data die het slechts helpt om een specifieke test te memoriseren.

De implicaties van dit werk zijn significant voor de toekomst van kunstmatige intelligentie. Naarmate modellen krachtiger worden, verschuift de flessenhals van rekenkracht naar de kwaliteit van de data die zij consumeren. Als onderzoekers zich blijven richten op testscores om data te cureren, riskeren zij het bouwen van modellen die broos zijn en gevoelig voor falen wanneer zij worden geconfronteerd met het onverwachte. De nieuwe PMI-score-functie biedt een manier om te waarborgen dat datacuratie-inspanningen gericht zijn op echt leren in plaats van op strategische manipulatie. Door een betrouwbare manier te bieden om de werkelijke informatieve waarde van een dataset te meten, helpt deze methode ontwikkelaars bij het bouwen van systemen die niet alleen goed zijn in het behalen van examens, maar die robuust zijn en in staat zijn de complexe, diverse wereld te begrijpen waarvoor zij zijn ontworpen. De studie concludeert dat hoewel traditionele metrieken misleidend kunnen zijn, een informatie-theoretische benadering, geworteld in de relatie tussen trainings- en testdata, een helder en principieel pad biedt voor de evaluatie van de kwaliteit van de data die de moderne intelligentie aandrijft.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →