← Nieuwste papers
🤖 machine learning

Rashomon Alignment

Dit artikel introduceert Rashomon Alignment (RA), een nieuwe geometrische maatstaf die de functionele gelijkenis tussen machine learning-modellen beoordeelt over de gehele invoerruimte in plaats van alleen op geobserveerde data, wat een complementair perspectief biedt aan distributionele methoden voor toepassingen zoals modelselectie en interpreteerbaarheid.

Oorspronkelijke auteurs: Moisés Santos, Peter van der Putten, Bernhard Pfahringer, Carlos Soares

Gepubliceerd 2026-07-29
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Moisés Santos, Peter van der Putten, Bernhard Pfahringer, Carlos Soares

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren om katten te herkennen. Je laat het duizenden foto's zien, en het leert snorharen en puntige oren te herkennen. Maar hier komt het lastige deel: twee robots kunnen allebei 90% van de foto's goed hebben, maar ze kunnen op een totaal andere manier "denken". De één kijkt misschien naar de achtergrond, terwijl de ander zich concentreert op de oren. In de wereld van machine learning is dit een enorm belangrijk punt. Als je alleen naar de eindscore (nauwkeurigheid) kijkt, denk je misschien dat twee robots identieke tweelingen zijn, terwijl ze in werkelijkheid vreemden zijn die toevallig toevallig hetzelfde antwoord gaven op de test die je hen gaf. Dit artikel duikt in een specifiek hoekje van de informatica genaamd "modelgelijkenis". Het stelt een simpele maar diepzinnige vraag: Hoe weten we of twee AI-modellen de wereld echt op dezelfde manier zien, of dat het slechts gelukkige toevalligheden zijn? De auteurs willen verder kijken dan alleen het controleren van de testscores en beginnen met het in kaart brengen van de werkelijke "beslissingsgrenzen"—de onzichtbare lijnen die de modellen in hun geest trekken om een categorie van een andere te scheiden.

De auteurs van dit artikel, Moisés Santos en zijn team, stellen een nieuwe manier voor om deze gelijkenis te meten, genaamd Rashomon Alignment. Denk er zo over na: stel je twee cartografen voor die kaarten tekenen van een mysterieus eiland. De ene cartograaf tekent alleen de delen van het eiland waar toeristen meestal komen (de populaire stranden en hotels). De andere tekent het gehele eiland, inclusief de dichte, onverkende jungles en verborgen grotten. Als je alleen naar de toeristische gebieden kijkt, kunnen hun kaarten identiek lijken. Maar als je uitzoomt om het hele eiland te zien, kun je ontdekken dat de ene cartograaf een berg heeft getekend waar de andere een meer heeft getekend.

Het artikel introduceert twee versies van deze kaartcontrole-tool. De eerste is Distributional Rashomon Alignment (dRA). Dit is als de eerste cartograaf; het controleert hoeveel de modellen overeenstemming vertonen over de data die ze daadwerkelijk hebben gezien (de "toeristische plekken"). De tweede, en de ster van het artikel, is Geometric Rashomon Alignment (gRA). Dit is de tweede cartograaf. Deze negeert waar de data zich daadwerkelijk bevindt en vraagt de modellen in plaats daarvan om te raden op een perfect uniform rooster dat de gehele mogelijke ruimte beslaat. Het dwingt de modellen om hun kaarten te laten zien in regio's waar ze nog nooit eerder zijn geweest, wat onthult of hun interne logica werkelijk vergelijkbaar is of slechts een toevalstreffer is van de specifieke data waarop ze zijn getraind.

Om dit te testen, voerde het team een massaal experiment uit met 92 verschillende datasets uit de UCI Machine Learning Repository. Ze zetten twee soorten beslissingsbomen tegenover elkaar: "unpruned" bomen (die ongehinderd wild en complex mogen groeien, vaak door elk klein detail te onthouden) en "pruned" bomen (die zijn bijgeschaafd om eenvoudiger en algemener te zijn). Ze ontdekten dat kijken naar alleen nauwkeurigheid vaak misleidend was. In veel gevallen hadden de twee bomen zeer vergelijkbare scores, maar onthulde de gRA dat ze beslissingen op een totaal andere manier namen over de volledige ruimte.

De resultaten waren oogopenend. De studie toonde aan dat gRA en dRA verschillende, complementaire inzichten bieden. Soms stemden modellen perfect overeen op de data die ze zagen (hoge dRA), maar verschilden ze enorm elders (lage gRA). Dit is een gevaarlijke situatie: het betekent dat de modellen fragiel zijn en rampzalig kunnen falen als de data ook maar een klein beetje verandert. De auteurs ontdekten dat in ongeveer 92 datasets de geometrische uitlijning (gRA) sterk varieerde, verspreid over het volledige bereik van 0 tot 1, terwijl de distributionele uitlijning (dRA) de neiging had om bij hogere waarden te clusteren, wat suggereert dat modellen vaak meer overeenstemming vertonen op de "toeristische plekken" dan op het hele eiland.

Cruciaal is dat het artikel suggereert dat het vertrouwen op alleen nauwkeurigheid of alleen op op data gebaseerde overeenstemming misleidend kan zijn. Zo identificeerden ze bijvoorbeeld gevallen waar twee modellen exact dezelfde nauwkeurigheid hadden maar structureel heel verschillend waren (lage gRA), en gevallen waar ze structureel bijna identiek waren (hoge gRA) maar verschillende nauwkeurigheidsscores hadden omdat de testdata toevallig in een lastig gebied viel. De auteurs concluderen dat Geometric Rashomon Alignment een krachtig nieuw instrument is. Het vervangt de nauwkeurigheid niet, maar voegt een vitale laag van begrip toe, waardoor we kunnen zien of twee modellen werkelijk op één lijn zitten in hun logica of dat ze het op de specifieke data die we toevallig hebben alleen maar veinzen. Dit kan ingenieurs helpen om betere AI-teams (ensembles) te bouwen en te begrijpen waarom een model een fout maakt, en niet alleen dat het een fout heeft gemaakt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →