← Nieuwste papers
💬 NLP

Detecting Data Contamination in LLMs via In-Context Learning

Het artikel introduceert CoDeC, een praktische en geautomatiseerde methode die trainingdata-contaminatie in grote taalmodellen detecteert en kwantificeert door te analyseren hoe contextueel leren de modelvertrouwen beïnvloedt, waarbij onderscheid wordt gemaakt tussen uit het trainingsmateriaal onthouden gegevens en ongezette verdelingen.

Oorspronkelijke auteurs: Michał Zawalski, Meriem Boubdir, Klaudia Bałazy, Besmira Nushi, Pablo Ribalta

Gepubliceerd 2026-05-13
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Michał Zawalski, Meriem Boubdir, Klaudia Bałazy, Besmira Nushi, Pablo Ribalta

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een leraar bent die het examen van een leerling nakijkt. Je wilt weten: Heeft deze leerling het materiaal daadwerkelijk geleerd, of heeft hij/zij de antwoorden gewoon uit een gelekte antwoordkey uit het hoofd geleerd?

Lange tijd was het controleren of Large Language Models (LLM's) hebben "gevalst" door hun toetsvragen tijdens het trainen uit het hoofd te leren, vergelijkbaar met het zoeken naar een speld in een hooiberg. Traditionele methoden waren traag, vereisten toegang tot de geheime trainingsbestanden van het model, of gaven verwarrende resultaten.

Dit artikel introduceert een nieuwe, eenvoudige tool genaamd CoDeC (Contamination Detection via Context). Denk aan CoDeC als een "Verrassingstest met een Hint".

De Kernidee: De "Hint"-test

Zo werkt CoDeC, gebruikmakend van een eenvoudige analogie:

1. Het "Ongezien" Scenario (De Eerlijke Leerling)
Stel je voor dat je een leerling een wiskundeprobleem stelt die hij/zij nog nooit heeft gezien.

  • Zonder hint: Hij/zij heeft misschien even moeite.
  • Met een hint: Je toont hem/haar een vergelijkbaar probleem dat hij/zij ook nog nooit heeft gezien. Plotseling krijgt hij/zij een "lampje moment". De hint helpt hem/haar de stijl van de vraag te begrijpen, en hij/zij antwoordt met meer vertrouwen.
  • CoDeC's Observatie: Wanneer een model een dataset ziet die het niet heeft uit het hoofd geleerd, werken voorbeelden uit diezelfde dataset als een nuttige hint. Het model wordt slimmer en krijgt meer vertrouwen.

2. Het "Uit het hoofd geleerde" Scenario (De Valstende Leerling)
Stel je nu voor dat je de leerling een probleem stelt die hij/zij al uit het hoofd heeft geleerd uit een gelekte antwoordkey.

  • Zonder hint: Hij/zij reciteert het antwoord perfect omdat hij/zij het uit het hoofd kent.
  • Met een hint: Je toont hem/haar een ander probleem uit dezelfde gelekte key. In plaats van te helpen, verwart deze nieuwe informatie hem/haar. Waarom? Omdat zijn/haar brein vastzit in de "recitatie-modus". De nieuwe hint verstoort zijn/haar stijve geheugenpatroon, waardoor hij/zij struikelt en antwoordt met minder vertrouwen.
  • CoDeC's Observatie: Wanneer een model de data uit het hoofd heeft geleerd, verlaagt het toevoegen van meer voorbeelden uit diezelfde data eigenlijk zijn/haar vertrouwen, omdat het zijn/haar memorisatie-rhythme verstoort.

Hoe CoDeC dit Meet

De methode is verrassend eenvoudig en geautomatiseerd:

  1. Neem een vraag uit een dataset waarvan je vermoedt dat deze in de trainingsdata van het model zit.
  2. Vraag het model om het te beantwoorden (Meet zijn/haar vertrouwen).
  3. Voeg een "hint" toe: Zet een paar andere willekeurige vragen uit die zelfde dataset direct voor de doelvraag.
  4. Vraag het model opnieuw: Gaat zijn/haar vertrouwen omhoog of omlaag?
    • Vertrouwen gaat OMHOOG? Het model is waarschijnlijk schoon (het leert van de context).
    • Vertrouwen gaat OMLAAG? Het model is waarschijnlijk verontreinigd (het leert uit het hoofd, en de extra context verstoort het).

Door dit te doen voor honderden vragen, geeft CoDeC je een percentage score.

  • 0–20%: Het model is waarschijnlijk eerlijk; het redeneert, niet uit het hoofd lerend.
  • 80–100%: Het model heeft deze dataset waarschijnlijk uit het hoofd geleerd. Het "valst".

Waarom dit een Groot Ding is

  • Geen Geheime Sleutels Nodig: Je hoeft de trainingsbestanden van het model niet te zien (die vaak geheim zijn). Je hoeft alleen maar met het model te praten.
  • Het Werkt Overal: Het werkt op wiskundetoetsen, programmeeruitdagingen en algemene kennisvragen.
  • Het Vangt "Zacht" Valsten: Het vangt niet alleen exacte kopieën. Het vangt modellen die zeer vergelijkbare data hebben gezien (zoals een herschreven versie van een toetsvraag of een synthetische versie van een benchmark). Als het model de "sfeer" van de toets uit het hoofd heeft geleerd, zal CoDeC het vangen.

Wat de Auteurs Vonden

De onderzoekers testten CoDeC op tientallen modellen, waaronder sommige met openbare trainingsdata (zodat ze de waarheid kenden) en sommige met geheime trainingsdata.

  • De Resultaten: CoDeC was ongelooflijk accuraat (99,9% nauwkeurigheid in het onderscheiden van geziene versus ongeziene data).
  • De Baselines: Oudere methoden (zoals controleren hoe "gemakkelijk" het model de vraag vindt) faalden om de valsters te scheiden van de eerlijke leerlingen.
  • Real-World Bevindingen: Toen ze CoDeC toepasten op populaire, recente modellen, vonden ze meerdere gevallen waarin modellen zeer hoog scoorden op specifieke benchmarks, wat suggereert dat die modellen de toetsdata (of zeer vergelijkbare data) waarschijnlijk tijdens hun training hadden gezien.

De Conclusie

CoDeC is als een leugendetector voor AI-benchmarks. Het vraagt niet alleen, "Ken je het antwoord?" Het vraagt, "Helpt het zien van meer van dit onderwerp je, of verward het je?" Als het je verward, wist je het antwoord waarschijnlijk al uit het hoofd. Dit helpt de AI-gemeenschap om benchmark-scores meer te vertrouwen en zorgt ervoor dat modellen worden beoordeeld op hun vermogen om te leren, niet alleen op hun vermogen om uit het hoofd te leren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →