← Nieuwste papers
💬 NLP

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework

Dit artikel introduceert ArxivRoll, een dynamisch evaluatiekader dat is geïnspireerd op een-time pad-versleuteling en een halfjaarlijks, geautomatiseerd benchmark gebruikt dat is gegenereerd uit recente ArXiv-artikelen om LLM-overestimatie veroorzaakt door datacontaminatie en trainingsbias te kwantificeren en te mitigeren.

Oorspronkelijke auteurs: Zi Liang, Liantong Yu, Shiyu Zhang, Qingqing Ye, Haibo Hu

Gepubliceerd 2026-05-26
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zi Liang, Liantong Yu, Shiyu Zhang, Qingqing Ye, Haibo Hu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Open Boek"-Toets

Stel je voor dat je een leraar bent die probeert te testen hoe slim je leerlingen zijn. Je geeft ze een standaard wiskundetoets. Maar de leerlingen hebben in het geheim de antwoorden op die specifieke toets uit een studiegids onthouden die ze online hebben gevonden.

Wanneer ze de toets maken, halen ze 100% op de vragen die ze hebben onthouden. Maar als je hen een nieuw wiskundeprobleem stelt dat ze nog nooit hebben gezien, kunnen ze falen.

Dit is precies wat er gebeurt met Grote Taalmodellen (LLM's) (zoals de AI waarmee je praat).

  • Het Bedrog: Veel AI-modellen worden getraind op data die de antwoorden bevat op populaire toetsen (benchmarks) die worden gebruikt om hun intelligentie te meten.
  • Het Resultaat: Ze leren of redeneren eigenlijk niet; ze herhalen gewoon antwoorden die ze eerder hebben gezien. Dit maakt dat ze slimmer lijken dan ze echt zijn, wat leidt tot on eerlijke vergelijkingen tussen verschillende AI-bedrijven.

De Oplossing: ArxivRoll (De "One-Time Pad"-Toets)

De onderzoekers van de Hong Kong Polytechnic University hebben een nieuw systeem ontwikkeld dat ArxivRoll heet om deze bedriegers te betrappen. Ze hebben inspiratie geput uit een concept in cryptografie dat de "One-Time Pad" wordt genoemd.

De Analogie: De Wegwerp-Geheime Sleutel
In cryptografie is een "One-Time Pad" een geheime sleutel die wordt gebruikt om een bericht te versleutelen. De regel is: Gebruik de sleutel één keer en gooi hem daarna weg. Als je dezelfde sleutel twee keer gebruikt, is het geheim gecompromitteerd.

ArxivRoll past deze regel toe op toetsen:

  1. Verse Ingrediënten: In plaats van oude, statische toetsvragen te gebruiken, genereren ze elke zes maanden nieuwe toetsen met behulp van gloednieuwe onderzoeksartikelen van ArXiv (een website waar wetenschappers hun nieuwste, nog niet gepubliceerde werk plaatsen).
  2. De "Ongeziene" Toets: Omdat deze artikelen zo nieuw zijn, heeft geen enkele AI ze ooit gezien tijdens hun training. Het is alsof je een leerling een toets geeft die gebaseerd is op een boek dat gisteren pas is gedrukt.
  3. Gebruik en Verwerp: Zodra de toets voorbij is, worden de antwoorden openbaar gemaakt zodat iedereen het werk kan controleren, maar de specifieke toetsvragen worden als "verlopen" gemarkeerd en nooit meer gebruikt. Dit zorgt ervoor dat geen enkele toekomstige AI ze kan onthouden.

Hoe de Toets Werkt: Het "Invulvragen"-Spel

Om deze toetsen automatisch te maken (zonder dat mensen duizenden vragen hoeven te schrijven), gebruiken ze een methode die SCP (Sequencing, Cloze, and Prediction) heet. Denk hierbij aan een geavanceerde versie van "Mad Libs" of een legpuzzel:

  • Sequencing (Volgorde): De AI krijgt een alinea waarbij de zinnen door elkaar zijn geschud als een kaartspel. Het moet ze in de juiste volgorde terugzetten.
  • Cloze (Invullen): De AI krijgt een alinea met enkele ontbrekende zinnen (gemaskeerd). Het moet de juiste zin kiezen om de leegte op te vullen uit een lijst met opties.
  • Prediction (Voorspelling): De AI leest een verhaal en moet raden wat de allerlaatste zin zal zijn, waarbij het kiest uit vier verschillende opties.

Omdat deze vragen willekeurig worden gegenereerd uit verse tekst, kan de AI het patroon niet zomaar "onthouden"; het moet daadwerkelijk de logica begrijpen.

Het Scorebord: "Rugged Scores"

Het paper introduceert een nieuwe manier om deze modellen te scoren, genaamd Rugged Scores (RS). Stel je voor dat je een hardloper beoordeelt:

  • Publieke Score: Hoe snel ze rennen op het parcours waar ze op hebben geoefend (de oude, verontreinigde toetsen).
  • Privé Score: Hoe snel ze rennen op een gloednieuw, onbekend pad (de ArxivRoll-toets).

De Rugged Score meet het verschil tussen deze twee.

  • Lage Rugged Score: De hardloper presteerde vergelijkbaar op beide parcoursen. Ze zijn echt fit.
  • Hoge Rugged Score: De hardloper was supersnel op het oefenparcours maar traag op het nieuwe pad. Dit betekent dat ze "bedrogen" hebben door het oefenparcours uit het hoofd te leren.

Wat Ze Vonden

De onderzoekers testten veel populaire AI-modellen (zoals Llama, Qwen, GPT en Claude) met dit nieuwe systeem.

  1. De "Overbeoordeling" is Echt: Veel modellen die als genieën leken op publieke ranglijsten, vielen aanzienlijk in de rangorde toen ze werden getest op de verse, privé ArxivRoll-toetsen.
  2. Sommige Modellen zijn "Overgetraind": Ze ontdekten dat sommige modellen specifiek waren afgestemd om bepaalde soorten vragen (zoals wiskunde of financiën) te kraken, maar volledig faalden bij andere. Het is als een leerling die alleen voor het geschiedenisexamen heeft gestudeerd maar faalt in het natuurkundedictaat.
  3. Het Verschil is Enorm: Bij sommige modellen was het verschil tussen hun "Publieke Score" en "Privé Score" enorm, wat bewijst dat een groot deel van hun gerapporteerde intelligentie eigenlijk gewoon uit het hoofd leren was.

Samenvatting

Het paper betoogt dat we zijn bedrogen door AI-benchmarks. Door een systeem te gebruiken dat zijn vragen voortdurend ververst met gloednieuwe, ongeziene onderzoeken (ArxivRoll) en het verschil meet tussen oude en nieuwe toetsen (Rugged Scores), kunnen ze zien hoeveel van een AI's "intelligentie" echt is en hoeveel gewoon bedrog is. Het is een manier om ervoor te zorgen dat wanneer we zeggen dat een AI slim is, het ook daadwerkelijk slim is, en niet alleen goed in het onthouden van de toets.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →