← Neueste Arbeiten
💻 computer science

Test of Time: Rethinking Temporal Signal of Benchmark Contamination

Dieser Beitrag stellt die Annahme in Frage, dass ein Leistungsabfall nach dem Stichtag zuverlässig auf eine Kontamination von Benchmarks hindeutet, und zeigt durch die Analyse von LiveCodeBench und Einflussfunktionen, dass dieses zeitliche Signal stark von der Fragestellung abhängt und durch von LLMs generierte Transformationen künstlich herbeigeführt oder beseitigt werden kann.

Ursprüngliche Autoren: Terry Jingchen Zhang, Gopal Dev, Ning Wang, Max Obreiter, Punya Syon Pandey, Keenan Samway, Wenyuan Jiang, Yinya Huang, Bernhard Schölkopf, Mrinmaya Sachan, Zhijing Jin

Veröffentlicht 2026-04-28
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Terry Jingchen Zhang, Gopal Dev, Ning Wang, Max Obreiter, Punya Syon Pandey, Keenan Samway, Wenyuan Jiang, Yinya Huang, Bernhard Schölkopf, Mrinmaya Sachan, Zhijing Jin

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Die große Idee: Der „Frische"-Test ist kaputt

Stellen Sie sich vor, Sie sind ein Lehrer, der herausfinden möchte, ob ein Schüler bei einer Abschlussprüfung betrogen hat. Ein gängiger Trick von Lehrern besteht darin zu prüfen, ob der Schüler bei Fragen aus dem Lehrbuch des letzten Jahres (die er möglicherweise auswendig gelernt hat) besser abschneidet als bei Fragen aus einem brandneuen Buch, das nach dem Ende des Lernzeitraums des Schülers veröffentlicht wurde.

Wenn der Schüler bei den alten Fragen hohe, bei den neuen jedoch niedrige Punkte erzielt, geht der Lehrer davon aus: „Aha! Sie haben das alte Buch auswendig gelernt, verstehen das Material aber tatsächlich nicht." Dieser Punktrückgang wird als „Leistungsabfall nach dem Stichtag" bezeichnet.

Lange Zeit nutzten Forscher diesen „Frische"-Test, um KI-Modelle zu entlarven, die ihre Trainingsdaten heimlich auswendig gelernt hatten (ein Problem, das als Benchmark-Kontamination bekannt ist). Wenn eine KI bei neuen Fragen schlechter abschnitt, galt dies als Beweis für Betrug.

Dieses Paper argumentiert, dass dieser Test unzuverlässig ist. Die Autoren zeigen, dass das Testergebnis vollständig davon abhängt, wie die Fragen formuliert sind, und nicht nur davon, ob die KI die Antworten auswendig gelernt hat.


Das Experiment: „Dasselbe Suppe, verschiedene Schüsseln"

Um ihren Punkt zu beweisen, entwickelten die Forscher ein sehr spezifisches Experiment, bei dem sie dieselben „Zutaten" (Quellenmaterial aus wissenschaftlichen Papers) verwendeten, diese jedoch in zwei verschiedenen „Schüsseln" (Fragetypen) servierten.

1. Schüssel A: „Lückentext"-Fragen (Cloze)

Stellen Sie sich vor, Sie nehmen einen Satz aus einem Lehrbuch und verdecken die wichtigsten Wörter mit schwarzem Klebeband, wobei Sie den Schüler auffordern, die Lücken zu füllen.

  • Beispiel: „Die Hauptstadt von Frankreich ist [______]."
  • Das Ergebnis: Als die KI diese Fragen sah, bestand sie den Frische-Test nicht. Sie erzielte bei alten Fragen hohe und bei neuen niedrige Punkte. Das sah exakt wie Betrug aus. Die KI rief offensichtlich den spezifischen Text ab, den sie zuvor gesehen hatte.

2. Schüssel B: „Von der KI umgeschriebene" Fragen

Stellen Sie sich nun vor, Sie nehmen genau denselben Satz und bitten eine superschlaue KI, ihn in ein brandneues, komplexes Rätsel umzuwandeln, das dieselbe Logik zur Lösung erfordert, aber andere Wörter und eine andere Struktur verwendet.

  • Beispiel: Statt „Die Hauptstadt von Frankreich ist [______]" fragt die KI: „Wenn Sie in die Stadt reisen würden, die für den Eiffelturm und den Louvre bekannt ist, welchen Namen würden Sie in Ihren Reisepass schreiben?"
  • Das Ergebnis: Als die KI diese umgeschriebenen Fragen sah, verschwand der „Frische-Test". Die KI schnitt bei den „neuen" Fragen genauso gut ab wie bei den „alten".

Die schockierende Schlussfolgerung: Obwohl die KI in beiden Fällen exakt dasselbe Quellenmaterial betrachtete, verschwand das „Betrugssignal" (der Punktrückgang bei neuen Fragen) einfach dadurch, dass die Fragen umgeschrieben wurden.

Der „Detektiv"-Beweis: Einflussfunktionen

Um zu verstehen, warum dies geschah, nutzten die Forscher ein „Detektivwerkzeug" namens Einflussfunktionen. Stellen Sie sich dies als eine forensische Lupe vor, die die KI fragt: „Welche spezifische Seite in Ihrer Trainingsbibliothek hat Ihnen geholfen, diese Frage zu beantworten?"

  • Bei den „Lückentext"-Fragen: Die KI wies direkt auf das ursprüngliche Quellpaper hin. Sie sagte: „Ich weiß das, weil ich genau diese Seite gelesen habe." (Hohe Sicherheit bezüglich des Gedächtnisses).
  • Bei den „von der KI umgeschriebenen" Fragen: Die KI hatte Schwierigkeiten, die Quelle zu identifizieren. Es war für die KI viel schwieriger, die Antwort auf die spezifische Seite zurückzuführen, die sie auswendig gelernt hatte.

Dies beweist, dass der Akt des Umschreibens der Frage (selbst durch eine andere KI) die direkte Verbindung zwischen der Frage und dem auswendig gelernten Text unterbricht. Die KI „schlussfolgert" nicht unbedingt besser; sie kann einfach keine exakte Gedächtnisübereinstimmung mehr finden.

Warum das wichtig ist

Das Paper kommt zu dem Schluss, dass wir dem „Frische-Test" (Prüfung, ob die Punkte bei neuen Daten abfallen) nicht als alleinigen Beweis für Betrug vertrauen können.

  • Der alte Glaube: „Wenn die Punkte der KI bei neuen Fragen abfallen, muss sie die alten auswendig gelernt haben."
  • Die neue Realität: „Wenn die Punkte der KI bei neuen Fragen abfallen, liegt das möglicherweise nur daran, dass die neuen Fragen so formuliert waren, dass sie zu stark mit den alten übereinstimmen (wie Lückentexte). Wenn wir die Fragen umschreiben, verschwindet das „Betrugs"-Signal, selbst wenn die KI dasselbe Wissen besitzt."

Die Kernaussage

Die Autoren sagen der KI-Forschungsgemeinschaft: Hören Sie auf, sich auf einen einzigen datumsbasierten Test zu verlassen, um Betrug aufzudecken.

Nur weil eine KI bei einer „neuen" Frage durchfällt, bedeutet das nicht, dass sie unschuldig ist, und nur weil sie bei einer „neuen" Frage besteht, bedeutet das nicht, dass sie schuldig ist. Die Art und Weise, wie Sie die Testfrage formulieren, verändert das Ergebnis mehr als das tatsächliche Gedächtnis der KI. Wir brauchen bessere, robustere Methoden, um zu prüfen, ob KI-Modelle tatsächlich schlussfolgern oder nur auswendig lernen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →