← Neueste Arbeiten
🤖 machine learning

CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes

Dieses Paper stellt CELEUS vor, ein Framework, das E-Prozesse nutzt, um zertifizierbare, jederzeit gültige Konfidenzintervalle für die LLM-Evaluierung bereitzustellen und dabei die Anzahl der erforderlichen Stichproben durch unsicherheitsgesteuerte Stichprobenziehung und surrogate-gestützte Approximationen signifikant zu reduzieren.

Ursprüngliche Autoren: Zhijian Zhou, Zesheng Ye, Zhaorun Chen, Bo Li, Feng Liu

Veröffentlicht 2026-06-23
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Zhijian Zhou, Zesheng Ye, Zhaorun Chen, Bo Li, Feng Liu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie haben ein riesiges Glas mit 100.000 Murmeln. Einige sind rot (das repräsentiert einen Fehler, den die KI gemacht hat), und einige sind blau (das repräsentiert eine korrekte Antwort). Sie möchten den exakten Prozentsatz der roten Murmeln im gesamten Glas wissen, um zu entscheiden, ob die KI gut genug ist, um in der realen Welt eingesetzt zu werden.

Das Problem? Jede einzelne Murmel zu prüfen, ist langsam, teuer und erfordert manchmal einen Menschen, der hinsieht. Wenn Sie einfach nur eine Handvoll nehmen und raten, könnten Sie Glück oder Pech haben, und Sie wüssten nicht, wie nah Ihre Schätzung an der Wahrheit liegt.

Dieses Paper stellt CELEUS vor, eine intelligente, mathematisch garantierte Methode, um diesen Prozentsatz schnell und sicher herauszufinden.

So funktioniert es, unter Verwendung einfacher Analogien:

1. Das Problem: „Stopp und Geh“ vs. „Weiterprüfen“

Traditionell prüft man, um sicher zu sein, vielleicht eine feste Anzahl von Murmeln (sagen wir 1.000) und hört dann auf. Aber was, wenn die ersten 1.000 alle blau waren? Sie würden denken, das Glas sei perfekt, aber Sie könnten einfach nur Glück gehabt haben.

Einige neuere Methoden versuchen, Murmeln nacheinander zu prüfen und aufzuhören, sobald sie „sicher genug“ sind. Die Autoren des Papers argumentieren jedoch, dass diese Methoden einen Fehler haben: Wenn man seinen Fortschritt ständig überprüft und entscheidet aufzuhören, basierend auf dem, was man gerade jetzt sieht, kann man sich versehentlich selbst täuschen und glauben, man sei sich sicherer, als man tatsächlich ist. Es ist wie ein Spieler, der seine Wettstrategie ständig ändert, basierend auf den letzten Gewinnen; irgendwann glaubt er, ein „garantiertes“ System zu haben, aber er ist eigentlich nur glücklich.

CELEUS behebt dies. Es bietet eine „zertifizierbare“ Garantie. Egal wann Sie sich entscheiden aufzuhören, die Mathematik verspricht, dass Ihre Antwort innerhalb eines spezifischen Bereichs der Wahrheit liegt (wie zum Beispiel zu sagen: „Wir sind uns zu 95 % sicher, dass der Anteil der roten Murmeln zwischen 10 % und 12 % liegt“).

2. Das Geheimrezept: Die „Kristallkugel“ (Surrogates)

Eine Murmel zu prüfen ist teuer (wie wenn ein Mensch einen Aufsatz bewertet). CELEUS nutzt einen Trick, um Geld zu sparen.

Stellen Sie sich vor, Sie haben eine Kristallkugel (ein sogenanntes „Surrogate-Modell“). Es ist eine kleinere, günstigere KI, die eine Murmel betrachtet und rät, ob sie rot oder blau ist.

  • Der Haken: Die Kristallkugel ist nicht perfekt. Manchmal rät sie falsch.
  • Die CELEUS-Strategie: Anstatt jede Murmel mit einem teuren Menschen zu prüfen, lässt CELEUS die Kristallkugel zuerst für alle Murmeln raten.
    • Wenn die Kristallkugel sehr selbstbewusst und konsistent ist, vertraut CELEUS ihr und verschwendet keine Zeit damit, diese Murmel mit einem Menschen zu prüfen.
    • Wenn die Kristallkugel verwirrt ist oder ihre Vermutung riskant erscheint, sagt CELEUS: „Hey, ich muss diese hier mit einem Menschen prüfen, um sicher zu sein.“

Dies wird als Surrogate-Assisted Approximation bezeichnet. Es ermöglicht dem System, die teuren Prüfungen bei den „einfachen“ Murmeln zu überspringen und sich nur auf die schwierigen zu konzentrieren.

3. Der „Unsicherheits-Detektiv“ (Sampling)

CELEUS wählt Murmeln nicht einfach zufällig aus. Es agiert wie ein Detektiv, der nach den verwirrendsten Hinweisen sucht.

Es nutzt Uncertainty-Guided Sampling. Wenn die Kristallkugel sagt, eine Murmel sei „Rot“, aber die Mathematik darauf hindeutet, dass sie eigentlich „Blau“ sein könnte (eine große Diskrepanz), priorisiert CELEUS die Prüfung genau dieser speziellen Murmel durch einen Menschen. Es ignoriert die Murmeln, bei denen sich alle einig sind. Das ist wie ein Lehrer, der einen Stapel Tests bewertet: Er verbringt die meiste Zeit mit den Aufsätzen, die schwer zu bewerten sind, und nicht mit denen, die offensichtlich perfekt oder offensichtlich schlecht sind.

4. Das „Magische Kassenbuch“ (E-Prozesse)

Woher weiß CELEUS, dass es nicht geschummelt hat, indem es die Tipps der Kristallkugel beobachtet hat?

Es verwendet ein mathematisches Werkzeug namens E-Process. Denken Sie an dies als ein magisches Kassenbuch oder ein „Fairness-Messgerät“.

  • Jedes Mal, wenn CELEsUS eine Murmel prüft, aktualisiert es das Kassenbuch.
  • Das Kassenbuch ist so konzipiert, dass, wenn das System lügt oder schummelt (indem es zu früh aufhört oder schlechte Vermutungen nutzt), das „Fairness-Messgerät“ eine Pfeife ertönen lässt und eine rote Flagge zeigt.
  • Da das Kassenbuch auf diese Weise aufgebaut ist, kann das System sein Konfidenzintervall kontinuierlich aktualisieren, ohne jemals gegen die Regeln zu verstoßen. Es ist wie ein Richter, der ein Verfahren jederzeit unterbrechen kann, die bisher gesammelten Beweise betrachtet und sagt: „Wir haben genug, um uns zu 95 % sicher zu sein“, ohne dass das Verfahren jemals unfair wird.

Die Ergebnisse: Schneller und Günstiger

Das Paper hat dies an echten KI-Modellen (wie Llama und DeepSeek) unter Verwendung von Standard-Benchmarks (wie Sentiment-Analyse und allgemeine Wissensfragen) getestet.

  • Die Behauptung: CELEUS erreichte das gleiche Maß an Sicherheit wie ältere Methoden, nutzte dafür aber 54 % bis 62 % weniger menschliche Prüfungen.
  • Die Analogie: Wenn eine alte Methode 10.000 Aufsätze von einem Menschen bewerten lassen müsste, um sicher zu sein, benötigte CELEUS nur etwa 4.000, weil es die „Kristallkugel“ für den Rest genutzt hat.
  • Die Garantie: Obwohl weniger Aufsätze geprüft wurden, beweist das Paper mathematisch, dass das Endergebnis vertrauenswürdig ist und nicht „kaputtgeht“, nur weil man früher mit der Prüfung aufgehört hat.

Zusammenfassung

CELEUS ist eine neue Art, KI zu testen, die:

  1. Geld spart, indem sie eine günstige „Kristallkugel“ (Surrogate) nutzt, um Antworten für die meisten Artikel zu erraten.
  2. Die Anstrengung fokussiert, indem sie nur Menschen bittet, die Artikel zu prüfen, bei denen die Kristallkugel verwirrt ist.
  3. Sicherheit garantiert, indem sie ein spezielles mathematisches „Kassenbuch“ (E-Process) verwendet, das sicherstellt, dass die Ergebnisse genau sind, egal wann man mit der Prüfung aufhört.

Es ermöglicht Forschern zu sagen: „Wir sind statistisch sicher, dass diese KI gut ist“, ohne dabei Zeit und Geld damit zu verschwenden, jedes einzelne Beispiel zu prüfen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →