← Neueste Arbeiten
📊 statistics

LLM Evaluation as Tensor Completion: Low Rank Structure and Semiparametric Efficiency

Diese Arbeit etabliert ein semiparametrisches Inferenzframework für die Low-Rank-Tensor-Vervollständigung in der LLM-Evaluierung, leitet Effizienzgrenzen her und führt eine Score-Whitening-Methode ein, um eine asymptotisch normale, unsicherheitsquantifizierte Schätzung der Modellfähigkeiten aus verrauschten, spärlichen paarweisen Vergleichen zu ermöglichen.

Ursprüngliche Autoren: Jiachun Li, David Simchi-Levi, Will Wei Sun

Veröffentlicht 2026-09-04
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Jiachun Li, David Simchi-Levi, Will Wei Sun

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In der sich rasant entwickelnden Welt der künstlichen Intelligenz ist eine neue Art statistischer Herausforderung entstanden. Da große Sprachmodelle immer leistungsfähiger werden, geht es nicht mehr nur darum, sie zu bauen, sondern genau zu wissen, wie gut sie tatsächlich sind. Um dies zu beantworten, haben Plattformen eine Methode entwickelt, die widerspiegelt, wie Menschen lernen: Menschen bitten, zwei Antworten nebeneinander zu vergleichen und für die bessere zu stimmen. Dieser Prozess erzeugt einen massiven Strom an Daten, aber dieser ist unordentlich. Einige Modelle werden tausendfach verglichen, während andere selten zu sehen sind. Manche Fragen werden ständig gestellt, während andere ignoriert werden. Das Ergebnis ist eine Bestenliste, die wie ein klares Ranking aussieht, aber tatsächlich auf einem Fundament aus ungleichmäßigen, verrauschten und unvollständigen Informationen aufgebaut ist. Ohrem eine Möglichkeit zu haben, die Unsicherheit in diesen Rankings zu messen, ist es schwierig zu wissen, ob ein Modell wirklich besser geworden ist oder ob das Ergebnis nur ein Zufallsprodukt der Daten ist.

Forscher des MIT und der Purdue University haben dieses Problem angegangen, indem sie die Bewertung dieser KI-Modelle als ein Puzzle aus fehlenden Teilen betrachteten. Sie erkannten, dass die Fähigkeit eines Modells keine einzelne Zahl ist, sondern ein komplexes Profil, das sich je nach Aufgabe, Sprache oder Nutzer verändert. Um dies begreifbar zu machen, stellten sie sich die Leistung jedes Modells in jedem möglichen Szenario als ein riesiges, mehrdimensionales Gitter verborgener Scores vor. Die meisten dieser Scores werden nie direkt beobachtet, da wir keinen Menschen bitten können, jedes Modell gegen jedes andere Modell in jeder Situation zu vergleichen. Stattdessen sehen wir nur das Ergebnis spezifischer, zufälliger Paarungen. Die Forscher entwickelten einen neuen mathematischen Rahmen, um diese fehlenden Scores zu ergänzen – nicht bloß durch Raten, sondern indem sie die wahrscheinlichsten Werte berechnen und gleichzeitig rigoros messen, wie sicher wir uns bei diesen Vermutungen sein können.

Der Kern ihrer Arbeit adressiert eine spezifische Schwierigkeit, die bisherige Methoden übersehen haben: die ungleichmäßige Natur der Daten. In einer perfekten Welt wäre jeder Vergleich gleichermaßen informativ, aber in der Realität liefert ein Matchup zwischen zwei sehr ähnlichen Modellen viele nützliche Informationen, während ein Matchup zwischen einem Top-Modell und einem schwachen Modell uns nur sehr wenig sagt. Zudem ist die Art und Weise der Datenerhebung oft zugunsten populärer Modelle oder Trendthemen verzerrt. Die Forscher fanden heraus, dass Standard-Statistikwerkzeuge in diesem Umfeld versagen, da sie davon ausgehen, dass die Daten gleichmäßig verteilt sind. Sie entdeckten, dass die mathematische Mechanik, die zur Schätzung dieser Scores verwendet wird, instabil wird, wenn die Informationen einseitig sind, was zu unzuverlässigen Rankings und irreführenden Konfidenzintervallen führt.

Um dies zu lösen, führten die Forscher eine Technik ein, die sie „Score Whitening“ nennen. Stellen Sie sich das wie das Einstellen der Lautstärke bei einem Radio vor, damit jeder Sender, egal ob er klar oder mit statischem Rauschen überträgt, gleichermaßen zum endgültigen Klang beiträgt. Durch die mathematische Reskalierung jedes Vergleichs basierend darauf, wie viel Information er tatsächlich trägt, verwandelten sie die chaotischen, ungleichmäßigen Daten in einen ausgewogenen Strom. Dies ermöglichte es ihnen, einen neuen Typus von Schätzer zu konstruieren, der mit der realen Unordnung der KI-Evaluierung umgehen kann. Sie bewiesen, dass diese Methode die Erstellung von Konfidenzintervallen ermöglicht, die sowohl präzise als auch effizient sind – das heißt, sie sind so eng wie möglich, ohne die Zuverlässigkeit zu opfern.

Ihre Ergebnisse zeigen, dass es durch die Berücksichtigung der Low-Rank-Struktur der Daten – was bedeutet, dass die Modellleistung von wenigen zugrunde liegenden Faktoren wie Denkvermögen oder Programmierfähigkeiten statt von zufälligem Rauschen getrieben wird – möglich ist, Informationen über verschiedene Aufgaben und Modelle hinweg zu kombinieren. Dieses Zusammenführen von Informationen ist entscheidend, wenn die Daten spärlich sind. Die Forscher demonstrierten, dass ihr Ansatz nicht nur für einfache Fragen funktioniert, wie „Ist Modell A besser als Modell B?“, sondern auch für komplexe, nicht-lineare Fragen, wie etwa „Wie hoch ist die Wahrscheinlichkeit, dass Modell A in einer bestimmten Kategorie gewinnt?“.

In Experimenten mit sowohl synthetischen als als auch mit realen Daten von der populären Arena-Plattform erwies sich die neue Methode als wertvoll. Im Vergleich zu bestehenden Ansätzen, die jede Aufgabe separat behandeln oder die ungleichmäßige Stichprobenziehung ignorieren, lieferte der neue Schätzer Rankings mit signifikant geringeren Fehlermargen. Er kalibrierte seine Konfidenzniveaus erfolgreich, was bedeutet, dass er, wenn er behauptete, zu 95 % korrekt zu sein, auch in 95 % der Fälle korrekt war. Die Studie bestätigt, dass es zwar möglich ist, dass die Daten aus menschlichen Präferenzen inhärent verrauscht und verzerrt sind, aber dennoch ein klares, statistisch fundiertes Bild der Modellleistung zu extrahieren. Dies bietet einen fundierten Weg für Entwickler und Nutzer, nicht nur zu verstehen, wer gewinnt, sondern auch, wie sicher wir uns über den Sieg sein können, und verwandelt eine verrauschte Sammlung von Stimmen in ein zuverlässiges Maß für die Leistungsfähigkeit künstlicher Intelligenz.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →