← Neueste Arbeiten
📈 economics

The Partial Testimony of Logs: Evaluation of Language Model Generation under Confounded Model Choice

Dieser Beitrag stellt ein dreiquelliges Rahmenwerk vor und bewertet dieses, das ein kleines randomisiertes Experiment mit einem Offline-Simulator kombiniert, um die in groß angelegten Beobachtungsprotokollen von Sprachmodellen inhärente Selektionsverzerrung zu identifizieren und zu korrigieren und dadurch valide kausale Vergleiche der Modellleistung zu ermöglichen.

Ursprüngliche Autoren: Jikai Jin, Vasilis Syrgkanis

Veröffentlicht 2026-05-05
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Jikai Jin, Vasilis Syrgkanis

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen herauszufinden, welcher von drei Köchen die beste Suppe macht. Sie haben ein massives Notizbuch mit Kundenbewertungen aus einem belebten Restaurant (das Beobachtungsprotokoll oder OBS). Allerdings gibt es einen Haken: Die Kunden haben nicht zufällig einen Koch ausgewählt. Sie wählten den Koch, von dem sie dachten, er sei der Beste, basierend auf ihrer eigenen Stimmung, ihrem Hunger oder ihren früheren Erfahrungen.

Wenn Sie das Notizbuch einfach nur lesen, könnten Sie denken, Koch A sei der Beste, weil die Leute, die bei Koch A bestellt haben, bereits in guter Stimmung waren und alles liebten. Aber vielleicht ist Koch B tatsächlich besser; sie haben nur mürrische Kunden bedient, die zu müde waren, die Suppe zu würdigen. Dies ist Verzerrung durch Störfaktoren (Confounding): Der Grund, warum die Leute einen Koch gewählt haben, ist mit der Frage vermischt, wie sehr ihnen das Essen gefallen hat.

Um dies zu lösen, könnten Sie ein kleines, strenges Experiment durchführen, bei dem Sie Kunden zwingen, zufällig einen Koch auszuwählen (das Randomisierte Experiment oder EXP). Dies gibt Ihnen einen fairen, unverzerrten Geschmackstest. Doch die Durchführung dieses Experiments ist teuer und für die Kunden lästig, sodass Sie es nur wenige Male durchführen können.

Dieser Artikel schlägt eine clevere Dreiteilstrategie vor, um das Beste aus beiden Welten zu nutzen, wobei ein „Küchensimulator" als Brücke dient.

Die drei Zutaten

  1. Das große Notizbuch (OBS): Ein riesiger Haufen realer Bewertungen. Es ist verzerrt, enthält aber viele Daten.
  2. Der kleine faire Test (EXP): Ein kleiner Haufen von Bewertungen, bei denen Kunden gezwungen wurden, zufällig auszuwählen. Es ist unverzerrt, aber sehr klein.
  3. Der Küchensimulator (SIM): Ein Roboter, der die Suppe neu kochen kann. Wenn Sie ihm sagen: „Koch A hat diese Suppe für diesen spezifischen Kunden gemacht", kann der Roboter sofort generieren, wie Koch As Suppe ausgesehen hätte, selbst wenn der Kunde sie nie tatsächlich bestellt hat.

Die große Entdeckung: Der „Magische Trick"

Die Hauptaussage des Artikels ist ein mathematischer Beweis (Satz 1), der besagt: Sie benötigen das große Notizbuch nicht, um herauszufinden, wer tatsächlich der beste Koch ist.

Hier ist der magische Trick:

  • Der Simulator kann Ihnen zeigen, was jeder Koch für jeden Kunden gekocht hätte.
  • Der kleine faire Test sagt Ihnen genau, wie gut die Suppe in diesen wenigen zufälligen Fällen war.

Durch die Kombination dieser beiden können Sie mathematisch die wahre Fähigkeit jedes Kochs berechnen. Das große Notizbuch (OBS) ist nicht erforderlich, um zu beweisen, wer besser ist; es wird erst später benötigt, um Ihre Schätzung präziser zu machen (die „Rauschsignale" in Ihrer Antwort zu reduzieren).

Stellen Sie es sich so vor: Der Simulator und der kleine faire Test geben Ihnen die Wahrheit. Das große Notizbuch ist nur eine Lupe, die hilft, diese Wahrheit klarer zu sehen, aber es erzeugt die Wahrheit nicht selbst.

Die sechs Möglichkeiten, die Zutaten zu mischen

Sobald Sie wissen, dass die Wahrheit wiederherstellbar ist, stellt der Artikel die Frage: „Wie nutzen wir das große Notizbuch, um uns zu helfen, ohne von seiner Verzerrung getäuscht zu werden?" Sie testeten sechs verschiedene „Rezepte" (Schätzer) zum Mischen der Daten:

  1. Der reine Experimentator (Nur EXP): Ignoriert das große Notizbuch vollständig. Verwendet nur den kleinen fairen Test.
    • Vorteile: Komplett unverzerrt.
    • Nachteile: Sehr wackelige Ergebnisse, wenn der faire Test zu klein ist (hohe Varianz).
  2. Der Notizbuchleser (Nur OBS): Ignoriert den fairen Test und liest einfach das große Notizbuch.
    • Vorteile: Sehr stabile Zahlen.
    • Nachteile: Komplett falsch wegen der Verzerrung (niedrige Varianz, hohe Verzerrung).
  3. Der Übersetzer (Repräsentation-EXP): Nutzt das große Notizbuch, um eine „Sprache" dessen zu lernen, was Kunden mögen, und verwendet dann den kleinen fairen Test, um die tatsächlichen Werte in dieser Sprache zu lernen.
    • Vorteile: Gut, wenn die „Sprache" des Notizbuchs die richtigen Details erfasst.
    • Nachteile: Scheitert, wenn das Notizbuch die wichtigen Details verpasst.
  4. Der fundierte Korrektor (Grounded): Beginnt mit der Antwort des Notizbuchlesers und verwendet dann den kleinen fairen Test, um die Fehler zu „korrigieren".
    • Vorteile: Großartig, wenn das Notizbuch größtenteils richtig ist, aber einen kleinen systematischen Fehler hat.
  5. Der Mischer (CVCI): Vermischt Notizbuch und fairen Test miteinander und passt die Mischung basierend darauf an, welche Kombination im kleinen fairen Test am besten funktioniert.
    • Vorteile: Oft der ausgewogenste Ansatz.
  6. Der Residual-Mischer (CVCI-Residual): Ähnlich wie der Mischer, entfernt aber zuerst den „einfachen" Teil des Problems mithilfe des Notizbuchs und verwendet dann den fairen Test, um die „schweren" Reste zu korrigieren.

Was die Experimente zeigten

Die Autoren testeten diese Rezepte an zwei realen Aufgaben: Zusammenfassen von Nachrichtenartikeln und Korrigieren von Computercode.

  • Kein „Einheitslösung": Es gibt keinen einzigen Gewinner. Welches Rezept am besten funktioniert, hängt von zwei Dingen ab:
    1. Wie viel Daten haben Sie? Wenn Sie sehr wenige Daten aus dem fairen Test haben, müssen Sie stark auf das Notizbuch zurückgreifen (aber vorsichtig). Wenn Sie viele Daten aus dem fairen Test haben, können Sie die Verzerrung des Notizbuchs leichter ignorieren.
    2. Was messen Sie?
      • Bei der Zusammenfassungsaufgabe war der „Mischer" (CVCI) normalerweise der Beste. Er balancierte die enorme Menge an Notizbuchdaten perfekt mit dem kleinen fairen Test aus.
      • Bei der Codierungsaufgabe änderten sich die Ergebnisse je nachdem, was „Erfolg" bedeutete. Wenn Erfolg bedeutete „Hat der Code den Fehler behoben?", waren die auf dem Notizbuch basierenden Methoden besser. Wenn Erfolg bedeutete „Ist der Code-Stil schön?", funktionierte eine andere Methode (Repräsentation-EXP) besser.

Das Fazit

Wenn Sie KI-Modelle unter Verwendung realer Protokolle bewerten, können Sie den Zahlen nicht einfach vertrauen, weil Menschen Modelle basierend auf versteckten Faktoren auswählen.

Der Artikel beweist, dass Sie, wenn Sie einen Simulator (zum erneuten Generieren von Ausgaben) und einen kleinen randomisierten Test (zum Erhalt fairer Bewertungen) haben, mathematisch die wahre Leistung der Modelle finden können. Der riesige Haufen verzerrter realer Protokolle ist hilfreich, um die Antwort zu verfeinern, aber er ist nicht der Schlüssel zum Entschlüsseln der Wahrheit. Der Schlüssel ist die Kombination aus Simulator und randomisiertem Experiment.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →