← Neueste Arbeiten
🤖 machine learning

The Silent Hyperparameter: Quantifying the Impact of Inference Backends on LLM Reproducibility

Diese Arbeit zeigt, dass die Wahl des Inferenz-Backends als kritischer, jedoch häufig nicht berichteter Hyperparameter fungiert, der aufgrund systemweiter Optimierungen die Benchmark-Ergebnisse von LLMs um bis zu 16,6 Prozentpunkte erheblich verändern kann, wodurch die Community aufgefordert wird, die Berichterstattung über Inferenz-Stacks zu standardisieren, um die Reproduzierbarkeit sicherzustellen.

Ursprüngliche Autoren: David Pape, Jonathan Evertz, Lea Schönherr

Veröffentlicht 2026-05-20
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: David Pape, Jonathan Evertz, Lea Schönherr

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie sind Richter in einem hochriskanten Kochwettbewerb. Sie haben fünf identische Rezepte (die KI-Modelle) und fünf verschiedene Köche (die Inferenz-Backends). Sie erwarten, dass, wenn die Rezepte gleich sind, die Gerichte genau gleich schmecken sollten, oder?

Dieser Artikel argumentiert, dass der Koch genauso wichtig ist wie das Rezept.

In der Welt der Large Language Models (LLMs) konzentrieren sich Forscher normalerweise auf das „Rezept" (die Gewichte des Modells und das Training). Sie gehen davon aus, dass, wenn Sie denselben Prompt in dasselbe Modell eingeben, Sie dieselbe Antwort erhalten. Dieser Artikel zeigt auf, dass diese Annahme falsch ist. Der „Koch" (die Software-Engine, die das Modell ausführt) ist eine stille, unsichtbare Variable, die das Ergebnis des Gerichts vollständig verändern kann, manchmal so, dass ein großartiges Rezept schrecklich schmeckt oder ein mittelmäßiges eines erstaunlich.

Hier ist eine Aufschlüsselung dessen, was der Artikel fand, unter Verwendung einfacher Analogien:

1. Der „stille Hyperparameter"

In der KI-Forschung ist ein „Hyperparameter" eine Einstellung, die Sie anpassen, um bessere Ergebnisse zu erzielen (wie Temperatur oder Geschwindigkeit). Die Autoren entdeckten, dass das Inferenz-Backend (die Software wie vLLM, llama.cpp oder Ollama) wie ein verborgener Hyperparameter wirkt, über den niemand spricht.

  • Die Analogie: Stellen Sie sich zwei Personen vor, die dasselbe Buch lesen. Eine liest es in einer ruhigen Bibliothek (die Standard-Software), die andere liest es, während sie auf einer holprigen Achterbahn fährt (eine hochleistungsfähige, optimierte Engine). Obwohl das Buch identisch ist, könnte der Achterbahnfahrer ein Wort überspringen, einen Satz falsch lesen oder abgelenkt werden, was dazu führt, dass er am Ende eine andere Geschichte erzählt.
  • Die Erkenntnis: Die Autoren testeten fünf verschiedene „Köche" (Engines) an fünf verschiedenen „Rezepten" (Modellen). Sie stellten fest, dass allein das Wechseln der Engine die Testpunktzahl eines Modells um bis zu 16,6 Prozentpunkte verändern konnte. Das ist eine massive Schwankung – genug, um ein Modell von „durchschnittlich" zu „Weltmeister" oder umgekehrt springen zu lassen, obwohl sich das Modell selbst nicht verändert hat.

2. Der „Schmetterlingseffekt" im Gespräch

KI-Modelle generieren Text Wort für Wort. Wenn die Engine beim allerersten Wort einen winzigen Fehler macht, kann das gesamte Gespräch aus dem Ruder laufen.

  • Die Analogie: Denken Sie an das Spiel „Stille Post". Wenn die erste Person ein leicht anderes Wort flüstert als beabsichtigt, hört die letzte Person etwas völlig anderes.
  • Die Erkenntnis: Der Artikel zeigte, dass diese Engines oft beim allerersten Wort einer Antwort nicht übereinstimmen. Bei komplexen logischen Aufgaben (wie dem Lösen von Matheproblemen) könnte eine Engine die Lösung korrekt beginnen, während eine andere Engine mit einem winzigen Fehler startet. Dieser winzige Fehler kaskadiert und veranlasst die Engine, eine völlig andere und oft falsche Gedankenkette zu generieren.

3. Warum passiert das? (Die Geheimnisse der Küche)

Die Autoren gruben im Code nach, um herauszufinden, warum die Köche verschiedene Gerichte zubereiteten. Sie fanden zwei Hauptgründe:

  • Grund A: Versteckte Standards (Die „Geheime Soße"): Einige Engines haben versteckte Einstellungen, die automatisch aktiviert werden.
    • Beispiel: Eine Engine (Ollama) fügt dem Prompt heimlich ein zusätzliches „Start"-Token hinzu, wie eine Prise Salz, die Sie nicht bestellt haben. Eine andere Engine (LMDeploy) erzwingt eine spezifische Strafe für das Wiederholen von Wörtern. Als die Forscher diese „Geheimsoßen" ausschalteten, stiegen die Punktzahlen wieder an, was bewies, dass die Engine mit den Ergebnissen spielte.
  • Grund B: Geschickte Tricks (Der „Vorwärts"-Fehler): Um KI schneller laufen zu lassen, verwenden Ingenieure mathematische Abkürzungen (wie das Gruppieren von Berechnungen oder die Verwendung von Mathematik mit geringerer Genauigkeit).
    • Beispiel: Stellen Sie sich vor, Sie lösen ein langwieriges Matheproblem. Eine Person löst es schrittweise mit einem Taschenrechner (Standard). Eine andere Person verwendet einen super-schnellen Kopfrechen-Trick, der Zahlen leicht anders rundet. Die endgültige Antwort ist normalerweise ähnlich, aber manchmal ändert dieser winzige Rundungsfehler das Ergebnis. In der KI verursachen diese „Geschick-Tricks" winzige Gleitkommafehler, die sich summieren und die endgültige Antwort verändern.

4. Das „unsichtbare" Problem in der Forschung

Die Autoren befragten über 35.000 Forschungsarbeiten, um zu sehen, ob Wissenschaftler zugaben, welchen „Koch" sie verwendeten.

  • Die Erkenntnis: Fast niemand berichtete darüber. Es ist wie bei einem Kochwettbewerb, bei dem die Teilnehmer sagen: „Ich habe ein geheimes Rezept verwendet", sich aber weigern zu sagen, auf welchem Herd sie es gekocht haben.
  • Die Konsequenz: Da Forscher die Engine nicht melden, können wir nicht feststellen, ob ein neues „State-of-the-Art"-Modell tatsächlich besser ist oder ob es einfach nur Glück hatte, weil es auf einer bestimmten Engine getestet wurde, die zufällig seine Punktzahl erhöhte. Dies macht wissenschaftlichen Fortschritt schwer überprüfbar.

5. Sicherheitsrisiken

Der Artikel testete auch die Sicherheit. Sie baten die Modelle, zu versuchen, aus ihren Sicherheitsregeln auszubrechen (Jailbreaks).

  • Die Erkenntnis: Ein Modell, das auf einer Engine sicher ist und sich weigert, eine gefährliche Frage zu beantworten, könnte plötzlich anfällig werden und sie auf einer anderen Engine beantworten. Die „Bereitstellungslücke" bedeutet, dass ein Modell, das im Labor als sicher getestet wurde, in der realen Welt unsicher sein kann, nur weil die Software, die es ausführt, anders ist.

Das Fazit

Die Autoren fordern einen neuen Standard in der KI-Forschung: Hören Sie auf, die Software-Engine als unsichtbar zu behandeln.

Genauso wie Sie die Temperatur und den Ofentyp angeben würden, wenn Sie einen Kuchen backen, müssen Forscher genau melden, welche Inferenz-Engine sie verwendet haben. Bis wir das tun, können wir nicht sicher sein, ob wir Äpfel mit Äpfeln vergleichen oder ob wir nur Äpfel mit Äpfeln vergleichen, die von verschiedenen Messern geschnitten wurden.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →