How Lossless Is Lossless Speculative Decoding? The Role of Numerical Precision in Orthrus
Diese Arbeit zeigt auf, dass während Orthrus in FP32 eine verlustfreie spekulative Dekodierung mit exakter Trajektorienanpassung erreicht, seine behauptete Verlustfreiheit unter BF16-Präzision signifikant abnimmt, was verdeutlicht, dass die numerische Präzision die Trajektorienäquivalenz kritisch beeinflusst, selbst wenn die Leistung bei nachgelagerten Aufgaben unbeeinträchtigt bleibt.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Moderne Computer, die Texte schreiben – bekannt als Sprachmodelle –, sind zu einer dominierenden Kraft bei der Generierung von Informationen geworden. Diese Systeme arbeiten, indem sie das nächste Wort in einem Satz basierend auf den vorangegangenen Wörtern vorhersagen, Schritt für Schritt. Diese Methode ist zuverlässig, aber von Natur aus langsam, da der Computer das erste Wort erst fertig berechnen muss, bevor er überhaupt mit dem Denken über das zweite Wort beginnen kann. Wenn diese Modelle größer werden und die Konversationen länger werden, wird dieser schrittweise Prozess zu einem Engpass, der die Technologie teuer und träge in der Anwendung macht. Um dies zu beschleunigen, haben Forscher eine Technik namens „Speculative Decoding“ entwickelt. Dieser Ansatz versucht, mehrere zukünftige Wörter gleichzeitig zu erraten, wie ein Leser, der in einem Buch vorausliest, und prüft dann, ob diese Vermutungen korrekt sind. Wenn die Vermutungen richtig sind, spart der Computer eine enorme Menge an Zeit.
Ein jüngstes System namens Orthrus versprach, dies zu tun, ohne an Genauigkeit zu verlieren. Es kombiniert einen standardmäßigen, langsamen Textgenerator mit einer schnelleren, parallelen Vermutungsmaschine. Die Schöpfer behaupteten, dass ein eingebauter Prüfmechanismus sicherstellen würde, dass die schnelle Maschine exakt dieselbe Wortsequenz produziert wie die langsame, ursprüngliche Engine, was die Beschleunigung wahrhaft „verlustfrei“ mache. Verlustfrei bedeutet in diesem Zusammenhang, dass die endgültige Ausgabe identisch mit der ist, die das ursprüngliche, langsamere Modell produziert hätte, bis auf das letzte Zeichen. Dieses Versprechen war bedeutend, da es suggerierte, dass wir das Beste aus beiden Welten haben könnten: die Geschwindigkeit des parallelen Ratens mit der perfekten Zuverlässigkeit des ursprünglichen Modells.
Ein Team von Forschern beschloss, dieses Versprechen unabhängig zu testen. Sie bauten ihre eigene Version des Orthrus-Systems und verglichen dessen Ausgabe mit dem Originalmodell bei einer Vielzahl von Aufgaben, darunter das Schreiben von Code, das Lösen von Mathematikproblemen und das Verfassen von Poesie. Sie führten diese Tests unter Verwendung eines Standardmaßes an numerischer Präzision durch, das die meisten modernen Computer zur Effizienzsteigerung nutzen. Als sie die generierten Wortsequenzen des schnellen Orthrus-Systems mit denen des langsamen Originalsystems verglichen, fanden sie ein überraschendes Ergebnis. Die beiden Systeme stimmten nicht immer überein. Tatsächlich entsprachen die Sequenzen beim ursprünglich veröffentlichten Modell nur zu etwa 45 Prozent perfekt. Für ihre eigene, unabhängig trainierte Version der Forscher lag die Übereinstimmungsrate sogar noch niedriger, bei 43 Prozent. Das bedeutet, dass das schnelle System in mehr als der Hälfte der Fälle einen leicht anderen Weg einschlug und andere Wörter wählte, als das ursprüngliche Modell gewählt hätte.
Die Forscher gruben tiefer, um zu verstehen, warum dies geschah. Sie entdeckten, dass die Wahrscheinlichkeit, mit der die Systeme übereinstimmten, mit der Schwierigkeit des Textes zusammenhing, den das Originalmodell vorherzusagen hatte. Wenn das Originalmodell sehr sicher in seinem nächsten Wort war, stimmte das schnelle System meist mit ihm überein. Wenn der Text jedoch komplexer war oder das Modell weniger sicher war, war das schnelle System eher dazu geneigt, abzuweichen und ein anderes Wort zu wählen. Dies deutet darauf hin, dass die Behauptung der „Verlustfreiheit“ unter den spezifischen Bedingungen der Standard-Computerberechnungen nicht standhielt. Die Forscher stellten auch fest, dass diese Abweichung den Text nicht zwangsläufig schlechter machte. Als sie die Modelle auf Standard-Benchmarks für logisches Denken und Programmierung testeten, schnitt das schnelle System manchmal etwas besser ab als das langsame, was zeigt, dass ein anderer Weg nicht immer ein schlechteres Ergebnis bedeutet.
Um das Rätsel zu lösen, warum die Systeme uneinig waren, änderten die Forscher die Art und Weise, wie der Computer mit Zahlen umging. Sie wiederholten das gesamte Experiment unter Verwendung einer höheren Ebene numerischer Präzision, die es dem Computer ermöglicht, Zahlen mit wesentlich größerer Exaktheit zu speichern. Als sie diesen Wechsel vornahmen, änderte sich das Ergebnis komplett. Unter dieser präziseren Berechnung stimmte das schnelle Orthrus-System bei jedem einzelnen der 1.190 Test-Prompts perfekt mit dem langsamen Originalmodell überein. Dieser Befund enthüllte, dass die früheren Unstimmigkeiten nicht durch einen Fehler im Design des Orthrus-Systems selbst verursacht wurden, sondern durch die winzigen Rundungsfehler, die auftreten, wenn Computer mit Standard-Mathematik geringerer Präzision rechnen.
Die Studie kommt zu dem Schluss, dass das Versprechen einer „verlustfreien“ Beschleunigung vollständig von der mathematischen Präzision abhängt, die der Computer verwendet. Während das Orthrus-System in der Theorie wie vorgesehen funktioniert, führt die praktische Realität des Betriebs auf Standard-Hardware kleine Fehler ein, die das Endergebnis verändern können. Die Forscher argumentieren, dass Wissenschaftler, wenn sie behaupten, ein System sei verlustfrei, die Ebene der numerischen Präzision angeben müssen, die verwendet wird, da ein System, das in einer Umgebung perfekt genau ist, in einer anderen unterschiedliche Ergebnisse liefern kann. Diese Arbeit verdeutlicht, dass wir Sprachmodelle zwar viel schneller machen können, die Sicherstellung, dass sie exakt dieselbe Ausgabe wie das Original liefern, jedoch eine sorgfältige Beachtung der zugrunde liegenden Mathematik erfordert, nicht nur der Architektur des Modells.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.