← Neueste Arbeiten
🤖 machine learning

The Quantum Shortcut: Complex Phase-State Dynamics Reduce the Optimization Steps of Sequence Models

Diese Arbeit zeigt auf, dass der Ersatz des standardmäßigen reellwertigen verborgenen Zustands-Substrats durch eine komplexwertige, quanteninspirierte Alternative die Trainingskonvergenz sowohl von State-Space- als auch von Attention-basierten Sequenzmodellen signifikant beschleunigt, wobei der langfristige Leistungsvorteil jedoch nur in State-Space-Architekturen bestehen bleibt.

Ursprüngliche Autoren: Ahmed Nebli, Hadi Saadatdoorabi, Christopher Keibel, Kevin Yam

Veröffentlicht 2026-08-18
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Ahmed Nebli, Hadi Saadatdoorabi, Christopher Keibel, Kevin Yam

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Moderne künstliche Intelligenz, insbesondere jene Systeme, die Texte schreiben, Sprachen übersetzen und das nächste Wort in einem Satz vorhersagen, stützt sich auf eine spezifische Art von mathematischem Motor. Diese Motoren verarbeiten Informationen, indem sie diese durch eine Serie von Schichten bewegen, ähnlich wie ein Signal, das durch einen langen Draht reist. Jahrzehntelang war der Standardweg, diese Motoren zu bauen, darin bestand, reelle Zahlen zu verwenden – die vertrauten Zählzahlen und Dezimalzahlen, die wir im täglichen Leben nutzen. In diesem Standardaufbau erinnert sich der Motor an vergangene Informationen, indem er die Größe seiner internen Signale stark hält. Wenn Informationen jedoch weiter in die Vergangenheit reisen, werden diese Signale natürlicherweise schwächer, wie ein Flüstern, das in einem langen Flur verhallt. Wenn das Signal zu klein wird, vergisst die Maschine effektiv, was am Anfang des Satzes geschah, was es schwierig macht, aus langen Datensequenzen zu lernen. Dieses Verblassen ist eine fundamentale Einschränkung des aktuellen Designs und zwingt Forscher dazu, massive Mengen an Daten und Zeit einzusetzen, um der Maschine das Erinnern beizubringen.

Ein Team von Forschern hat einen Weg entdeckt, dieses Problem des Verblassens zu umgehen, indem sie das Zahlensystem ändern, das die Maschine zum Denken verwendet. Anstatt sich ausschließlich auf reelle Zahlen zu verlassen, bauten sie eine Version dieser Sprachmodelle, die komplexe Zahlen verwendet. Während reelle Zahlen nur einen einzelnen Wert besitzen, tragen komplexe Zahlen zwei unterschiedliche Informationen in sich: eine Größe und eine Richtung oder einen Winkel. Die Forscher fanden heraus, dass die Maschine durch das Speichern der wichtigen Informationen im Winkel anstatt in der Größe viel weiter reisen konnte, ohne ihr Gedächtnis zu verlieren. Selbst wenn die Größe des Signals schrumpft, während es sich durch das Netzwerk bewegt, bleibt der Winkel perfekt scharf und unverändert. Dies ermöglicht es der Maschine, den Kontext des Satzanfangs bis zum Ende des Satzes beizubehalten, ohne dass das Signal jemals in der Stille verblasst.

Die Forscher testeten diesen neuen Ansatz, indem sie zwei verschiedene Arten von Sprachmodellen bauten, eines basierend auf einem Standarddesign und ein anderes auf einem neueren, effizienteren Design. Sie erstellte eine „komplexe“ Version von jedem, wobei sie die reellen Zahlen durch komplexe ersetzten, und trainierten sie auf drei verschiedenen Textmengen, die von einer kleinen Sammlung von 100 Megabyte bis hin zu massiven 15 Gigabyte reichten. Die Ergebnisse waren beeindruckend. Beim neueren, kleineren Design erreichte das komplexe Modell das gleiche Genauigkeitsniveau wie das Standardmodell in nur etwa einem Drittel der Trainingsschritte. Beim größeren, traditionelleren Design erreichte es dasselbe in etwa der Hälfte der Schritte. Das bedeutet, dass die neuen Modelle die gleiche Menge an Informationen lernten, während sie signifikant weniger Daten und Zeit verbrauchten.

Was diese Entdeckung besonders robust macht, ist, dass der Vorteil sofort auftrat, aber das Verhalten der beiden Designs im weiteren Verlauf des Trainings auseinanderging. Die Forscher beobachteten, dass die komplexen Modelle direkt ab den ersten hundert Trainingsschritten die Führung übernahmen. Entscheidend war, dass die Art der Beschleunigung zwischen den beiden Architekturen variierte. Im Fall des neueren Designs (dem State-Space-Modell) wurde die Lücke zwischen dem komplexen Modell und dem Standardmodell mit fortschreitendem Training sogar immer größer, was darauf hindeutet, dass der Vorteil ein permanentes Merkmal des neuen Designs ist und kein flüchtiger Effekt zu Beginn des Prozesses. Für das ältere Design (das Attention-basierte Modell) hingegen war der Vorteil zu Beginn am stärksten und nahm dann langsam ab, bis er gegen Null sank, während das Training voranschritt. Trotz dieses Abfalls war der frühe Schub immer noch substanziell genug, um die Trainingszeit für diese spezifische Architektur um die Hälfte zu verkürzen.

Die Forscher waren sorgfältig darauf bedacht, sicherzustellen, dass diese Beschleunigung nicht einfach durch das Hinzufügen von mehr Rechenleistung oder die Änderung der Größe der Modelle verursacht wurde. Sie stimmten die beiden Versionen jedes Modells so präzise ab, dass sie exakt die gleiche Anzahl an anpassbaren Teilen hatten, mit einer Abweichung von weniger als einem Hundertstel Prozent. Sie verwendeten auch denselben Trainingsplan und dieselbe Computerhardware für beide Versionen. Diese strikte Kontrolle bestätigte, dass der Unterschied in der Geschwindigkeit ausschließlich auf den Wechsel zu komplexen Zahlen und die Art und Weise, wie die Maschine diese verarbeitet, zurückzuführen war. Die Studie schloss zudem die Idee aus, dass die komplexen Modelle einfach nur Glück mit ihren Ausgangsbedingungen hatten; der konsistente Vorteil über verschiedene Textgrößen und verschiedene Modellarchitekturen hinweg deutete auf eine fundamentale Verbesserung der Art und Weise hin, wie die Maschine lernt.

Einer der interessantesten Aspekte dieser Arbeit ist, wie sie die Handhabung widersprüchlicher Informationen verändert. In einem Standardmodell, wenn sich die Maschine unsicher ist, ob eine Sequenz von Zahlen eine Jahreszahl oder einen Preis darstellt, muss sie eine dieser Möglichkeiten aktiv unterdrücken, indem sie ihr internes Signal so weit schrumpfen lässt, bis es verschwindet. Im komplexen Modell kann die Maschine stattdin den Winkel des Signals rotieren. Wenn zwei Möglichkeiten im Konflikt stehen, kann die Maschine sie so rotieren, dass sie sich durch einen Prozess namens Interferenz gegenseitig aufheben, ähnlich wie Noise-Cancelling-Kopfhörer funktionieren, indem sie eine Schallwelle erzeugen, die das exakte Gegenteil des Geräusches ist. Dies ermöglicht es der Maschine, die falsche Idee zu verwerfen, ohne die Stärke der richtigen Idee zu verlieren – eine Fähigkeit, die Standardmodelle nicht besitzen.

Die Forscher merkten an, dass es praktische Kompromisse gab, während die komplexen Modelle schneller lernten. Die Computerchips, die für diese Aufgaben verwendet werden, sind derzeit auf reelle Zahlen optimiert, sodass das Ausführen der komplexen Modelle pro Schritt etwas mehr Recrechenleistung erforderte. Für das neuere Modelldesign bedeutete dieser zusätzliche Aufwand, dass die gesamte Trainingszeit des Modells etwa der des Standardmodells entsprach, obwohl es weniger Schritte benötigte. Dennoch verbrauchte das komplexe Modell deutlich weniger Daten, um die gleiche Qualität zu erreichen, was ein großer Vorteil für spezialisierte Aufgaben ist, bei denen Daten knapp sind. Für das ältere Modelldesign verfügten die Forscher nicht über eine optimierte Version des Standardmodells für einen Vergleich, sodass sie noch nicht sagen konnten, ob die komplexe Version in der realen Rechenzeit schneller wäre, aber der Gewinn an Dateneffizienz war eindeutig.

Diese Arbeit legt nahe, dass die Wahl des Zahlensystems genauso wichtig ist wie die Architektur des Modells selbst. Jahrelang haben sich Forscher darauf konzentriert, wie die Maschine Informationen leitet, aber diese Studie zeigt, dass die Änderung der Sprache, in der die Maschine denkt, sogar noch größere Vorteile bringen kann. Die komplexen Modelle lernten nicht nur etwas schneller; sie veränderten die Effizienz des Lernprozesses grundlegend und erreichten hohe Leistungsniveaus mit einem Bruchteil der Daten. Die Forscher kamen zu dem Schluss, dass ihre aktuelle Version eine praktische Anpassung ist, die die strengen mathematischen Regeln der Theorie lockert, aber ausreicht, um zu beweisen, dass der komplexe Ansatz in großem Maßstab funktioniert. Sie haben ihren gesamten Code und ihre Trainingsprotokolle veröffentlicht und laden andere dazu ein, die Ergebnisse zu verifizieren und zu erforschen, wie diese neue Denkweise die nächste Generation der künstlichen Intelligenz verbessern könnte.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →