← Neueste Arbeiten
🤖 machine learning

Amortizing intractable inference in large language models

Dieses Paper schlägt vor, GFlowNets einzusetzen, um die schwer berechenbare Inferenz in großen Sprachmodellen zu amortisieren, wodurch diese in der Lage sind, aus komplexen Posteriori-Verteilungen für Aufgaben wie die beschränkte Generierung und Chain-of-Thought-Reasoning zu sampeln, als eine dateneffiziente Alternative zum traditionellen Maximum-Likelihood- oder Reward-Maximierung-Training.

Ursprüngliche Autoren: Edward J. Hu, Moksh Jain, Eric Elmoznino, Younesse Kaddar, Guillaume Lajoie, Yoshua Bengio, Esmeralda S. Whitammer

Veröffentlicht 2026-09-01
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Edward J. Hu, Moksh Jain, Eric Elmoznino, Younesse Kaddar, Guillaume Lajoie, Yoshua Bengio, Esmeralda S. Whitammer

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Große Sprachmodelle sind riesige Bibliotheken menschlichen Wissens, komprimiert in digitale Netzwerke, die das nächste Wort in einem Satz basierend auf dem vorangegangenen vorhersagen. Sie sind darauf trainiert, exzellent darin zu sein, eine Geschichte fortzuführen oder eine Frage zu beantworten, wenn ihnen ein Ausgangspunkt gegeben wird – ein Prozess, der natürlich von links nach rechts fließt. Viele der interessantesten Aufgaben, die wir diesen Modellen übertragen wollen, erfordern jedoch das Denken in Rückwärtsrichtung oder das Ausfüllen der Mitte einer Geschichte. Stellen Sie sich vor, man gibt Ihnen den Anfang und das Ende einer Erzählung und bittet Sie, die Mitte zu erfinden, oder man bittet Sie, die Logik hinter einer bestimmten Antwort zu erklären. In diesen Szenarien kann das Modell nicht einfach nur das nächste Wort erraten; es muss durch eine massive, komplexe Landschaft von Möglichkeiten suchen, um den spezifischen Pfad zu finden, der den Anfang mit dem Ende verbindet. Dies ist ein schwieriges mathematisches Problem, da die Anzahl der möglichen Pfade so enorm ist, dass das schrittweise Überprüfen aller Wege unmöglich ist, und die Standardmethoden zur Navigation in dieser Landschaft oft bei nur ein oder zwei gängigen Routen stecken bleiben und die reiche Vielfalt der existierenden, gültigen Lösungen übersehen.

Forscher des Mila – Quebec AI Institute und der University of Oxford haben einen neuen Weg entwickelt, wie man diese Modelle lehrt, diese komplexe Landschaft zu navigieren. Anstatt das Modell darauf zu trainieren, lediglich einen Score für die „beste“ Antwort zu maximieren, was oft zu repetitivem und eng gefasstem Denken führt, verwendeten sie eine Methode namens amortisierte Inferenz. Dieser Ansatz betrachtet das Problem als die Suche nach einer vielfältigen Menge korrekter Pfade statt nach einem einzigen perfekten Pfad. Zu diesem Zweck setzten sie eine Technik namens Generative Flow Network ein, das wie ein Wegweiser fungiert, der lernt, aus dem gesamten Spektrum möglicher Lösungen zu sampeln, um sicherzustellen, dass das Modell verschiedene gültige Argumentationsketten exploriert, anstatt in ein einziges, übermäßig genutztes Muster zu kollabieren.

Das Team demonstrierte dies, indem sie große Sprachmodelle darauf feinabstimmten, Probleme zu lösen, die mehrstufiges Denken erfordern, wie etwa arithmetische Berechnungen oder die Klassifizierung, ob eine Filmkritik eine Meinung oder eine Tatsache ausdrückt. In einem Experiment baten sie das Modell, den fehlenden Mittelsatz einer kurzen Geschichte einzufügen, gegeben den Anfang und das Ende. Standardmethoden erzeugten oft Sätze, die zwar grammatikalisch korrekt waren, aber nicht zum narrativen Fluss passten. Die neue Methode hingegen generierte erfolgreich Mittelsätze, die den Anfang und das Ende kohärent miteinander verknüpften, was eine wesentlich höhere Fähigkeit zum Verständnis des gesamten Kontextes zeigte. In einem anderen Test, der einfache Matheaufgaben beinhaltete, wurde das Modell mit einem Taschenrechner-Werkzeug ausgestattet und gebeten, die Berechnung in Schritten aufzuschlüsseln. Während andere Trainingsmethoden dazu führten, dass das Modell Zahlen wiederholte oder das Werkzeug nicht korrekt nutzte, lehrte der neue Ansatz das Modell, seine Schritte sorgfältig zu planen, was zu einer dramatischen Verbesserung der Genauigkeit führte, insbesondere bei Problemen, die es zuvor noch nie gesehen hatte.

Die Ergebnisse legen nahe, dass diese Methode besonders leistungsfähig ist, wenn Daten knapp sind. In einem Test, bei dem das Modell nur zehn Beispiele von Filmkritiken zum Lernen zur Verfügung hatte, erreichte die neue Methode eine signifikant höhere Genauigkeit als Standard-Trainingsmethoden, und sie übertraf diese auch bei fünfzig Beispielen weiterhin deutlich. Die Forscher fanden heraus, dass das System robuster und zuverlässiger wurde, indem es die Modelle dazu ermutigte, eine breite Vielfalt an Argumentationspfaden zu sampeln und dann deren Schlussfolgerungen zu kombinieren. Dies ist ein entscheidender Unterschied, denn es bedeutet, dass das Modell nicht nur einen einzigen Weg zur Problemlösung auswendig lernt, sondern die zugrunde liegende Struktur dessen lernt, wie man ein Problem durchdenkt. Die Studie deutet darauf hin, dass wir, indem wir das Ziel von der Suche nach der wahrscheinlichsten einzelnen Antwort hin zur Erforschung der vollen Diversität korrekter Antworten verschieben, diese mächtigen Werkzeuge flexibler und besser für komplexe Denkaufgaben geeignet machen können.

Die Arbeit hebt auch eine Einschränkung hervor, wie aktuelle Modelle oft trainiert werden. Wenn Modelle darauf gedrängt werden, eine Belohnung zu maximieren, neigen sie dazu, Abkürzungen zu finden, wie etwa das Wiederholen derselben Phrase oder das Ignorieren der eigentlichen Logik eines Problems, nur um eine hohe Punktzahl zu erreichen. Die Forscher zeigten, dass ihre Methode diese Falle vermeidet, indem sie die gesamte Verteilung möglicher Lösungen abgleicht und so sicherstellt, dass das Modell nicht in ein einziges, fehlerhaftes Denkmodell kollabiert. Dieser Ansatz ermöglicht es dem Modell, besser zu generalisieren, etwa beim Lösen von Arithmetikproblemen mit mehr Zahlen als im Training verwendet wurden, wo andere Methoden versagten. Die Erkenntnisse bieten einen vielversprechenden Weg nach vorn, um künstliche Intelligenz zu einer ernsthafteren Form des Denkens zu befähigen, die über einfaches Musterabgleichen hinausgeht und zu einem nuancierteren Verständnis führt, wie man Argumente konstruiert und Probleme Schritt für Schritt löst.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →