← Neueste Arbeiten
💻 computer science

Scaling Reinforcement Learning for Diffusion Models via Velocity Matching

Dieses Paper stellt Reward-based Velocity Matching (RVM) vor, ein einfaches und recheneffizientes, trajektorienfreies Framework, das das Geschwindigkeitsfeld von Diffusionsmodellen direkt für das Reward-Fine-Tuning optimiert, dabei bestehende likelihood-basierte Policy-Gradient-Methoden übertrifft, eine vereinheitlichte Perspektive auf jüngste Ansätze bietet und verbesserte dynamische Rewards für die Videogenerierung ermöglicht.

Ursprüngliche Autoren: Jaemoo Choi, Wei Guo, Yuchen Zhu, Arash Vahdat, Molei Tao, Julius Berner, Yongxin Chen

Veröffentlicht 2026-08-26
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Jaemoo Choi, Wei Guo, Yuchen Zhu, Arash Vahdat, Molei Tao, Julius Berner, Yongxin Chen

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In der sich schnell entwickelnden Welt der künstlichen Intelligenz ist eine spezifische Klasse von Computerprogrammen entstanden, die atemberaubende Bilder und realistische Videos aus einfachen Textbeschreibungen erstellen kann. Diese Systeme, bekannt als Diffusionsmodelle, funktionieren, indem sie lernen, einen Prozess der schrittweisen Korruption umzukehren. Stellen Sie sich vor, man nimmt ein klares Foto und fügt langsam statisches Rauschen hinzu, bis es unerkennbar wird; diese Modelle lernen den mathematischen Pfad, um rückwärts zu gehen, indem sie von reinem Rauschen ausgehen und dieses Schritt für Schritt sorgfältig entfernen, um ein kohärentes Bild zu enthüllen. Obwohl diese Werkzeuge unglaublich leistungsstark geworden sind, hat sich die Aufgabe, sie dazu zu bringen, menschliche Vorlieben zu befolgen – wie etwa ein Video natürlicher bewegen zu lassen oder ein Bild schöner aussehen zu lassen – als schwierig erwiesen. Traditionell haben Forscher versucht, Methoden anzupassen, die für Sprachmodelle verwendet werden und auf der Berechnung der Wahrscheinlichkeit jedes möglichen nächsten Schritts in einer Sequenz beruhen. Da die Generierung von Bildern und Videos jedoch Millionen von Pixeln beinhaltet, die sich gleichzeitig verändern, ist die Berechnung dieser Wahrscheinlichkeiten rechenintensiv und oft nicht mit perfekter Genauigkeit möglich.

Ein Team von Forschern der Georgia Tech und NVIDIA hat einen einfacheren, direkteren Weg gefunden, um diesen Modellen beizubringen, was Menschen bevorzugen. Anstatt zu versuchen, komplexe Wahrscheinlichkeiten für jeden winzigen Schritt des Generierungsprozesses zu berechnen, schlugen sie eine Methode vor, die sich direkt auf die „Geschwindigkeit“ (Velocity) des Bildes konzentriert, während es entsteht. In der Sprache dieser Modelle sagt das System voraus, wie sich das Bild von einem Moment zum nächsten verändern muss, um das Endergebnis zu erreichen. Die Forscher entdeckten, dass sie diese Vorhersage einfach in Richtungen lenken können, die zu qualitativ hochwertigen Ergebnissen führen, und sie von Richtungen wegdrücken können, die zu schlechten Ergebnissen führen, wobei ein Belohnungssignal als Leitfaden dient. Dieser Ansatz, den sie „Reward-Based Velocity Matching“ nennen, umgeht die Notwendigkeit der komplizierten Wahrscheinlichkeitsberechnungen, die bisherige Versuche verlangsamt haben.

Die Forscher testeten diese Idee an groß angelegten Videogenerationsmodellen, die besonders teuer in der Ausbildung sind, da die Erstellung eines einzigen Videos erhebliche Rechenleistung erfordert. Sie verglichen ihre neue Methode mit bestehenden Techniken, die darauf basieren, den gesamten Pfad der Videogenerierung zu verfolgen. Die Ergebnisse waren beeindruckend: Ihre einfachere Methode produzierte Videos, die nicht nur besser in der Qualität waren, sondern auch nur einen Bruchteil der Rechenzeit benötigten. In einem spezifischen Test mit einem Modell namens Wan2.1 erreichte ihr Ansatz die höchste Gesamtqualität bei nur etwa einem Zwölftel der Trainingszeit, die die bisher besten Methoden benötigten. Dies deutet darauf hin, dass die Komplexität der alten Methoden unnötig war; der Schlüssel zur Verbesserung lag nicht in der Verfeinerung der mathematischen Mechanik der Wahrscheinlichkeit, sondern darin, wie die Belohnungssignale gestaltet und angewendet wurden.

Ein entscheidender Teil ihrer Entdeckung war das Verständnis dessen, was die Modelle tatsächlich optimierten. Die Forscher fanden heraus, dass Standardbelohnungen, die sich oft auf visuelle Klarheit oder darauf konzentrieren, wie gut das Video zu einer Textbeschreibung passt, das Modell unbeabsichtigt dazu ermutigen konnten, statische, unbewegliche Bilder zu erzeugen, die zwar sauber aussah, aber langweilig waren. Um dies zu beheben, führten sie eine neue Art von Belohnung ein, die speziell die Bewegung verfolgt und so sicherstellt, dass das Video eine bedeutungsvolle Dynamik enthält. Als sie diese bewegungsorientierte Belohnung in ihr System integrierten, wurden die Videos signifikant dynamischer, ohne ihre visuelle Qualität zu verlieren. Dieser Befund unterstreicht, dass für diese leistungsstarken Modelle nicht die Komplexität des Trainingsalgorithmus der wichtigste Faktor ist, sondern die Klarheit und Spezifität der Ziele, die der Maschine gesetzt werden.

Die Studie zeigte auch, dass die spezifische mathematische Formel, die zur Aktualisierung des Modells verwendet wird, weniger wichtig ist als bisher angenommen. Die Forscher zeigten, dass ihre neue Methode mathematisch äquivalent zu mehreren anderen aktuellen Ansätzen ist, was bedeutet, dass die Leistungsunterschiede zwischen diesen Methoden wahrscheinlich auf die Art und Weise zurückzuführen sind, wie sie ihre Belohnungen aufsetzten, und nicht auf den Kernalgorithmus selbst. Indem sie die unnötigen Schichten der Wahrscheinlichkeitsschätzung entfernten, demonstrierten sie, dass eine direkte, geschwindigkeitsbasierte Aktualisierung ausreicht, um das Modell zu besseren Ergebnissen zu führen. Diese Vereinfachung öffnet die Tür für ein effizienteres Training, das es Forschern ermöglicht, schneller zu iterieren und diese Technologien potenziell auf noch komplexere Aufgaben zu skalieren, ohne durch Rechenkosten ausgebremst zu werden.

Letztendlich deutet diese Arbeit auf einen Wandel in der Art und Weise hin, wie wir das Training generativer KI betrachten. Anstatt das Problem als ein komplexes Rätsel der Wahrscheinlichkeitsschätzung zu behandeln, zeigten die Forscher, dass es besser als eine direkte Ausrichtung der internen Richtung des Modells auf menschliche Vorlieben betrachtet werden sollte. Der Erfolg ihrer Methode, die überlegene Ergebnisse mit drastisch reduzierten Ressourcen erzielte, zeigt, dass die Zukunft des effizienten KI-Trainings in einfacheren, direkteren Rückkopplungsschleifen liegen könnte. Da diese Modelle immer größer und fähiger werden, wird die Fähigkeit, sie schnell und effektiv feinabzustimmen, von entscheidender Bedeutung sein, und dieser neue Ansatz bietet einen klaren, praktischen Weg, um künstliche Intelligenz reaktionsfähiger auf menschliche Bedürfnisse zu machen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →