Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming
Vorch-Streamer ist ein Post-Training-Framework, das durch die Kombination eines mit gemischten Forcing-Strategien trainierten kausalen Generators, DMD-Destillation für Langzeitstabilität und einem externen Sprachmodell zur Sprachplanung das Echtzeit-Streaming von langgestreckten Text-zu-Audio-Video-Inhalten ermöglicht, um eine hochgeschwindigkeitsfähige, synchronisierte und konsistente Avatar-Generierung zu erreichen.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie versuchen, einem Roboter beizubringen, eine Geschichte zu erzählen. Sie möchten, dass er spricht, seine Lippen bewegt und gleichzeitig seine Gesichtsausdrücke verändert, genau wie ein echter Mensch. Lange Zeit konnten die besten Roboter dies nur für sehr kurze Clips, wie etwa eine 5-sekündige Begrüßung, leisten. Sie arbeiteten wie ein Regisseur, der das gesamte Skript sieht, bevor er eine Szene filmt, um vorauszuplanen, was als Nächstes passiert. Aber in der realen Welt haben wir keine Zeit darauf zu warten, dass die ganze Geschichte geschrieben ist, bevor wir anfangen zu sprechen. Wir brauchen den Roboter, der jetzt spricht, basierend nur auf dem, was er bisher gesagt hat, während er gleichzeitig sein Gesicht und seine Stimme perfekt synchron hält. Dies ist die Herausforderung des „Echtzeit-Streamings“. Das Problem ist, dass, wenn ein Roboter im ersten zweiten einen winzigen Fehler macht, sich dieser Fehler im Laufe der Zeit aufhäufen kann, was dazu führt, dass das Gesicht des Roboters am Ende seltsam aussieht oder seine Stimme vom Thema abweicht. Wissenschaftler versuchen seit langem herauszufinden, wie sie digitale Avatare dazu bringen können, minutenlang zu sprechen, ohne den Verstand oder den Rhythmus zu verlieren.
Hier kommt Vorch-Streamer ins Spiel, ein neues System, das wie ein super organisierter Echtzeit-Geschichtenerzähler agiert. Anstatt zu versuchen, das ganze Skript auswendig zu lernen, bevor es spricht, nutzt Vorch-Streamer eine clevere zweiteilige Strategie, um die Show über zwei Minuten lang ohne Unterbrechung am Laufen zu halten. Denken Sie an eine Band, die eine lange Jam-Session spielt. Normalerweise würde der Rest des Liedes unordentlich werden, wenn ein Musiker einen falschen Ton spielt. Aber Vorch-Streamer hat einen speziellen „Proben“-Modus. Zuerst übt es, kurze Segmente zu spielen, während es sanft von einem Lehrer korrigiert wird (einem vortrainierten Modell, das es perfekt beherrscht). Dann übt es, das ganze Lied von Anfang bis Ende zu spielen, aber dieses Mal hört es auf seine eigenen vorherigen Fehler und lernt, sie im laufenden Betrieb zu korrigieren, während ein „Dirigent“ (ein KI-Planer) ihm genau sagt, welche Wörter er als Nächstes sagen soll.
Das Ergebnis ist ein digitaler Avatar, der Video und Audio gleichzeitig mit 27,12 Bildern pro Sekunde (FPS) generieren kann. Um das einzuordnen: Standardvideo spielt mit 24 FPS ab, was bedeutet, dass dieser Roboter tatsächlich schneller als Echtzeit ist! Er kann sein Gesicht so halten, dass es wie dieselbe Person aussieht, seine Lippen perfekt im Einklang mit seinen Worten bewegen und seine Stimme fast zwei Minuten lang klar und präzise halten. Die Forscher fanden heraus, dass der Roboter ohne einen spezifischen „Planungsschritt“, um zu entscheiden, was er als Nächstes sagen soll, verwirrt wäre und anfangen würde, Kauderwelsch zu sprechen oder sich zu wiederholen. Durch das Hinzufügen dieses Planers löst das System erfolgreich das Rätsel, wie man ein langes Gespräch flüssig gestaltet, ohne die Zukunft sehen zu müssen. Es beweist, dass man einen leistungsstarken, langsamen Roboter, der alles über eine Geschichte weiß, in einen schnellen, Live-Performer verwandeln kann, der gerade genug weiß, um die Show Sekunde für Sekunde am Laufen zu halten.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.