← Neueste Arbeiten
💻 computer science

UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos

UniSwap ist ein neuartiges Framework, das durch die Nutzung eines einzelnen Diffusion-Transformers mit einer Swap-and-Reconstruct-Trainingspipeline sowie effizienten Sampling-Techniken den ersten streamingbasierten, gemeinsamen audio-visuellen Identitätsersatz in sprechenden Videos ermöglicht, um eine synchronisierte, konsistente und stabile Langzeitgenerierung zu erreichen.

Ursprüngliche Autoren: Yuxuan Zhang, Haozhong Xiong, Jiayi Song, Jinpeng Yu, Yang Shi, Jiaming Liu, Ruihua Huang, Liwei Wang

Veröffentlicht 2026-08-13
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Yuxuan Zhang, Haozhong Xiong, Jiayi Song, Jinpeng Yu, Yang Shi, Jiaming Liu, Ruihua Huang, Liwei Wang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie schauen einen Film, aber der Schauspieler auf dem Bildschirm beginnt plötzlich, mit einer anderen Stimme zu sprechen und wie eine völlig andere Person auszusehen, während er dennoch exakt dieselben Worte sagt und seine Lippen perfekt im Takt bewegt. Dies ist der Traum des „Identitätsaustauschs“ in sprechenden Videos. Lange Zeit waren Computer gut darin, nur einen Teil dieses Tricks auszuführen: entweder das Gesicht einer Person zu ändern, während die ursprüngliche Stimme beibehalten wird, oder eine Stimme zu ändern, während das ursprüngliche Gesicht beibehalten wird. Aber der Versuch, beides gleichzeitig zu tun, war wie der Versuch, zwei verschiedene Bälle zu jonglieren, während man auf einem Einrad fährt; die Ergebnisse waren oft nicht synchron, wobei sich die Lippen zu den falschen Worten bewegten oder die Stimmen roboterhaft klangen. Dieses Paper taucht in die Welt der generativen KI ein und untersucht speziell, wie wir Computer lehren können, sowohl das Aussehen als auch die Stimme einer Person gleichzeitig zu tauschen, in Echtzeit, ohne dass das Video ruckelt oder der Ton hinterherhinkt.

Die Forscher hinter diesem Projekt, UniSwap, haben ein neues System entwickelt, das wie ein meisterhafter Puppenspieler fungiert, der die Fäden für die visuelle und die Audio-Seite eines Videos im exakt gleichen Moment zieht. Anstatt zwei separate Werkzeuge zu verwenden – eines für das Gesicht und eines für die Stimme – haben sie ein einziges „Gehirn“ erschaffen, das versteht, wie sich das Gesicht einer Person bewegt und wie die Stimme klingt, als wäre es eine zusammenhängende Erfahrung. Stellen Sie es sich wie einen zweisprachigen Übersetzer vor, der nicht nur Wörter übersetzt, sondern auch den Akzent und die Mimik des Sprechers sofort erfasst.

Das Paper stellt eine clevere Methode vor, um dieses System zu trainieren. Da es fast unmöglich ist, echte Videos derselben Person zu finden, die dieselben Zeilen spricht, während sie wie zwei verschiedene Personen aussieht und klingt, hat das Team ein „Swap-and-Reconstruct“-Spiel erfunden. Sie nehmen ein echtes Video, entfernen digital das Gesicht und die Stimme der Person, um eine „Geisterversion“ zu erstellen, und bitten die KI dann, das ursprüngliche Video unter Verwendung eines neuen Gesichts und einer neuen Stimme als Leitfaden wieder aufzubauen. Es ist, als würde man einem Koch eine leere Leinwand und ein Rezept geben und ihn dann bitten, ein bestimmtes Gericht perfekt nachzubilden. Durch das Training an Millionen dieser „Rekonstruktionen“ lernt die KI, Identitäten zu tauschen, während die ursprünglichen Bewegungen und der Hintergrund intakt bleiben.

Was dieses Projekt wirklich besonders macht, ist, dass es wie ein Livestream funktioniert und nicht wie ein langsamer, voraufgezeichneter Film. Die meisten Videogeneratoren müssen den gesamten Clip anschauen, bevor sie mit dem Zeichnen des ersten Rahmens beginnen können, was zu langsam für eine interaktive Nutzung ist. UniSwap hingegen generiert das Video in kleinen Blöcken, wie ein Förderband, was es ermöglicht, etwa 13,6 Frames pro Sekunde auf einem leistungsstarken Grafikchip (einem NVIDIA H100) zu produzieren. Obwohl dies noch nicht ganz schnell genug für eine sofortige Echtzeit-Interaktion ist, stellt es einen massiven Sprung dar, da das System lange Videos von bis zu einer Stunde Länge erzeugen kann, ohne dass das Gesicht oder die Stimme des Charakters über die Zeit auseinanderdriften oder verzerrt werden. Die Autoren fanden heraus, dass die KI durch einen speziellen „Gedächtnistrick“ namens Feature-RoPE Decomposition die ursprüngliche Identität beibehalten kann, selbst nachdem sie tausende von Frames generiert hat, wodurch sichergestellt wird, dass der Charakter vom ersten bis zum letzten Moment konsistent bleibt.

Kurz gesagt legt UniSwap nahe, dass wir endlich ein einheitliches System haben können, das sowohl das Aussehen als auch die Stimme in sprechenden Videos mit hoher Synchronisation und Stabilität austauscht. Während die aktuelle Version noch nicht ganz schnell genug für eine live geführte Echtzeit-Konversation ist (sie ist etwas langsamer als die Geschwindigkeit einer Standard-Videowiedergabe), beweist sie, dass ein einzelnes Modell beide Aufgaben gemeinsam besser bewältigen kann, als zwei separate Systeme zusammenzuflicken. Die Ergebnisse zeigen, dass die Lippenbewegungen perfekt mit der neuen Stimme synchron bleiben und die Identität des Charakters selbst in langen Clips stabil bleibt, was einen vielversprechenden Schritt in Richtung natürlicherer und interaktiverer digitaler Avatare darstellt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →