← Neueste Arbeiten
💻 computer science

Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation

Die Arbeit stellt Hallo-Live vor, ein Echtzeit-Streaming-Framework zur gemeinsamen Audio-Video-Avatar-Generierung, das durch asynchrone Dual-Stream-Diffusion mit Future-Expanding Attention und Human-Centric Preference-Guided DMD eine Hochgeschwindigkeits- und Niedriglatenz-Leistung erreicht und bestehende Modelle sowohl in Bezug auf Effizienz als auch auf Generierungsqualität deutlich übertrifft.

Ursprüngliche Autoren: Chunyu Li, Jiaye Li, Ruiqiao Mei, Haoyuan Xia, Hao Zhu, Jingdong Wang, Siyu Zhu

Veröffentlicht 2026-04-28
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Chunyu Li, Jiaye Li, Ruiqiao Mei, Haoyuan Xia, Hao Zhu, Jingdong Wang, Siyu Zhu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie möchten einen digitalen Charakter (einen Avatar) erstellen, der spricht und die Lippenbewegungen perfekt mit dem synchronisiert, was Sie eingeben. Normalerweise ist die Erstellung solcher Charaktere wie der Versuch, einen komplexen Kuchen zu backen: Es dauert lange, und wenn Sie versuchen, den Prozess zu beschleunigen, fällt der Kuchen oft flach oder schief aus.

Die Arbeit stellt Hallo-Live vor, ein neues System, das die Erstellung dieser sprechenden Avatare so schnell macht wie das Senden einer Textnachricht, ohne die Qualität zu beeinträchtigen. So funktioniert es, unter Verwendung einfacher Analogien:

1. Das Problem: Der „blinde" Schauspieler

In früheren Systemen agiert der Computer wie ein Schauspieler, dem strengstens verboten ist, das Drehbuch zu lesen, bis genau der Moment kommt, in dem er sprechen muss.

  • Das Problem: Im echten Leben beginnen unsere Lippen, sich zu bewegen, bevor der Ton tatsächlich aus unserem Mund kommt. Wir bereiten uns auf den nächsten Laut vor.
  • Der alte Weg: Da die alten Computermodelle nicht in die nächsten paar Worte „spähen" konnten, hinkten die Lippen des Avatars hinter der Stimme her, wirkten roboterhaft und waren nicht synchron.
  • Das Geschwindigkeitsproblem: Damit der Avatar gut aussah, musste der Computer normalerweise eine massive Menge an Mathematik für jede Sekunde Video berechnen. Dies war für einen Echtzeit-Chat zu langsam.

2. Die Lösung: Der „Zukunft lesende" Schauspieler

Hallo-Live löst das Verzögerungsproblem mit einem Trick namens Future-Expanding Attention (Erweiternde Aufmerksamkeitsmechanik für die Zukunft).

  • Die Analogie: Stellen Sie sich den Avatar als einen Schauspieler vor, dem erlaubt ist, während er den aktuellen Satz spricht, einen Blick auf den nächsten Satz im Drehbuch zu werfen.
  • Wie es funktioniert: Das System gewährt dem Videoteil des Gehirns ein winziges „Vorausblick"-Fenster. Es sieht das aktuelle Audio und die nächsten paar kommenden Laute. Dies ermöglicht es dem Avatar, die Lippen in Vorwegnahme des nächsten Lautes zu bewegen, genau wie ein Mensch. Dies lässt die Lippen-Synchronisation natürlich und unmittelbar wirken, obwohl das System dennoch in „Echtzeit" läuft.

3. Der Geschwindigkeitsschub: Der „destillierte" Schüler

Um das System schnell genug für den sofortigen Betrieb zu machen, verwendeten die Forscher eine Technik namens Destillation.

  • Die Analogie: Betrachten Sie das ursprüngliche, hochwertige Modell als einen Meisterkoch, der 2 Stunden benötigt, um eine perfekte Mahlzeit zuzubereiten. Das neue Modell ist ein Schülerkoch.
  • Das Problem: Normalerweise, wenn man einen Schüler anweist, so schnell wie der Meister zu kochen, hetzt er und macht Fehler (das Essen schmeckt fade oder sieht unordentlich aus).
  • Die Lösung (Mensch-zentrierte Präferenz): Anstatt dem Schüler nur zu sagen „kopiere den Meister", gaben die Forscher dem Schüler ein Geschmackstest-Panel.
    • Sie sagten nicht nur: „Lass es aussehen wie beim Meister."
    • Sie sagten: „Stelle sicher, dass das Gesicht realistisch aussieht (Visuelle Glaubwürdigkeit)", „Stelle sicher, dass die Stimme natürlich klingt (Sprachnaturalität)" und „Stelle sicher, dass die Lippen mit den Worten übereinstimmen (Synchronisation)".
    • Wenn das Kochen des Schülers bei diesen spezifischen menschlichen Präferenzen hoch bewertet wird, erhält er eine „Belohnung". Wenn es roboterhaft oder unsynchron aussieht, erhält er eine niedrigere Bewertung.
    • Dies lehrt den Schüler, schnell zu sein, ohne die Dinge zu opfern, die Menschen am meisten schätzen.

Die Ergebnisse: Ein Zaubertrick

Die Arbeit behauptet, dass auf leistungsstarken Computerchips (NVIDIA H200 GPUs) dieses neue System Folgendes erreicht:

  • Geschwindigkeit: Es generiert Video mit 20,38 Bildern pro Sekunde. Das ist schnell genug für ein Live-Gespräch.
  • Verzögerung: Es dauert nur 0,94 Sekunden, bis es startet. Das ist weniger als eine Sekunde Wartezeit.
  • Vergleich: Es ist 16-mal schneller und 99-mal weniger verzögert als der vorherige „Meisterkoch" (das Ovi-Modell), produziert jedoch dennoch hochwertiges Video, bei dem sich die Lippen perfekt mit der Stimme bewegen.

Was es leisten kann

Die Arbeit zeigt, dass dieses System in verschiedenen Szenarien gut funktioniert:

  • Realistische Menschen: Erstellung fotorealistischer Porträts von sprechenden Personen.
  • Cartoons: Erstellung stilisierter, animierter Charaktere.
  • Gruppen: Bewältigung von Szenen, in denen zwei Personen miteinander sprechen.
  • Verschiedene Winkel: Funktioniert für Nahaufnahmen von Gesichtern oder Ganzkörperaufnahmen.

Kurz gesagt, ist Hallo-Live wie einem digitalen Schauspieler ein Drehbuch zu geben, auf das er vorausblicken darf, und eine Reihe strenger Geschmackstester, die sicherstellen, dass er seine Performance nicht überstürzt, was zu einem sprechenden Avatar führt, der lebendig wirkt und sofort reagiert.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →