← Neueste Arbeiten
💻 computer science

Many-for-Many: Unify the Training of Multiple Video and Image Generation and Manipulation Tasks

Dieses Paper stellt „Many-for-Many“ vor, ein einheitliches Framework, das leichte Adapter und eine gemeinsame Bild-Video-Lernstrategie einsetzt, um ein einzelnes Foundation-Modell zu trainieren, das in der Lage ist, über zehn verschiedene visuelle Generierungs- und Manipulationsaufgaben auszuführen, wobei eine wettbewerbsfähige Leistung erzielt wird, während gleichzeitig Daten aus mehreren Quellen genutzt werden, um die hohen Kosten der aufgabenspezifischen Trainings zu überwinden.

Ursprüngliche Autoren: Ruibin Li, Tao Yang, Yangming Shi, Weiguo Feng, Shilei Wen, Bingyue Peng, Lei Zhang

Veröffentlicht 2026-02-06
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Ruibin Li, Tao Yang, Yangming Shi, Weiguo Feng, Shilei Wen, Bingyue Peng, Lei Zhang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie besitzen eine riesige Bibliothek mit Anweisungen zur Erstellung von Kunst. Einige Anweisungen lauten: „Zeichne eine Katze“, andere sagen: „Verwandle dieses Foto einer Katze in ein Video“ und einige sagen: „Repariere die unscharfen Teile dieses Videos“ oder „Koloriere diesen Schwarz-Weiß-Film“.

Normalerweise benötigt man für all diese Dinge einen anderen Spezialisten für jeden einzelnen Job. Sie brauchen einen „Text-zu-Video“-Koch, einen „Bild-zu-Video“-Koch und einen „Video-Editing“-Koch. Jeden dieser Köche von Grund auf neu auszubilden, ist unglaublich teuer und erfordert riesige Mengen an hochwertigen Zutaten (Daten).

Hier kommt „Many-for-Many“ (MfM) ins Spiel.

Die Autoren dieser Arbeit haben einen „Super-Chef“ gebaut, der all diese Jobs gleichzeitig erledigen kann. Anstatt zehn verschiedene Spezialisten einzustellen, haben sie ein einziges Modell trainiert, das über 10 verschiedene Arten von visuellen Aufgaben bewältigen kann – von der Erstellung von Videos aus dem Nichts bis hin zur Bearbeitung bestehender Videos.

Hier ist, wie sie es gemacht haben, unter Verwendung einfacher Analogien:

1. Der universelle Adapter (Der „Schweizer Taschenmesser-Griff“)

Verschiedene Aufgaben erfordern unterschiedliche „Inputs“.

  • Text-zu-Video: Sie geben ihm einen Satz.
  • Bild-zu-Video: Sie geben ihm ein Bild.
  • Video-Editing: Sie geben ihm ein Video mit einer „Maske“ (einer Schablone, die zeigt, welche Teile geändert werden sollen).

Normalerweise sind diese Inputs wie Puzzleteile mit unterschiedlichen Formen, die nicht in dasselbe Loch passen. Das MfM-Team hat einen leichten Adapter entwickelt. Denken Sie an dies als einen universellen Griff oder ein Schweizer Taschenmesser-Zubehörteil. Er nimmt den Text, das Bild, das Video, die Maske und sogar eine Tiefenkarte (eine Blaupause des 3D-Raums, wie eine topografische Karte der Szene) und formt sie alle in dasselbe Format um. Dies ermöglicht es dem Modell, jede Anweisung zu verstehen, egal in welcher Form sie kommt.

2. Die „Joint Learning“-Strategie (Die „Lehrlings-Methode“)

Ein Video-KI von Grund auf neu zu trainieren, ist normalerweise so, als würde man versuchen, jemandem beizubringen, einen Marathon zu laufen, bevor er laufen kann. Es erfordert Millionen von teuren Videobeispielen.

MfM nutzt einen cleveren Trainings-Trick namens Joint Image-Video Learning.

  • Phase 1: Sie beginnen damit, das Modell mit einfachen „Bild“-Aufgaben zu unterrichten (wie das Zeichnen eines Bildes aus einem Text). Das ist günstig und einfach.
  • Phase 2: Sie führen langsam „Video“-Aufgaben ein.
  • Die Magie: Da das Modell die Grundlagen des „Visuellen“ durch die Bilder gelernt hat, muss es nicht so viele teure Videobeispiele verwenden, um zu lernen, wie man Dinge in Bewegung setzt. Es ist wie ein Lehrling, der zuerst lernt, Gemüse zu hacken (Bilder); wenn er dann zum Kochen eines Eintopfs (Video) übergeht, weiß er bereits, wie man mit den Zutaten umgeht.

Das bedeutet, dass sie ein leistungsstarkes Modell mit 8 Milliarden Parametern unter Verwendung von nur 10 % der Videodaten trainieren konnten, die andere Top-Modelle verwenden.

3. Das „3D RoPE“ (Das GPS für Zeit und Raum)

Damit Videos natürlich aussehen, muss das Modell nicht nur verstehen, wo Dinge sind (links, rechts, oben, unten), sondern auch, wann sie passieren (erster Frame, letzter Frame).
Das Team hat das interne „GPS“ des Modells (genannt 3D RoPE) aufgerüstet. Anstatt nur die Position eines Pixels auf einem flachen Bildschirm zu kennen, versteht das Modell nun die Position im 3D-Raum und durch die Zeit hindurch. Dies hilft dem Modell, flüssige, realistische Bewegungen zu erzeugen, anstatt ruckartige, unnatürliche.

4. Die Ergebnisse: Ein Modell, viele Superkräfte

Das Team testete diesen „Super-Chef“ in zwei Größen: einer kleineren 2-Milliarden-Version und einer größeren 8-Milliarden-Version.

  • Vielseitigkeit: Das Modell kann über 10 verschiedene Aufgaben ausführen, darunter:
    • Kreation: Verwandlung von Text in Video oder Bildern in Video.
    • Erweiterung: Einen kurzen Clip nehmen und ihn länger machen.
    • Bearbeitung: Objekte entfernen (Inpainting), neue Szenarien hinzufügen (Outpainting) oder Farben ändern.
    • Verbesserung: Unscharfe Videos scharf machen (Super-Resolution).
  • Leistung: In direkten Tests gegen berühmte Modelle (wie Wan2.1, Hunyuan und sogar kommerzielle Giganten wie Sora) war das MfM-Modell äußerst wettbewerbsfähig. Es belegte oft Platz 1 oder 2 in Bezug auf die Gesamtkonsistenz und die Bewegungsqualität, obwohl es deutlich weniger Daten verwendete.

Das Fazit

Die Arbeit behauptet, dass sie durch die Vereinheitlichung des Trainingsprozesses und die Verwendung eines smarten „Adapters“ zur Mischung verschiedener Arten von Daten ein einziges, effizientes Modell geschaffen haben, das genauso gut (und manchmal besser) ist als spezialisierte Modelle, die nur für einen spezifischen Job trainiert wurden. Sie haben bewiesen, dass man nicht für jeden Job ein separates Werkzeug braucht, wenn man ein vielseitiges Werkzeug baut, das von einer breiten Palette an Erfahrungen lernt.

Was die Arbeit nicht behauptet:
Die Arbeit konzentriert sich strikt auf das technische Training und die Leistung des Modells bei Standard-Benchmarks. Sie behauptet nicht, spezifische klinische Probleme gelöst zu haben, noch beschreibt sie spezifische zukünftige kommerzielle Produkte über die Open-Source-Veröffentlichung des Codes und der Modellgewichte hinaus. Es ist ein grundlegender Forschungsschritt, keine fertige Konsumenten-App.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →