From Dense Prediction to Visual Editing: Structured Supervision for Unified Image and Video Creation
Dieses Paper schlägt ein einheitliches Framework zur Erstellung von Bildern und Videos vor, das durch die Einbeziehung von Tiefen- und Oberflächennormalen-Vorhersage als strukturierte visuelle Überwachung innerhalb eines gemeinsamen multimodalen Diffusion-Transformer-Backbones eine präzise, zeitlich konsistente Bearbeitung verbessert und dadurch nützliches Strukturwissen auf nachgelagerte Generierungsaufgaben überträgt.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich eine Welt vor, in der ein Computer nicht nur ein Bild aus einer Beschreibung malen kann, sondern auch ein bestehendes Video nehmen und ein spezifisches Detail ändern kann – etwa einen Regentag in einen sonnigen Tag zu verwandeln oder einen rennenden Hund hinzuzufügen – ohne den Rest der Szene zu verändern oder das Video flackern zu lassen. Dies ist das Versprechen der vereinheitlichten visuellen Erstellung, einem Bereich, in dem künstliche Intelligenz lernt, sowohl Bilder als auch Videos aus einer einzigen Gruppe von Anweisungen zu generieren und zu bearbeiten. Damit diese Systeme gut funktionieren, müssen sie nicht nur die Bedeutung von Wörtern wie „füge einen Hund hinzu“ verstehen, sondern auch die physische Struktur der Szene: wo Objekte sind, wie sie sich überlagern und wie sie sich durch die Zeit bewegen. Ohne dieses strukturelle Verständnis könnte der Computer zwar der Anweisung folgen, einen Hund hinzuzufügen, aber versehentlich die Person löschen, die daneben steht, oder das neue Tier im Laufe des Videos ein- und ausflackern lassen. Die Herausforderung besteht darin, einem einzelnen Modell beizubringen, vielfältige Befehle zu befolgen und gleichzeitig die zugrunde liegende Geometrie und Identität der visuellen Welt intakt zu halten.
Forscher haben einen neuen Ansatz entwickelt, der den Computer lehrt, die Welt dreidimensional zu sehen, während er sie erschafft. Anstatt dem Modell lediglich Paare von Bildern oder Videos zu zeigen und es zu bitten, die Änderungen zu erraten, fügte das Team eine neue Trainingsebene hinzu. Sie baten das Modell, zwei spezifische Dinge über jedes verarbeitete Bild vorherzusagen: die Tiefe der Szene, die angibt, wie weit Objekte entfernt sind, und die Oberflächennormalen, die beschreiben, in welche Richtung eine Oberfläche zeigt, wie etwa die Neigung einer Wand oder die Krümmung eines Balls. Diese Vorhersagen sind nicht das endgültige Ziel; die Forscher versuchen nicht, den besten 3D-Scanner zu bauen. Stattdessen nutzen sie diese Aufgaben als eine Möglichkeit, das Modell dazu zu zwingen, der verborgenen Skelettstruktur des Bildes Aufmerksamkeit zu schenken. Durch das Erlernen der Rekonstruktion dieser Strukturkarten gewinnt das Modell ein besseres Verständnis dafür, wo Grenzen liegen und wie Objekte miteinander in Beziehung stehen, was ihm hilft, diese Details zu bewahren, wenn es später angewiesen wird, den Inhalt zu bearbeiten.
Um dies umsetzbar zu machen, baute das Team ein System, das die Bedeutung eines Befehls von den visuellen Belegen trennt, denen er folgen muss. Ein Teil des Systems liest die Textanweisungen und versteht die Absicht, während ein anderer Teil die tatsächlichen Pixel des Quellbildes oder -videos betrachtet, um die räumlichen Details scharf zu halten. Diese beiden Informationsströme werden in einem gemeinsamen Gehirn kombiniert, das lernt, neue Inhalte zu generieren. Entscheidend ist, dass die Forscher auch eine spezielle Methode zur Generierung von Trainingsdaten entwickelt haben. Anstatt lediglich das erste Frame eines Videos zu bearbeiten und diese Änderung nach vorne zu kopieren, was oft zu Fehlern führt, brachten sie dem System bei, Videopaare zu generieren, in denen die Änderung zu unterschiedlichen Zeiten stattfindet. Ein Video zeigt vielleicht eine Szene, und das zugehörige Video zeigt dieselbe Szene mit einer Änderung, die in der Mitte beginnt oder vor dem Ende des Clips abgeschlossen ist. Dies lehrt das Modell genau, wann und wo eine Änderung anzuwenden ist, wodurch sichergestellt wird, dass der Rest des Videos stabil und konsistent bleibt.
Die Ergebnisse dieses Ansatzes zeigen, dass das Hinzufügen dieser strukturellen Lektionen die Qualität der Bearbeitungen signifikant verbessert. Bei Tests auf einem Standarddatensatz für Videobearbeitungsaufgaben erzielte das Modell, das dieses zusätzliche Training erhielt, höhere Werte als bisherige Systeme, insbesondere bei Aufgaben, die das Hinzufügen oder Ändern lokaler Objekte erforderten, ohne den Hintergrund zu stören. Die Verbesserung war am deutlichsten bei der Fähigkeit, die unbearbeiteten Teile des Videos natürlich und stabil zu halten. Die Forscher fanden heraus, dass diese Methode über ein breites Spektrum an Aufgaben hinweg gut funktionierte, von der Erstellung neuer Videos von Grund auf bis hin zur Bearbeitung bestehender Videos basierend auf Textanweisungen oder Referenzbildern. Sie demonstrierten, dass ein einzelnes Modell all diese verschiedenen Aufgaben bewältigen kann und dabei eine hohe Gesamtpunktzahl erreicht, die andere derzeit verfügbare vereinheitlichte Systeme übertrifft.
Dennoch sind die Forscher vorsichtig dabei, die Grenzen ihres Erfolgs zu definieren. Sie stellen explizit klar, dass ihr Ziel nicht darin bestand, ein überlegenes Werkzeug zur Messung von Tiefe oder Oberflächenwinkeln zu schaffen, und sie haben ihr Modell nicht auf diese spezifischen Aufgaben getestet. Der Wert der Tiefen- und Normalen-Vorhersagen liegt ausschließlich darin, wie sie den Erstellungsprozess unterstützen, und nicht in der Genauigkeit der Karten selbst. Die Studie legt nahe, dass dieser Transfer strukturellen Wissens real und messbar ist, behauptet jedoch nicht, dass das Modell ein allgemeines Verständnis der physischen Welt erlangt hat. Das System hat immer noch Schwierigkeiten mit sehr langen Videos, in denen Charaktere driften oder ihr Aussehen verändern können, und es kann Probleme mit sehr kleinen Objekten oder bei Konflikten zwischen mehreren Referenzen haben. Die Arbeit stellt einen bedeutenden Schritt in Richtung zuverlässigerer visueller Bearbeitung dar und zeigt, dass das Lehren eines Modells über die Struktur einer Szene es zu einem besseren Künstler macht, auch wenn der Künstler noch kein perfekter Architekt ist.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.