← Neueste Arbeiten
🤖 AI

ReWorld: An Interactive World Model with Long-Horizon Memory

ReWorld ist ein interaktives Weltmodell, das die strukturelle Spannung zwischen kurzfristiger Steuerung und langfristigem Gedächtnis auflöst, indem es diese Fähigkeiten während des Trainings durch gemischte Aufmerksamkeitsmechanismen trennt und sie bei der Inferenz über ein Pose-indiziertes Landmark-Retrieval-System vereinheitlicht, wodurch eine überlegene Aktionsfidelität, Videoqualität und minutenlange zeitliche Konsistenz über diverse visuelle Domänen hinweg erreicht wird.

Ursprüngliche Autoren: Zhifei Chen, Luozhou Wang, Guibao Shen, Dongyu Yan, Shuai Yang, Tianshuo Xu, Yihua Du, Wei Wang, Tianyi Gui, Lianghua Huang, Yingcong Chen

Veröffentlicht 2026-08-25
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Zhifei Chen, Luozhou Wang, Guibao Shen, Dongyu Yan, Shuai Yang, Tianshuo Xu, Yihua Du, Wei Wang, Tianyi Gui, Lianghua Huang, Yingcong Chen

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich einen Computer vor, der ein Video beobachten und dann vorhersagen kann, was als Nächstes passiert, Frame für Frame, als würde er im Inneren der Szene leben. Dies ist das Versprechen eines „Weltmodells“, einer Art künstlicher Intelligenz, die darauf ausgelegt ist, Umgebungen zu simulieren, in denen ein Agent sich bewegen und agieren kann. Damit sich diese Systeme wirklich lebendig anfühlen, müssen sie drei schwierige Dinge gleichzeitig leisten: Sie müssen sofort auf die Befehle eines Benutzers reagieren, sie müssen sich genau daran erinnern, wie ein Ort aussah, als der Benutzer ihn verließ und zu ihm zurückkehrte, und sie müssen in Echtzeit neue Videos generieren, ohne dass ihnen der Speicher ausgeht. Die Herausforderung bestand darin, dass sich diese Ziele oft gegenseitig bekämpfen. Um schnell zu reagieren, muss sich ein System nur auf die unmittelbare Vergangenheit konzentrieren, aber um einen fernen Ort zu erinnern, muss es eine gewaltige Historie festhalten. Wenn ein System versucht, beides mit demselben einfachen Ansatz zu erreichen, scheitert es meist an einem von beiden – entweder vergisst es die Vergangenheit oder stolpert über die Gegenwart.

Forscher haben nun ein System namens ReWorld entwickelt, das diese Spannung löst, indem es den Computer lehrt, gleichzeitig auf zwei verschiedene Arten zu denken. Das Team, das mit Institutionen in Hongkong und Alibaba zusammenarbeitete, erschuf ein Modell, das in der Lage ist, den Kamerabewegungen eines Benutzers zu folgen, hochqualitative Videos von fotorealistischen und spielartigen Welten zu streamen und sich an spezifische Szenen von vor Minuten zu erinnern, selbst nachdem die Kamera weit weggefahren ist und wieder zurückgekehrt ist. Die entscheidende Entdeckung ist, dass das System sich nicht zwischen kurzfristiger Reaktion und Langzeitgedächtnis entscheiden muss; stattdessen trennt es diese Aufgaben während des Lernprozesses und verwaltet sie dann sorgfältig, wenn es tatsächlich läuft.

Der Kern von ReWorlds Erfolg liegt darin, wie es seine Aufmerksamkeit organisiert. In vielen Modellen der künstlichen Intelligenz betrachtet das System alle Informationen, die es bisher gesehen hat, um zu entscheiden, was als Nächstes generiert werden soll. ReWorld teilt diese Aufgabe auf verschiedene Teile seines Gehirns auf. Einige Teile sind darauf trainiert, nur auf die ganz unmittelbare Vergangenheit zu schauen, vielleicht die letzten paar Sekunden, um sicherzustellen, dass ein Tastendruck zu einer sofortigen und präzisen Kamerabewegung führt. Andere Teile sind darauf trainiert, die gesamte Historie des Videos zu betrachten, was es dem System ermöglicht, zu erkennen, dass eine bestimmte Felsformation oder ein Gebäude, das es vor langer Zeit gesehen hat, dasselbe ist, das es jetzt wieder sieht. Entscheidend ist, dass die Forscher diese Aufgaben nicht festen Teilen des Systems zugewiesen haben. Stattdessen haben sie die Rollen während des Trainings zufällig vertauscht, um sicherzustellen, dass jeder Teil des Systems gelernt hat, sowohl unmittelbare Reaktionen als als auch ferne Erinnerungen zu handhaben. Dies verhindert, dass das System von einer spezifischen Art des Blickens auf die Vergangenheit abhängig wird, was wichtig ist, da das System in der realen Welt seine gesamte Historie nicht ewig im Speicher halten kann.

Wenn das System zum Einsatz kommt, sieht es sich mit einer strengen Grenze konfrontiert, wie viele Informationen es in einem Moment halten kann. Um dies zu bewältigen, nutzt ReWorld ein kluges Ablagesystem. Während das Video spielt, behält es ein kleines, ständig aktualisiertes Fenster der jüngsten Frames bei. Wenn ältere Frames aus diesem Fenster herausfallen, werden sie nicht einfach gelöscht. Stattdessen prüft das System, ob die Kamera sich weit genug bewegt hat, um die Speicherung eines Schnappschusses dieses Ortes zu rechtfertigen. Wenn dies der Fall ist, speichert das System ein hochwertiges „Landzeichen“ (Landmark) dieser Szene. Diese Landzeichen werden in einer separaten, begrenzten Bank gespeichert. Wenn die Kamera sich umdreht und zu einem Ort zurückkehrt, den sie zuvor besucht hat, durchsucht das System diese Bank nach dem Landzeichen, das der aktuellen Ansicht entspricht, und zieht es zurück in das aktive Gedächtnis. Dies ermöglicht es dem System, sich an eine Szene von vor einer Minute zu erinnern, ohne dafür jeden einzelnen Frame speichern zu müssen, der dazwischen lag.

Um dies zu ermöglichen, mussten die Forscher das Modell mit einer sehr spezifischen Art von Daten lehren. Sie kombinierten Aufnahmen aus realen Videos, Videospielen und computergenerierten Umgebungen, taten aber etwas Ungewöhnliches: Sie stellten sicher, dass ein einzener Befehl, wie das Drücken einer Taste, um vorwärts zu bewegen, in jeder Art von Material exakt die gleiche physische Distanz bewegt. Dies schuf eine einheitliche Sprache der Bewegung. Sie verwendeten auch eine spezielle Trainingstechnik, bei der sie manchmal Teile der Videohistorie vor dem Modell verbargen, was es zwang, die Szene auch dann zu rekonstruieren, wenn das Gedächtnis unvollständig war. Dies bereitete das Modell auf die Realität seines begrenzten Speicherbanks vor und stellte sicher, dass es nicht verwirrt würde, wenn es auf einige wenige Schlüssel-Landzeichen statt auf einen kontinuierlichen Datenstrom angewiesen war.

Die Ergebnisse dieses Ansatzes sind beeindruckend. In Tests, bei denen die Kamera sich entfernte und dann zum Ausgangspunkt zurückkehrte, konnte ReWorld die ursprüngliche Ansicht mit bemerkenswerter Genauigkeit regenerieren, selbst nachdem die Kamera eine Minute oder länger unterwegs gewesen war. Andere Systeme, die sich auf ein einfaches gleitendes Fenster der jüngsten Frames verlassen, konnten den Ausgangspunkt nicht mehr erinnern, sobald dieser aus dem Fenster gefallen war. ReWorld erwies sich auch als überlegen beim Folgen von Befehlen, wobei sich die Kamera exakt wie beabsichtigt bewegte, ohne vom Kurs abzuweichen. Das System kann Videos mit einer Auflösung von 704 mal 1280 Pixeln generieren, schnell genug, um interaktiv zu wirken, und es behält diese Qualität über verschiedene Stile hinweg bei, von realistischen Landschaften bis hin zu stilisierten Spielwelten.

Die Forscher fanden heraus, dass ihre Methode funktioniert, weil sie die unterschiedlichen Bedürfnisse von Kontrolle und Gedächtnis respektiert. Indem sie das System darauf trainierten, kurzfristige Befehle und langfristige Erinnerung separat zu handhaben, und indem sie ein intelligentes Abrufsystem verwendeten, um alte Erinnerungen nur bei Bedarf zurückzubringen, schufen sie ein Weltmodell, das sich sowohl reaktionsschnell als auch konsistent anfühlt. Das System muss keine massive, allwissende Entität sein, um sich an die Vergangenheit zu erinnern; es muss nur wissen, wie es das richtige Stück der Vergangenheit findet, wenn es benötigt wird. Dieser Ansatz ermöglicht es dem Modell, auf Standard-Computerhardware zu laufen und dabei ein Maß an Kontinuität zu wahren, das zuvor für die interaktive Videogenerierung unmöglich war. Die Arbeit legt nahe, dass die Zukunft der interaktiven KI nicht nur darin liegt, Modelle größer zu machen, sondern sie klüger darin zu machen, wie sie die bereits gelerten Informationen organisieren und darauf zugreifen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →