← Neueste Arbeiten
💬 NLP

GS-Agent: Creating 4D Physical Worlds With Generative Simulation

GS-Agent führt ein End-to-End-Multi-Agenten-Framework ein, das Foundation-Modelle und Physik-Engines nutzt, um durch die Emulation menschenähnlicher Arbeitsabläufe für Asset-Management, Materialabstimmung, Bewegungssteuerung und Rendering automatisch dynamische, physikalisch plausible und steuerbare 4D-Welten aus natürlichen Sprachbeschreibungen zu generieren.

Ursprüngliche Autoren: Hongxin Zhang, Chunru Lin, Junyan Li, Zhou Xian, Tsun-Hsuan Wang, Chuang Gan

Veröffentlicht 2026-07-24
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Hongxin Zhang, Chunru Lin, Junyan Li, Zhou Xian, Tsun-Hsuan Wang, Chuang Gan

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, eine Filmszene zu erstellen, in der ein Basketball von einem Trampolin abprallt, in einen Pool springt und dann wegrollt. In der realen Welt passiert Physik einfach so. Die Schwerkraft zieht, Wasser spritzt und der Ball springt, weil die Materie so funktioniert. Aber in der digitalen Welt der Computer ist es ein Albtraum, Dinge realistisch zu bewegen. Traditionell bräuchten Sie ein Team von Künstlern und Ingenieuren, die jeden einzelnen Wassertropfen und jeden Sprung manuell anpassen, was ewig dauert. In letzter Zeit sind Computer sehr gut darin geworden, Bilder und Videos zu „träumen“, aber diese digitalen Träumer bekommen die Physik oft falsch hin. Sie lassen vielleicht einen Ball wie ein Geist schweben oder verwandeln Wasser in festes Glas, weil sie nur raten, wie die nächsten Pixel aussehen sollten, anstatt tatsächlich zu berechnen, wie die Welt funktioniert. Wissenschaftler haben versucht, diese Lücke zu schließen: Wie bringen wir einem Computer bei, nicht nur so auszusehen wie eine echte Welt, sondern sich auch so zu verhalten, während wir ihm gleichzeitig erlauben, einen einfachen Satz einzutippen, um ihm zu sagen, was er tun soll?

Hier kommt GS-Agent ins Spiel, ein neues System, das wie eine superintelligente, automatisierte Filmcrew für die Erstellung von 4D-Welten fungiert (was im Grunde 3D-Welten sind, die sich durch die Zeit bewegen). Anstatt zu versuchen, das Video direkt wie durch einen Zauberkasten zu „träumen“, nutzt GS-Agent ein Team von KI-Spezialisten, die zusammenarbeiten, um die Szene innerhalb einer echten Physik-Engine aufzubauen. Stellen Sie es sich so vor: Wenn Sie einer normalen KI sagen würden: „Erstelle ein Video von einer Erdbeere, die auf einen Wassertropfen trifft“, würde sie vielleicht nur ein hübsches Bild malen, das für eine Sekunde richtig aussieht, aber in sich zusammenfällt, wenn man heranzoomt. GS-Agent hingegen agiert wie ein Regisseur, ein Requisitengestalter und ein Kameramann in einem. Es zerlegt Ihre Anfrage in Schritte: Es findet oder erstellt die 3D-Modelle der Erdbeere und des Wassers, verleiht ihnen die richtige „Persönlichkeit“ (wie etwa wie weich oder hart sie sind), platziert sie in der Szene und lässt dann eine echte Physik-Simulation laufen, um zu sehen, was tatsächlich passiert, wenn sie kollidieren.

Das Paper stellt ein Framework vor, bei dem drei verschiedene KI-„Agenten“ zusammenarbeiten. Der Manager Agent ist der Chef; er liest Ihren Satz, zerlegt ihn in eine To-do-Liste und delegiert die Aufgaben. Der Entity Agent ist der Baumeister; er holt sich 3D-Modelle, passt deren Materialien an (stellt sicher, dass der Teig weich und der Tisch hart ist) und platziert sie so, dass sie nicht in der Luft schweben. Der Render Agent ist der Kameramann; er stellt Kameras, Licht und Winkel ein, um die Szene filmisch wirken zu lassen. Entscheidend ist, dass diese Agenten nicht nur raten. Sie schreiben Code, um die Simulation auszuführen, beobachten das Ergebnis und wenn etwas seltsam aussieht (wie ein Ball, der durch den Boden fällt), korrigieren sie es automatisch. Sie passen die Szene so lange an, bis die Physik Sinn ergibt und das Video exakt Ihrer Beschreibung entspricht.

Die Forscher testeten dieses System gegen einige der besten derzeit verfügbaren Video-generierenden KI-Modelle wie Sora und Wan sowie gegen andere KI-Agenten, die versuchen, Szenen zu bauen. Die Ergebnisse zeigten, dass während die anderen Modelle oft Videos erstellten, die zwar hübsch aussah, aber die Gesetze der Physik brachen (wie Objekte, die durch einander hindurchgleiten oder Flüssigkeiten, die sich wie feste Blöcke verhalten), GS-Agent physikalisch realistische Welten erschuf. Es simulierte erfolgreich komplexe Interaktionen, wie etwa eine Kugel, die einen Wasserballon durchbohrt, oder einen Schwamm, der sich verdreht und schnellt, mit der korrekten Physik. Das System erwies sich auch als viel besser darin, spezifische Anweisungen zu befolgen, wie zum Beispiel „bewege die Kamera in einem Kreis“ oder „lasse die Schokolade langsam tropfen“.

Was das Ganze besonders cool macht, ist, dass GS-Agent nicht beim Erstellen eines Videos aufhört. Da es die Welt mithilfe von echtem Physik-Code aufbaut, produziert es eine „4D-Welt“, die auch verborgene Daten enthält, wie exakte Tiefenkarten und wie sich jedes einzelne Partikel bewegt. Das bedeutet, der Output ist nicht nur eine Videodatei, sondern eine spielbare, interaktive Simulation. Die Autoren deuten an, dass dies ein riesiger Sprung nach vorn für das Training von Robotern oder selbstfahrenden Autos sein könnte, indem es ihnen einen sicheren, realistischen Ort bietet, um zu üben, bevor sie die reale Welt berühren. Obwohl das System noch nicht perfekt ist und von den aktuellen Grenzen der Physik-Simulationstechnologie abhängt, zeigt es einen vielversprechenden neuen Weg auf: Anstatt der KI beizubringen, die Realität zu halluzinieren, können wir ihr beibringen, die Realität zu bauen – eine Physikregel nach der anderen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →