← Neueste Arbeiten
💻 computer science

Sandwich-Residuals: Parameter-Efficient Test-time Adaptation of World Models

Das Papier stellt Sandwich-Residuals vor, eine parametereffiziente Test-Time-Adaptationsmethode für latente Weltmodelle, die vortrainierte Gewichte einfriert und nur kleine residuelle Korrekturen online mittels selbstüberwachter Vorhersagefehler lernt, wodurch signifikant verbesserte Erfolgsraten unter Verteilungsverschiebungen erzielt wird, während gleichzeitig 97–99 % weniger Parameter als bestehende Ansätze angepasst werden.

Ursprüngliche Autoren: Krishnam Soni, Aditya Sehgal, Vedant Dave, Elmar Rueckert

Veröffentlicht 2026-09-21
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Krishnam Soni, Aditya Sehgal, Vedant Dave, Elmar Rueckert

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Roboter, die ihre Bewegungen selbst planen können, verlassen sich oft auf eine interne Karte davon, wie die Welt funktioniert. Stellen Sie sich einen Roboterarm vor, der versucht, einen Block über einen Tisch zu schieben. Anstatt nur auf das zu reagieren, was er im Moment sieht, baut ein intelligenter Roboter ein mentales Modell auf, das vorhersagt, was passieren wird, wenn er seinen Arm auf eine bestimmte Weise bewegt. Er lernt zu sagen: „Wenn ich hier drücke, wird der Block dort entlanggleiten.“ Dieses mentale Modell, das oft als Weltmodell bezeichnet wird, ermöglicht es dem Roboter, zukünftige Handlungen in seinem Geist zu simulieren, bevor er sich tatsächlich bewegt, was ihm hilft, Fehler zu vermeiden und seine Ziele effizient zu erreichen. Diese Modelle werden meist in einer kontrollierten Umgebung trainiert, etwa in einer Computersimulation, in der die Beleuchtung perfekt und die Physik konsistent ist. Die reale Welt ist jedoch chaotisch. Wenn ein Roboter, der in einer Simulation trainiert wurde, in einem neuen Raum mit anderer Beleuchtung platziert wird oder wenn die Tischoberfläche rutschig wird, kann die interne Karte des Roboters falsch werden. Die Vorhersagen, die er trifft, stimmen nicht mehr mit der Realität überein, und der Roboter scheitert bei der Ausführung seiner Aufgabe. Jahrelang war die Standardlösung für dieses Problem, Teile des Gehirns des Roboters während des Betriebs neu zu trainieren, indem Millionen von internen Einstellungen angepasst wurden, um sie an die neuen Bedingungen anzupassen. Dieser Prozess ist schwerfällig, langsam und erfordert, dass der Roboter ständig sein eigenes Verständnis dafür, wie Dinge sich bewegen, umschreibt.

Ein Team von Forschern hat einen viel leichteren Weg gefunden, um dieses Problem zu lösen. Anstatt den Roboter zu bitten, seine gesamte interne Karte neu zu schreiben, haben sie herausgefunden, dass es oft ausreicht, lediglich die Kanten anzupassen, an denen der Roboter seine Eingaben liest und seine Ausgaben schreibt. In einer neuen Studie stellten die Forscher eine Methode vor, die sie „Sandwich-Residuals“ nennen. Sie nahmen einen Roboter, der bereits gelernt hatte, sich in einer Simulation zu bewegen, und frierten sein internes Gehirn vollständig ein, wodurch verhindert wurde, dass sich seine Millionen von gelernten Einstellungen verändern. Dann fügten sie zwei sehr kleine, flexible Softwareschichten hinzu: eine, die die Informationen ankommt, die in das Gehirn des Roboters fließen, leicht verändert, und eine weitere, die die Vorhersagen verändert, die aus ihm herauskommen. Diese kleinen Schichten wirken wie eine Sandwichfüllung, die den gefrorenen Kern umschließt. Während der Roboter versucht sich zu bewegen und Fehler macht, lernen diese kleinen Schichten, die Fehler laufend zu korrigieren, ohne jemals das schwere, vorab trainierte Gehirn im Inneren anzupassen. Der Roboter lernt zu sagen: „Mein Gehirn denkt, der Block wird hierhin gehen, aber meine neue Korrekturschicht weiß, dass der Boden rutschig ist, also werde ich meinen Plan anpassen, um ihn dorthin zu senden.“

Die Forscher testeten diese Idee bei einer Vielzahl anspruchsvoller Aufgaben, darunter das Navigieren durch Labyrinthe und das Schieben von Objekten unterschiedlicher Form. Sie verglichen ihre Methode mit dem Standardansatz, der das Aktualisieren des internen Gehirns des Roboters beinhaltet, sowie mit einem Roboter, der gar keine Anpassungen vornimmt. In einundzwanzig verschiedenen Testszenarien gelang es dem Roboter mit der neuen „Sandwich“-Methode in 65 Prozent der Fälle, sein Ziel zu erreichen. Dies war eine signifikante Verbesserung gegenüber dem unangepassten Roboter, der nur in etwa 49 Prozent der Fälle erfolgreich war. Wichtiger noch: Die neue Methode schnitt fast so gut ab wie der Standardansatz, der das Gehirn des Roboters neu schreibt und in etwa 68 Prozent der Fälle erfolgreich war. Der entscheidende Unterschied liegt in der Effizienz. Die Standardmethode musste fast zehn Millionen Einstellungen aktualisieren, um sich an die neuen Bedingungen anzupassen. Die neue Methode hingegen musste nur etwa einhunderttausend Einstellungen anpassen. Das bedeutet, dass der neue Ansatz mit weniger als drei Prozent des Rechenaufwands der alten Methode anpassungsfähig ist und dennoch ein fast gleiches Maß an Erfolg erzielt.

Die Studie untersuchte auch, was passiert, wenn der Roboter mit mehreren Problemen gleichzeitig konfrontiert wird, wie etwa einer Änderung der Beleuchtung kombiniert mit einer Änderung der Schwere der Objekte. In diesen schwierigen „kombinierten“ Situationen war die neue Methode noch beeindruckender. Sie war 1,9 Mal erfolgreicher als der unangepasste Roboter und blieb dabei genauso effektiv wie die schwere, gehirn-aktualisierende Methode. Die Forscher fanden heraus, dass die Art der benötigten Korrektur von der spezifischen Aufgabe abhing. Wenn der Roboter durch ein Labyrinth navigierte und sich die Physik der Bewegung änderte, leistete die Schicht, die die Vorhersagen des Roboters nach deren Erstellung korrigierte, den Großteil der Arbeit. Wenn der Roboter Objekte schob und die Steuerung empfindlicher wurde, war die Schicht, die die Eingabebefehle des Roboters anpasste, wichtiger. Durch das Beibehalten beider Schichten konnte das System eine Vielzahl von unerwarteten Änderungen bewältigen, ohne im Voraus wissen zu müssen, um welche Art von Schwierigkeiten es sich handelt.

Um zu beweisen, dass diese Idee über einfache Labyrinthspiele hinausgeht, wandten die Forscher sie auch auf eine komplexere Aufgabe an, die einen realitätsnahen Roboterarm betrifft, der einen Würfel im dreidimensionalen Raum bewegt. Sie verwendeten für diese Aufgabe einen anderen Typ von Robotergehirn, das auf visuellen Mustern basiert statt auf dem vorherigen Design. Selbst mit dieser anderen Architektur funktionierte das gleiche „Sandwich“-Prinzip. Der Roboter war in der Lage, sich an Änderungen der Beleuchtung, der Kamerawinkel und der Stärke seiner eigenen Motoren anzupassen. In jedem einzelnen Testfall, in dem sich die Bedingungen änderten, verbesserte die neue Methode die Leistung des Roboters im Vergleich zum Nichtstun, während die anderen Methoden den Roboter manchmal sogar schlechter dastehen ließen. Dies deutet darauf hin, dass die Fähigkeit zur Anpassung nicht immer erfordert, dass ein Roboter sein grundlegendes Verständnis der Welt ändert. Manchmal reicht es aus, einfach einen kleinen, flexiblen Filter hinzuzufügen, der dem Roboter hilft, seine aktuelle Situation korrekt zu interpretieren.

Die Ergebnisse legen nahe, dass sich die Art und Weise, wie wir Roboter für die Zukunft bauen, ändern könnte. Lange Zeit galt die Annahme, dass, wenn sich die Umgebung eines Roboters ändert, sein internes physikalisches Modell neu geschrieben werden muss, um passend zu sein. Diese Arbeit zeigt, dass diese Annahme nicht immer notwendig ist. Wenn das grundlegende Verständnis des Roboters für die Welt noch weitgehend korrekt ist, kann er einfach lernen, seine Eingaben und Ausgaben anzupassen, um sich an die neue Realität anzupassen. Dieser Ansatz ist nicht nur schneller und kostengünstiger, sondern auch stabiler, da er das Risiko vermeidet, dass der Roboter das, was er bereits weiß, vergisst, während er versucht, etwas Neues zu lernen. Obwohl die Experimente in Computersimulationen durchgeführt wurden, deuten die Ergebnisse auf eine Zukunft hin, in der Roboter in neue Umgebungen eintreten und sofort mit der Arbeit beginnen können, indem sie winzige, effiziente Anpassungen nutzen, um die Überraschungen der realen Welt zu bewältigen, ohne eine massive Überarbeitung ihrer Intelligenz zu benötigen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →