← Neueste Arbeiten
🤖 AI

Workspace Models: Lightweight Robotic Memory via Saliency-Driven Supervision

Dieses Paper führt „Workspace Tokens“ ein, eine leichtgewichtige latente Speicherrepräsentation, die durch Saliency-gesteuerte Supervision von VLMs trainiert wird und es Robotik-Policies ermöglicht, langfristige Gedächtnisaufgaben bei der Anwendung effizient zu lösen, ohne dass ein In-the-Loop-VLM-Reasoning erforderlich ist, während sie gleichzeitig die Gesamtleistung verbessert.

Ursprüngliche Autoren: Nitish Dashora, Douglas Chen, Idan Shenfeld, John Marangola, Pulkit Agrawal, Max Simchowitz

Veröffentlicht 2026-09-18
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Nitish Dashora, Douglas Chen, Idan Shenfeld, John Marangola, Pulkit Agrawal, Max Simchowitz

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Roboter, die Objekte in der realen Welt manipulieren können, stehen vor einer grundlegenden Herausforderung: Sie müssen sich daran erinnern können, was vor einem Moment oder sogar vor Minuten passiert ist, um jetzt die richtige Entscheidung zu treffen. Wenn ein Roboter Blöcke stapelt, muss er sich daran erinnern, wie viele er bereits platziert hat. Wenn er eine Schublade öffnet, muss er sich merken, welche diejenige ist, die das Objekt enthält, das er sucht. In der Vergangenheit versuchten Ingenieure dies zu lösen, indem sie dem Computer des Roboters jedes einzelne Videobild einspeisten, das er je gesehen hatte, aber dieser Ansatz verwirrte die Maschine oft, was dazu führte, dass sie sich an irrelevante Details klammerte und scheiterte. Vor kurzem versuchten Forscher, massive, leistungsstarke Modelle der künstlichen Intelligenz als Gedächtnis einzusetzen, die ständig die Historie des Roboters scannen, um zusammenzufassen, was wichtig ist. Dies funktioniert zwar, ist aber langsam und teuer – so, als würde man einen menschlichen Bibliothekar bitten, jedes Buch in einer Bibliothek zu lesen, jedes Mal, wenn man nach einer einzigen Seite fragt. Die Kernfrage für Robotikexperten bestand darin, wie man einem Roboter ein zuverlässiges Gedächtnis geben kann, ohne ihn zu verlangsamen oder einen Supercomputer für den Betrieb zu benötigen.

Ein Team von Forschern vom MIT und der Carnegie Mellon University hat eine Lösung vorgeschlagen, die sie „Workspace Model“ (Arbeitsraum-Modell) nennen. Anstatt sich darauf zu verlassen, dass ein leistungsstarker, langsamer Computer die Historie zusammenfasst, während der Roboter arbeitet, bringen sie dem Roboter während der Trainingsphase ein kleines, leichtgewichtiges Gedächtnissystem bei. Sie verwenden das leistungsstarke KI-Modell nur während der Lernphase des Roboters, nicht während er eine Aufgabe ausführt. Dieses leistungsstarke Modell fungt als Lehrer und zeigt genau auf, welche Momente in einem Video wichtig sind – etwa wenn ein Roboter-Greifer einen Block aufnimmt oder wenn eine Schublade geschlossen wird. Die Forscher trainieren dann ein kompaktes, effizientes System, um diese wichtigen Momente in eine winzige, verborgene Zusammenfassung zu komprimieren. Sobön dieses Training abgeschlossen ist, kann der Roboter diese kleine Zusammenfassung nutzen, um sich augenblicklich an die Vergangenheit zu erinnern, ohne erneut den langsamen, leistungsstarken Lehrer anrufen zu müssen.

Die Forscher testeten diesen Ansatz bei mehreren schwierigen Aufgaben, die ein Langzeitgedächtnis erfordern. In einer simulierten Umgebung musste ein Roboter genau fünf Würfel in eine Schüssel fallen lassen, wobei die Würfel aus der Sicht verschwanden, sobald sie sich darin befanden, was den Roboten zwang, sie in seinem Gedächtnis zu zählen. In einer anderen Aufgabe musste ein Roboter eine bestimmte Schublade öffnen, die ein anderer Roboter zuvor geschlossen hatte, was erforderte, dass er sich daran erinnerte, welche Schublade das Objekt enthielt. Sie testeten auch einen realen Roboter an einem Hardware-Setup, bei dem er Würfel in Boxen legen musste, die zu hoch waren, um hineinzusehen, was wiederum erforderte, dass der Roboter eine laufende Zählung beibehielt. Bei diesen Tests war das neue Workspace-Modell in 91,5 Prozent der Versuche erfolgreich. Dies war signifikant besser als andere Methoden. Ein Standardroboter, der nur die letzten paar Frames betrachtete, scheiterte die meiste Zeit, weil er die Vergangenheit vergaß. Ein Roboter, der versuchte, ein leistungsstarkes KI-Modell zu nutzen, um während der Aufgabe Schlüsselmomente aus der Vergangenheit auszuwählen, war viel langsamer und erreichte nur 6-6,8 Prozent Erfolg. Das Workspace-Modell war nicht nur am genauesten, sondern auch am schnellsten, was es dem Roboter ermöglichte, schnell zu reagieren, ohne die Verzögerung, die durch das Warten auf einen großen Computer zur Verarbeitung der Historie entsteht.

Der Erfolg dieser Methode beruht auf einer klugen Verschiebung der Art und Weise, wie das Gedächtnis aufgebaut wird. In früheren Versuchen baten Forscher ein großes KI-Modell darum, wichtige Frames aus einem Videostream auszuwählen, während der Roboter sich bewegte. Dieser Prozess verursachte eine Verzögerung, oder einen Lag, der die Bewegungen des Roboters ruckartig und weniger präzise machte. Der neue Ansatz verlagert diese schwere Arbeit in die Trainingsphase. Während des Trainings überprüft das leistungsstarke KI-Modell das gesamte Video einer Aufgabe und identifiziert die kritischen Ereignisse. Es lehrt dann das kleine Workspace-Modell, diese wichtigen visuellen Details zu rekonstruieren. Das kleine Modell lernt, diese Informationen in ein einziges, dichtes Token zu komprimieren – ein winziges Datenstück, das die Essenz der Vergangenheit enthält. Wenn der Roboter in der realen Welt eingesetzt wird, betrachtet er einfach dieses Token. Er muss die Vergangenheit nicht neu analysieren oder auf ein großes Modell warten; das Gedächtnis ist bereits destilliert und bereit. Dies ermöglicht es dem Roboter, einen klaren, kontinuierlichen Handlungsfluss aufrechtzuerhalten, ohne die Unterbrechungen, die frühere Methoden plagten.

Die Forscher fanden heraus, dass diese Methode nicht nur die Geschwindigkeit erhöhte, sondern den Roboter tatsächlich intelligenter machte. Als sie analysierten, warum die anderen Methoden scheiterten, entdeckten sie, dass das bloße Einspeisen von mehr Frames oder sogar sorgfältig ausgewählter Frames den Roboter oft verwirrte. Der Roboter begann, die falschen Bewegungen nachzuahmen oder konnte Objekte nicht präzise greifen, weil die zusätzlichen Informationen Rauschen einführten. Das Workspace-Modell hingegen bot eine glatte, kontinuierliche Darstellung der Vergangenheit. Da das kleine Modell darauf trainiert wurde, die markantesten Details aus der gesamten Historie zu rekonstruieren, lernte es, das störende Rauschen zu ignorieren und sich nur auf das zu konzentrieren, was für die Aufgabe wichtig war. Dies führte zu einem Roboter, der korrekt zählen, die richtige Schublade finden und Objekte mit einer Präzision greifen konnte, die andere Methoden nicht erreichen konnten.

Die Studie legt nahe, dass die Zukunft des robotischen Gedächtnisses nicht darin liegen könnte, die Roboter selbst größer oder leistungsstärker zu machen, sondern darin, wie sie das Erinnern lernen. Indem man leistungsstarke Werkzeuge nutzt, um einfachere, effizientere Systeme zu trainieren, können Forscher Roboter erschaffen, die sowohl schnell als auch zu komplexem, langfristigem Denken fähig sind. Das Workspace-Modell funget als Brücke, die die für das Gedächtnis erforderliche schwere Denkarbeit übernimmt und sie in eine Form komprimiert, die ein Roboter in Echtzeit nutzen kann. Dieser Ansatz bietet einen Weg nach vorn für Roboter, die in dynamischen, unvorhersehbaren Umgebungen operieren müssen, in denen das Erinnern an die Vergangenheit genauso wichtig ist wie das Sehen der Gegenwart. Die Arbeit zeigt, dass ein Roboter mit der richtigen Trainingsstrategie eine reiche Erfahrungshistorie in einem leichtgewichtigen Paket mit sich tragen kann, bereit, mit Klarheit und Geschwindigkeit zu handeln.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →