← Neueste Arbeiten
💻 computer science

Retrospective Open-Vocabulary Memory for Long-Term Object Search

Dieses Paper stellt ECROM vor, eine Methode für die langfristige Objektsuche, die retrospektives Open-Vocabulary-Gedächtnis nutzt, um über Detektionsmöglichkeiten zu schlussfolgern und die Sucheffizienz zu verbessern, validiert durch einen neuen Benchmark, der signifikante Leistungssteigerungen gegenüber bestehenden Gedächtnissystemen aufzeigt.

Ursprüngliche Autoren: Jiaming Wang, Zhiwei Xue, Chen Jizhuo, Peng Shiqi, Harold Soh

Veröffentlicht 2026-10-05
📖 8 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Jiaming Wang, Zhiwei Xue, Chen Jizhuo, Peng Shiqi, Harold Soh

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Roboter, die sich durch die Welt bewegen, werden immer besser darin zu sehen, aber sie sind immer noch schrecklich darin, sich daran zu erinnern, wo Dinge normalerweise sind. Stellen Sie sich einen Roboter vor, der damit beauftragt ist, einen verlorenen Schlüsselbund in einem Haus zu finden, das er schon oft besucht hat. Wenn der Roboter sich nur an das letzte Mal erinnert, als er die Schlüssel gesehen hat, könnte er an der falschen Stelle suchen, wenn die Schlüssel gestern weggeräumt wurden. Wenn er einfach zählt, wie oft er die Schlüssel an einem bestimmten Ort gesehen hat, könnte er von seinem eigenen Pech getäuscht werden: Vielleicht ist er hundertmal am Küchentisch vorbeigelaufen, ohne jedoch nach unten zu schauen, während er nur einmal kurz auf das Sofa im Wohnzimmer geblickt und dort zufällig die Schlüssel gesehen hat. Eine einfache Zählung würde den Roboter glauben lassen, dass das Sofa der beste Ort zum Suchen sei, obwohl der Tisch eigentlich der Ort ist, an dem die Schlüssel die meiste Zeit gehören. Dies ist der Kern des Problems der langfristigen Objektsuche: zwischen dem Ort, an dem ein Objekt tatsächlich lebt, und dem Ort, an dem der Roboter zufällig nur hingesehen hat, zu unterscheiden.

Um dies zu lösen, haben Forscher an der National University of Singapore eine neue Methode entwickelt, mit der Roboter ein Gedächtnis für ihre Umgebung aufbauen können. Sie nennen ihr System ECROM, was für Exposure-Calibrated Retrospective Open-Vocabulary Memory steht. Das Team testete dieses System in einer Reihe kontrollierter Simulationen in zehn verschiedenen digitalen Heimen, in denen Objekte gemäß verborgener Muster bewegt wurden und der Pfad des Roboters bewusst variiert wurde, sodass einige Oberflächen oft und andere selten gesehen wurden. Sie fanden heraus, dass der Roboter, indem er genau abwog, was er sah, gegen das Maß dessen, wie viel einer Oberfläche er tatsächlich sehen konnte, die wahren Gewohnheiten von Objekten erlernen konnte. Wenn er gefragt wurde, Gegenstände zu finden, nach denen er zuvor nie explizit suchen sollte, half diesem neuen Gedächtnissystem dem Roboter, das Ziel viel schneller und zuverlässiger zu finden als bisherige Methoden.

Die Herausforderung, die die Forscher angegangen sind, wurzelt in der chaotischen Realität, wie sich Roboter bewegen. In einem echten Zuhause scannt ein Roboter nicht jeden Zentimeter jedes Raumes mit perfekter Klarheit ab. Er könnte durch eine Küche laufen, während er an die Decke starrt, oder an einem Esstisch vorbeigehen, der teilweise durch einen Stuhl blockiert wird. Wenn ein Roboter einfach zählt, wie oft er einen „Strohhut“ auf einem Tisch im Vergleich zu einer Kücheninsel detektiert hat, könnte er die falsche Antwort erhalten, wenn er sich mehr Zeit beim Betrachten der Insel verbracht hat. Der Hut könnte die Hälfte der Zeit auf dem Tisch liegen, aber wenn der Roboter nur jemals auf die Insel geschaut hat, würde eine einfache Zählung darauf hindeuten, dass die Insel das Zuhause des Hutes ist. Die Forscher erkannten, dass ein Roboter, um zu lernen, wo Dinge normalerweise vorkommen, das Beweismittel für die Anwesenheit eines Objekts von der Gelegenheit trennen muss, es gesehen zu haben. Eine verpasste Detektion ist nur dann aussagekräftig, wenn der Roboter tatsächlich in die richtige Richtung geschaut hat; wenn er weggeschaut hat, sagt das Fehlen einer Detektion nichts aus.

Um diese Idee zu testen, erstellte das Team einen Benchmark namens LOOP-Bench, der aus zehn realistischen Heimumgebungen besteht. In diesen Simulationen platzierten sie Objekte wie Tassen, Scheren und Hüte auf verschiedenen Oberflächen gemäß verborgener Wahrscheinlichkeitsverteilungen. Einige Objekte waren immer auf demselben Tisch, andere bewegten sich zwischen einigen wenigen Stellen, und einige erschienen nur selten. Entscheidend war, dass der Pfad des Roboters durch diese Häuser unabhängig von der Platzierung der Objekte generiert wurde. Das bedeutete, dass der Roboter vielleicht zehnmal an einem Tisch vorbeilaufen konnte, ohne die Oberfläche jemals klar zu sehen, während er vielleicht nur einmal an einer Kücheninsel vorbeikam und einen perfekten Blick darauf hatte. Dieser Aufbau zwang das Gedächtnissystem dazu, die wahren Standorte der Objekte zu ermitteln, ohne von den Bewegungsmustern des Roboters selbst getäuscht zu werden.

Das neue System ECROM arbeitet, indem es die Historie des Roboters in eine Karte von Oberflächen, oder „Supports“, organisiert und genau aufzeichnet, wie viel jeder Oberfläche während jedes Durchgangs sichtbar war. Wenn ein Mensch später einen spezifischen Gegenstand sucht, betrachtet das System alle vergangenen Fahrten. Es zählt nicht einfach nur die Detektionen; stattdin berechnet es eine Wahrscheinlichkeit basierend darauf, wie viel der Oberfläche exponiert war. Wenn der Roboter eine Oberfläche klar sah und das Objekt nicht fand, senkt das System die Überzeugung, dass das Objekt dort ist, stark ab. Aber wenn der Robbot nur einen flüchtigen Blick auf eine Oberfläche erwarf oder die Sicht blockiert war, behandelt das System das Fehlen einer Detektion als neutral und weigert sich, diesen Ort zu bestrafen. Dies ermöglicht es dem Roboter zu lernen, dass ein Objekt wahrscheinlich auf einer Oberfläche liegt, die er selten gesehen hat, vorausgesetzt, diese Oberfläche ist die einzige, an der das Objekt jemals gesehen wurde, als es sichtbar war.

Die Ergebnisse der Simulation waren eindeutig. Als die Forscher den Roboter baten, Objekte zu finden, nach denen er nie explizit suchen sollte, übertraf das neue System jede andere von ihnen getestete Methode. Es verbesserte die Genauigkeit seiner Vorhersagen um eine signifikante Spanne und, was noch wichtiger ist, es fand die Objekte während der aktiven Suche viel schneller. In den Simulationen fand der Roboter mit ECROM das Ziel in etwa 59 Prozent seiner Versuche, verglichen mit etwa 53 Prozent für die nächstbeste Methode. Noch frappierender war, dass in einer spezifischen Fallstudie, die in der Arbeit gezeigt wurde, die Distanz, die der Roboter zurücklegen musste, um das Objekt zu finden, von 17,8 Metern auf nur 3,2 Meter sank. Diese Effizienz kam daher, dass der Roboter genau wusste, welche Oberflächen es wert waren, zuerst überprüft zu werden, anstatt ziellos umherzuwandern oder an Orten hängen zu bleiben, die er bereits ausgeschlossen hatte.

Um sicherzustellen, dass dies nicht nur ein digitaler Trick war, testete das Team das System auch an einem physischen Roboter, einem Hello Robot Stretch 3, in einer echten Büroumgebung. Sie führten die gleiche Art von Suchaufgabe mit echten Objekten wie einem roten Becher, einer Schere und einer Dose Fleisch durch. Der Roboter musste in einem 500 Quadratmeter großen Raum navigieren, sich zwischen Schreibtischen und Regalen bewegte, um diese Gegenstände zu finden. Die Ergebnisse spiegelten die Simulation wider. Der Roboter, der das neue Gedächtnissystem nutzte, fand die Objekte in 14 von 15 Versuchen, während die anderen Methoden nur in 10 oder 11 Fällen erfolgreich waren. Der physische Roboter legte auch deutlich weniger Distanz zurück und überwand im Durchschnitt 19,4 Meter im Vergleich zu fast 29 Metern bei den anderen Ansätzen. Dies bewies, dass die Logik, die Beobachtungsmöglichkeit von der Anwesenheit des Objekts zu trennen, auch funktioniert, wenn der Roboter mit der unvorhersehbaren Beleuchtung und Unordnung der realen Welt zu tun hat.

Die Forscher untersuchten auch, was passieren würde, wenn sie die Schlüsselteile ihres Systems entfernen würden. Wenn sie den Roboter dazu zwangen, davon auszugehen, dass er jede Oberfläche vollständig gesehen hatte, selbst wenn er dies offensichtlich nicht getan hatte, sank die Leistung des Roboters. Er begann, verpasste Detektionen als Beweis dafür zu werten, dass ein Objekt abwesend sei, was dazu führte, dass er die korrekten Standorte ignorierte. Ebenso, als sie das System vereinfachten, indem sie nur noch darauf achteten, ob ein Objekt gesehen wurde oder nicht, und die Stärke des visuellen Beweises ignorierten, wurde der Roboter weniger präzise. Diese Tests bestätigten, dass der Erfolg des Systems von zwei spezifischen Dingen abhing: einer sorgfältigen Abrechnung darüber, wie viel einer Oberfläche tatsächlich sichtbar war, und einer nuancierten Interpretation dessen, wie stark der visuelle Beweis war.

Diese Arbeit deutet einen Weg für Roboter auf, die in dynamischen, sich verändernden Umgebungen über lange Zeiträume hinweg operieren müssen. Anstatt sich nur an das letzte Mal zu erinnern, als sie etwas gesehen haben, oder eine einfache Zählung von Sichtungen vorzunehmen, können diese Roboter die Gewohnheiten der Welt um sie herum erlernen. Sie können verstehen, dass nur weil sie vor kurzem keine Kaffeetasse auf einem Tresen gesehen haben, das nicht bedeutet, dass die Tasse nicht da ist; es könnte einfach bedeuten, dass sie diesen Tresen seit einer Weile nicht betrachtet haben. Indem ein Roboter ein Gedächtnis aufbaut, das die Grenzen seiner eigenen Sichtweise respektiert, kann er zu einem zuverlässigeren Partner im Haushalt werden, der in der Lage ist, verlorene Gegenstände zu finden, selbst wenn die Welt um ihn herum in ständigem Wandel ist. Die Forscher planen, ihren Code und die Benchmark-Daten der Öffentlichkeit zugänglich zu machen, um anderen die Möglichkeit zu geben, auf diesem Fundament smarterer, beobachtungsfähigerer Maschinen aufzubauen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →