← Neueste Arbeiten
🤖 AI

Bridging Learned Visual Perception and Symbolic Belief-Space Planning

Dieses Paper führt ein neuartiges „VLM-as-probabilistic-grounder“-Paradigma ein, das die Unsicherheit der visuellen Wahrnehmung als Wahrscheinlichkeitsverteilungen über symbolische Zustände erfasst und so eine robuste Planung im Belief-Space ermöglicht, die bestehende deterministische Ansätze in teilweise beobachtbaren Umgebungen übertrifft.

Ursprüngliche Autoren: Guy Azran, Michael Navat, Sarah Keren

Veröffentlicht 2026-09-16
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Guy Azran, Michael Navat, Sarah Keren

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich einen Roboter vor, der versucht, ein unordentliches Wohnzimmer aufzuräumen. Er sieht ein Buch auf einem Tisch und ein Regal am anderen Ende des Raumes, aber seine Kamera wackelt und das Licht ist schwach. In der realen Welt haben Roboter selten ein perfektes Sehvermögen. Sie können nicht alles auf einmal sehen; Objekte verstecken sich hinter Möbeln, und Sensoren interpretieren oft falsch, was sie gerade betrachten. Damit ein Roboter sicher und effektiv agieren kann, muss er zugeben, was er nicht weiß. Wenn er sich über den Ort eines Objekts falsch entscheidet, versucht er vielleicht etwas zu greifen, das gar nicht da ist, oder schlimmer noch, er versucht ein Objekt zu platzieren, das er gar nicht hält. Diese Unsicherheit ist die größte Hürde bei der Lehre von Maschinen, in unseren komplexen, unvorhersehbaren Haushalten zu navigieren.

Jahrelang haben Forscher versucht, dies zu lösen, indem sie einem Roboter ein „Gehirn“ gaben, das ein Bild betrachten und sofort entscheiden kann, was wahr ist. Sie verwenden leistungsstarke KI-Modelle, die sowohl Bilder als auch Sprache verstehen. Die Idee war simpel: Man zeigt dem Roboter ein Foto, fragt ihn „Ist der Schrank offen?“, und wenn das Modell mit „Ja“ antwortet, behandelt der Roboter dies als absolute Tatsache und plant seinen nächsten Schritt. Doch in der Praxis ist dieser Ansatz zerbrechlich. Wenn das Modell einen Fehler macht – was oft passiert, wenn Objekte verdeckt sind oder die Sicht unklar ist – folgt der Roboter einem Plan, der auf einer Lüge basiert. Er verbringt vielleicht Minuten damit, eine Tür zu öffnen, die bereits offen ist, oder schlimmer noch, er gibt ganz auf, weil er glaubt, die Aufgabe sei unmöglich. Das Kernproblem ist, dass diese Systeme unsichere Vermutungen als feste Fakten behandeln und somit keinen Raum für Fehler lassen.

Ein Team von Forschern am Technion in Israel hat einen anderen Weg vorgeschlagen, um dieses Problem anzugehen. Anstatt den Roboter zu zwingen, eine einzige, starre Vermutung über die Welt zu treffen, haben sie ihm beigebracht, mehrere Möglichkeiten gleichzeitig im Kopf zu behalten. Sie nennen ihr neues System RoVLaP. Anstatt das KI-Modell zu fragen, ob „das Buch auf dem Tisch liegt“ oder „das Buch nicht auf dem Tisch liegt“, fragt das System das Modell, wie wahrscheinlich jedes dieser Szenarien ist. Es könnte sagen, dass eine Wahrscheinlichkeit von 60 % besteht, dass das Buch auf dem Tisch liegt, und eine Wahrscheinlichkeit von 40 %, dass es in einer Schublade versteckt ist. Indem es diese Wahrscheinlichkeiten lebendig hält, kann der Roboter eine „Überzeugung“ über die Welt aufbauen, die die Unsicherheit anerkennt. Er plant nicht nur für das wahrscheinlichste Szenario; er plant gleichzeitig für eine Reihe wahrscheinlicher Szenarien.

Die Forscher testeten diese Idee in einer simulierten Heimumgebung, einer digitalen Welt voller virtueller Möbel, Schubladen und Objekte. Sie gaben dem Roboter Aufgaben, die typisch für die Hausarbeit sind, wie das Sortieren von Büchern in Regale, das Ausräumen von Schubladen oder das Abschließen von Türen. In diesen Tests musste sich der Roboter ausschließlich auf das verlassen, was seine Kamera sehen konnte, ohne spezielles Wissen darüber, wo sich versteckte Objekte befinden könnten. Sie verglichen ihre neue Methode mit zwei anderen gängigen Ansätzen: einem, bei dem das KI-Modell dem Roboter Schritt für Schritt direkt sagt, was er tun soll, und einem anderen, bei dem das Modell eine einzige, feste Beschreibung des Raumes liefert, die ein Standard-Planer nutzen kann.

Die Ergebnisse zeigten einen klaren Vorteil für den neuen Ansatz. In den simulierten Tests scheiterten die Standardmethoden oft völlig, wenn die Sicht des Roboters blockiert oder irreführend war. Beispielsweise in einer Aufgabe, bei der eine Schüssel in einem geschlossenen Schrank versteckt war: Der Standard-Roboter nahm an, die Schüssel sei sichtbar, und versuchte sofort nach ihr zu greifen, was jedes Mal fehlschlug. Das neue System hingegen erkannte, dass die Schüssel versteckt sein könnte. Es plante eine Abfolge von Aktionen, die zuerst das Öffnen des Schranks beinhaltete. Diese eine Änderung ermöglichte es dem Roboter, in Situationen erfolgreich zu sein, in denen die anderen Methoden versagten. Bei schwierigen Aufgaben löste das neue System 66,7 % der Probleme, während die Standard-„Grounder“-Methode gar keine löste. Bei Aufgaben mittleren Schwierigkeitsgrades verbesserte es die Erfolgsrate im Vergleich zur Standardmethode um mehr als 160 %.

Neben der Lösung von mehr Aufgaben war das neue System auch effizienter. Da es von Anfang an die Unsicherheit mit einplante, machte es weniger Fehler und musste seine Pläne seltener neu erstellen. Die Standardmethoden mussten oft anhalten, feststellen, dass sie falsch lagen, und dann neu anfangen, was Zeit und Energie verschwendete. Das neue System hingegen erstellte Pläne, die robust genug waren, um die anfängliche Verwirrung zu bewältigen, ohne ständig stoppen und neu denken zu müssen. Es bewegte sich mit einer Art vorsichtiger Zuversicht und bereitete sich auf die Möglichkeit vor, dass seine erste Vermutung falsch sein könnte, indem es einen Backup-Plan bereit hielt, falls nötig.

Die Forscher bewiesen auch, dass diese Methode mathematisch fundiert ist. Sie zeigten, dass der Roboter letztendlich den wahren Zustand der Welt herausfinden wird, wenn das KI-Modell auch nur geringfügig besser als reines Raten ist, sofern er kontinuierlich Beobachtungen sammelt und seine Überzeugungen aktualisiert. Das System erfordert nicht, dass das Modell perfekt ist; es muss lediglich konsistent besser als ein Münzwurf sein. Mit der Zeit, während der Roboter mehr visuelle Beweise sammelt, schrumpft seine Unsicherheit und seine Pläne werden präziser. Dies bietet ein Sicherheitsnetz: Selbst wenn der Roboter mit einer falschen Vorstellung beginnt, ist das System so konzipiert, dass es sich selbst korrigiert, ohne abzustürzen oder stecken zu bleiben.

Diese Arbeit stellt einen Paradigmenwechsel in der Entwicklung autonomer Agenten dar. Sie bewegt sich weg von der Vorstellung, dass ein Roboter die Wahrheit wissen muss, um zu handeln, hin zu der Idee, dass ein Roboter auch dann klug handeln kann, wenn er unsicher ist. Indem er die Welt als eine Menge von Möglichkeiten statt als eine einzige, feste Realität betrachtet, wird der Roboter anpassungsfähiger und zuverlässiger. In den simulierten Häusern bedeutete dies den Unterschied zwischen einem Roboter, der aufgibt, wenn er ein verstecktes Objekt nicht sehen kann, und einem, der geduldig den Schrank öffnet, um es zu finden. Wenn Roboter aus kontrollierten Laboren in unsere tatsächlichen Wohnungen ziehen, in denen sich Lichtverhältnisse ändern, Objekte bewegen und Sichtlinien blockiert werden, könnte diese Fähigkeit, für das Unbekannte zu planen, der Schlüssel dazu sein, sie wirklich nützliche Begleiter zu machen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →