← Neueste Arbeiten
💻 computer science

RoboFind: Multi-Agent Personalized Object Search for People Who Are Blind or Have Low Vision

RoboFind ist ein Multi-Agenten-Framework, das es blinden und sehbehinderten Nutzern ermöglicht, spezifische persönliche Gegenstände zu lokalisieren, indem es eine smartphonebasierte Teaching-Schnittstelle mit den autonomen Such- und Verifikationsfähigkeiten eines quadrupeden Roboters kombiniert und dabei signifikant höhere Erfolgs- und Zuverlässigkeitsraten als Baseline-Methoden erzielt.

Ursprüngliche Autoren: Ruiping Liu, Shaofang Quan, Qian Yin, Jingqi Zhang, Junwei Zheng, Yufan Chen, Di Wen, Weijia Fan, Kailun Yang, M. Saquib Sarfraz, Tamim Asfour, Kunyu Peng, Rainer Stiefelhagen

Veröffentlicht 2026-09-18
📖 7 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Ruiping Liu, Shaofang Quan, Qian Yin, Jingqi Zhang, Junwei Zheng, Yufan Chen, Di Wen, Weijia Fan, Kailun Yang, M. Saquib Sarfraz, Tamim Asfour, Kunyu Peng, Rainer Stiefelhagen

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Für Menschen, die blind sind oder eine Sehbehinderung haben, wird die Welt oft durch Klang, Tastsinn und Erinnerung navigiert. Während die Technologie seit langem Werkzeuge zur Unterstützung der Fortbewegung bietet, wie etwa Blindenführhunde oder Blindenstöcke, bleibt eine andere Art von Herausforderung bestehen: das Finden eines bestimmten Gegenstands in einem Raum. Aktuelle Lösungen erfordern oft, dass der Nutzer umherläuft, eine Kamera hält und hofft, einen Blick auf das Gesuchte zu erhaschen. Wenn der Gegenstand hinter einem Stuhl verborgen oder in einer Ecke verstaut ist, kann die Kamera ihn nicht sehen, und die Suche schlägt fehl. Die Frage, die sich Forscher gestellt haben, lautete, ob ein Roboter die physische Arbeit der Suche übernehmen könnte – indem er sich durch einen Raum bewegt, um einen Gegenstand zu finden, während der Nutzer sicher an seinem Platz bleibt, und dies alles, ohne dass dieser das Ergebnis selbst sehen muss.

Dies ist der Kern des Problems, das ein neues System namens RoboFind adressiert. Die Forscher am Karlsruher Institut für Technologie in Deutschland haben ein Framework entwickelt, das ein Smartphone, welches der Nutzer hält, mit einem vierbeinigen Roboter verbindet, der die Suche durchführt. Das System ist darauf ausgeert, eine sehr spezifische Schwierigkeit zu bewältigen: das Finden eines ganz bestimmten Gegenstands, wie etwa eines geliebten blauen Rucksacks oder einer bestimmten Brille, anstatt nur irgendeines Objekts dieser Art. Ein Roboter, der nur „einen Rucksack“ finden kann, würde vielleicht den falschen mitbringen und den Nutzer frustrieren. RoboFind löst dies, indem es die Aufgabe in zwei deutlich voneinander getrennte Phasen unterteilt: das Lehren des Roboters, wonach er suchen soll, und die anschließende Verifizierung, dass er tatsächlich genau das Richtige gefunden hat, bevor er dem Nutzer meldet, dass die Aufgabe erledigt ist.

Der Prozess beginnt damit, dass der Nutzer den Roboter lehrt. Über eine Smartphone-App, die für die Nutzung per Sprache und Berührung konzipiert ist, nimmt der Nutzer kurze Videos des Objekts auf, das er finden möchte. Die App leitet den Nutzer an, das Telefon um den Gegenstand herum zu bewegen, um ihn von vorne, von der Seite und von oben sowie vor einem anderen Hintergrund zu erfassen. Dies ist nicht nur ein einfaches Foto; das System analysiert diese Videos, um ein detailliertes digitales Profil des Objekts zu erstellen. Es speichert eine Sammlung visueller Referenzen, die genau beschreiben, wie dieser spezifische Rucksack aussieht, um ihn von allen anderen Taschen im Haus zu unterscheiden. Sob-ald dieses Profil gespeichert ist, kann der Nutzer es aus einer Liste auswählen und den Roboter beauftragen, danach zu suchen.

Wenn die Suche beginnt, betritt ein vierbeiniger Roboter, der in seiner Form einem Hund ähnelt, den Raum. Er weiß nicht, wo sich das Objekt befindet, und nutzt daher ein Navigationssystem, um die Umgebung zu erkenfluchen, indem er vorwärts fährt, sich dreht und den Raum scannt. Wenn das Navigationssystem des Roboters glaubt, eine potenzielle Übereinstimmung gefunden zu haben, hält er an. Doch hier unterscheidet sich das System von früheren Versuchen. Anstatt sofort zu melden, dass das Objekt gefunden wurde, hält der Roboter inne und sendet ein Bild dessen, was er sieht, zur zweiten Überprüfung an das Smartphone zurück. Ein separater Teil der Software vergleicht dieses neue Bild mit der ursprünglichen Referenzdatenbank, die während der Lehrphase erstellt wurde. Es stellt eine einfache Frage: Sieht dies exakt so aus wie der spezifische Gegenstand, den der Nutzer mir beigebracht hat?

Wenn das Bild den gespeicherten Referenzen eng genug entspricht, bestätigt der Roboter den Fund und meldet den Erfolg an den Nutzer. Wenn das Bild jedoch nicht übereinstimmt – zum Beispiel, wenn der Roboter vor einer anderen schwarzen Tasche stehen geblieben ist, die zwar ähnlich aussieht, aber nicht die richtige ist –, lehnt das System den Kandidaten ab. Der Roboter gibt nicht auf; er löscht sein Gedächtnis an dieser Stelle, dreht sich um und setzt die Suche fort, bis er den korrekten Gegenstand findet. Dieser Kreislauf aus Suchen, Anhalten, Prüfen und entweder Akzeptieren oder Weitersuchen ist das Herzstück des Systems. Er stellt sicher, dass der Roboter nicht einfach basierend auf einer allgemeinen Beschreibung rät, sondern die Identität des Objekts verifiziert, bevor er die Mission für abgeschlossen erklärt.

Die Forscher testeten dieses System in realen Umgebungen, darunter Schlafzimmer, Wohnzimmer, Küchen und sogar Gärten. Sie führten zweiunddreißig separate Missionen mit zehn verschiedenen Zielobjekten durch, die von beweglichen Gegenständen wie Regenschirmen und Handtüchern bis hin zu stationären Objekten wie Stühlen und Toiletten reichten. In diesen Versuchen war das System in 85 Prozent der Versuche erfolgreich, das Objekt korrekt zu finden. Um die Effektivität zu verdeutlichen, verglichen die Forscher es mit einem einfacheren Ansatz, bei dem der Roboter beim ersten Objekt stoppen und den Sieg verkünden würde, das halbwegs richtig aussah. Diese einfachere Methode war nur in 25 Prozent der Fälle erfolgreich und lag in drei Vierteln der Fälle falsch, indem sie oft den falschen Gegenstand lieferte. Das neue System war auch leistungsfähiger als eine Version, die ausschließlich auf einem leistungsstarken KI-Modell ohne den spezifischen Verifizierungsschritt basierte, welche in weniger als der Hälfte der gemeinsamen Versuche erfolgreich war.

Die Daten zeigten, dass die zusätzliche Zeit für das Prüfen und erneute Suchen die Mühe wert war. Während die erfolgreichen Missionen im Durchschnitt etwa drei Minuten und fünfundvierzig Sekunden dauerten, unterlief dem System selten ein Fehler. Im Gegensatz dazu waren die einfacheren Methoden schneller, führten aber häufig zu „falschen Erfolgen“, bei denen der Roboter behauptete, das Objekt gefunden zu haben, obwohl dies nicht der Fall war. Der Verifizierungsschritt war entscheidend; er filterte fast alle Fehlstopps heraus. Wenn der Robot an der falschen Stelle anhielt, erkannte das System den Fehler, schickte den Roboter wieder hinaus und fand schließlich das richtige Objekt. Diese Fähigkeit, aus einem Fehler zu lernen und die Suche fortzusetzen, bis die exakte Übereinstimmung gefunden ist, macht das System für einen Nutzer, der das Ergebnis nicht visuell bestätigen kann, zuverlässig.

Die Studie untersuchte auch, wie das System mit verschiedenen Arten von Objekten umgeht. Für Gegenstände, die bewegt werden können, wie eine Tasse oder ein Rucksack, stützt sich das System auf das visuelle Erscheinungsbild des Objekts selbst. Für Gegenstände, die an einem festen Platz verbleiben, wie ein bestimmter Stuhl an einem Schreibtisch, prüft das System zusätzlich den Kontext der Umgebung. Diese Unterscheidung ermöglichte es dem Roboter, die Komplexität eines echten Zuhauses zu bewältigen, in dem viele ähnliche Objekte existieren können. Die Forscher merkten an, dass das System zwar hocheffektiv, aber nicht perfekt ist; in einigen seltenen Fällen hatte der Roboter Schwierigkeiten, zwischen sehr ähnlichen Gegenständen zu unterscheiden, oder es kam zu technischen Unterbrechungen, doch dies waren Ausnahmen und nicht die Regel.

Letztendlich zeigt diese Arbeit, dass ein Roboter ein vertrauenswürdiger Partner für Menschen mit Sehbehinderungen sein kann, nicht nur indem er sie von einem Ort zum anderen bewegt, sondern indem er aktiv nach ihren persönlichen Bes belongings sucht. Die entscheidende Innovation liegt in der Trennung von Suche und Bestätigung. Indem man den Roboter die schwere körperliche Arbeit des Durchquerens des Raumes leisten lässt und dann eine strenge Prüfung durchführt, um sicherzustellen, dass das richtige Objekt gefunden wurde, schließt das System die Lücke zwischen dem, was der Roboter sieht, und dem, was der Nutzer benötigt. Die Ergebnisse legen nahe, dass Roboter mit einer solchen mehrstufigen Verifizierung über die reine Navigation hinaus zu zuverlässigen Assistenten für alltägliche Aufgaben werden können und den Nutzern die Gewissheit geben, dass wenn der Roboter meldet, er habe ihren Gegenstand gefunden, er dies auch wirklich getan hat.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →