← Neueste Arbeiten
💻 computer science

LH-AVLN: A Benchmark for Long-Horizon Audio-Visual-Language Navigation

Dieses Paper stellt LH-AVLN vor, einen neuen Benchmark für die langfristige audio-visuelle-sprachliche Navigation, der Agenten mit Multi-Ziel-Missionen in akustisch reichhaltigen Innenräumen herausfordert, und schlägt PAG-Nav vor, einen trainingsfreien Agenten, der binaurales Audio effektiv für die Suche nutzt, während er sich zur Zielerreichung auf visuell-semantische Verifizierung stützt.

Ursprüngliche Autoren: Rufeng Chen, Yue Chang, Zili Shao, Zhaofan Zhang, Li Chen, Hechang Chen, Hui Xiong, Sihong Xie

Veröffentlicht 2026-07-21
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Rufeng Chen, Yue Chang, Zili Shao, Zhaofan Zhang, Li Chen, Hechang Chen, Hui Xiong, Sihong Xie

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie bringen einem Roboter bei, der ultimative Hausdetektiv zu sein. Normalerweise geben wir einem Roboter, wenn wir ihm beibringen, sich in einem Haus zu bewegen, eine einfache Mission: „Finde den roten Ball.“ Er schaut mit seinen Kameraaugen um sich, erinnert sich vielleicht daran, wo er schon war, und läuft los, bis er das Objekt entdeckt. Dieses wissenschaftliche Feld wird als „Embodied Navigation“ bezeichnet – eine Form der Navigation, bei der ein Roboter lerte, sich durch die reale Welt zu bewegen, um eine Aufgabe zu lösen. Aber es gibt einen Haken: Die meisten dieser Trainingsspiele sind vollkommen lautlos. Der Roboter kann nur das sehen, was direkt vor seiner Linse liegt. Wenn der Ball hinter einer geschlossenen Tür oder in einer dunklen Ecke versteckt ist, ist der Roboter festgefahren, blind für alles außerhalb seines aktuellen Sichtfeldes.

Stellen Sie sich nun vor, Sie geben diesem Roboter eine Superkraft: Ohren. In der realen Welt bewegt sich Schall nicht nur in einer geraden Linie; er springt um Ecken und sickert durch Ritzen. Ein Roboter mit guten Ohren könnte das Bellen eines Hundes aus dem nächsten Zimmer hören oder das Tropfen eines Wasserhahns hinter einer Wand, was ihm einen Hinweis darauf gibt, wohin er gehen muss, selbst wenn er das Objekt noch nicht sehen kann. Diese Arbeit stellt eine große, knifflige Frage: Was passiert, wenn wir diese beiden Superkräfte kombinieren – Sehen und Hören – aber die Mission gleichzeitig viel schwieriger machen? Anstatt nur nach einer Sache zu suchen, was wäre, wenn der Roboter eine ganze Liste verschiedener Gegenstände finden müsste, von denen einige durch Wörter, andere durch Bilder und wieder andere nur durch ihren Namen beschrieben werden, während sich die Geräusche im Haus ständig ändern, während er das Rätsel löst?

Die Forscher hinter dieser Studie, angeführt von Rufeng Chen und Kollegen der Hong Kong University of Science and Technology und der Jilin University, haben eine neue Herausforderung namens LH-AVLN entwickelt. Betrachten Sie dies als ein hochkarätiges, mehrstufiges Videospiel für Roboter. In diesem Spiel wird der Roboter in ein 3D-Haus gesetzt und erhält eine „globale Mission“, die zwei bis vier verschiedene Ziele enthält. Diese Ziele sind knifflig: Eines könnte „Finde das Sofa“ (eine Kategorie) sein, ein anderes „Finde das hellgraue Sofa neben den transparenten Vorhängen“ (eine Beschreibung) und ein drittes „Finde dieses spezifische Bild eines Bettes“ (ein Bildreferenz).

Die eigentliche Wendung ist jedoch der Klang. In diesem Spiel macht jeder Gegenstand, nach dem der Roboter sucht, ein Geräusch. Aber hier ist der Haken: Die Geräusche sind keine festen Zielobjekte. Sobald der Roboter ein Ziel findet und abschließt, hört das Geräusch dieses Gegenstands auf. Währenddessen machen die Gegenstände, die er noch nicht gefunden hat, weiterhin Geräusche und wechseln sich dabei ab, wer am lautesten ist. Dies schafft eine verwirrende Situation. Wenn der Roboter nach einem Sofa sucht, aber das Geräusch einer Toilettenspülung hört (weil er die Toilette noch nicht gefunden hat), ist das Geräusch eine Ablenkung. Der Roboter muss herausfinden: „Hilft mir dieses Geräusch, mein aktuelles Ziel zu finden, oder ist es ein Ablenkungsmanöver, das mich zu einer anderen, noch nicht abgeschlossenen Aufgabe führt?“

Um dies zu testen, erstellten die Autoren einen riesigen Datensatz mit über 150.000 Episoden, in denen Roboter diese verrauschten Multi-Ziel-Missionen bewältigen müssen. Sie fanden heraus, dass bestehende Roboter – selbst die intelligenten, die gut darin sind, Anweisungen zu folgen oder visuelle Karten zu speichern – extrem Schwierigkeiten haben. Wenn das Geräusch verwirrend wird oder die Mission lang wird, verirren sich diese Roboter oder geben auf. Sie können nicht zwischen einem hilfreichen Hinweis und einem störenden Geräusch unterscheiden.

Um zu zeigen, wie schwer dies ist, entwickelte das Team ihren eigenen Roboter-Agenten namens PAG-Nav. Dieser Roboter nutzt kein komplexes Training zum Lernen, sondern eine kluge Strategie. Er führt eine mentale Karte des gesamten Hauses, verfolgt, wo er gewesen ist, was er gesehen hat und woher die Geräusche kommen. Er nutzt den Klang, um seine Suche zu leiten, wenn er nichts sehen kann, aber er weigert sich zu sagen „Ich habe es gefunden!“, bis er einen guten, klaren Blick auf das Objekt erhalten hat, um sicherzustellen, dass es das richtige ist. Selbst mit dieser klugen Strategie besteht der Roboter nur in etwa 2 % bis 3 % der geordneten Missionen und in 3 % bis 5 % der ungeordneten Missionen.

Das Hauptergebnis dieser Arbeit ist, dass das Hinzufügen von Sound zu langen, komplexen Missionen die aktuelle Technologie erheblich erschwert, anstatt sie zu erleichtern. Die Autoren argumentieren, dass Sound zwar ein mächtiges Werkzeug ist, um Dinge zu finden, die verborgen sind, aber zu einem Albtraum wird, wenn der Roboter nicht herausfinden kann, welches Geräusch zu welcher Aufgabe gehört. Sie führen aus, dass die Zukunft der Roboternavigation nicht nur darin besteht, besser zu sehen oder besser zu hören, sondern darin, zu lernen, das Rauschen zu ignorieren und sich zur richtigen Zeit auf den richtigen Hinweis zu konzentrieren. Die Arbeit kommt zu dem Schluss, dass wir dieses Rätsel noch lange nicht gelöst haben, was viel Raum für zukünftige Erfinder lässt, die Roboter bauen können, die wirklich in einer lauten, multitaskingfähigen Welt navigieren können.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →