← Neueste Arbeiten
⚡ electrical engineering

VLN on the Fly: An Onboard Vision-Language Navigation Stack for Aerial Robots

Das Papier präsentiert „VLN on the Fly“, einen modularen Onboard-Vision-Language-Navigation-Stack für Luftroboter, der Grounding, Planung und Steuerung in distinkte Phasen unterteilt, um hohe Erfolgsraten und Sicherheit bei gleichzeitig geringem Rechenaufwand zu erreichen.

Ursprüngliche Autoren: Marco S. Tayar, Felipe Tommaselli, Gianluca Capezutto, Pedro Antonio Rabelo Saraiva, Pedro H. V. de Freitas, Lucas Kido, Guilherme Sonego, Ricardo V. Godoy, Marcelo Becker

Veröffentlicht 2026-09-18
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Marco S. Tayar, Felipe Tommaselli, Gianluca Capezutto, Pedro Antonio Rabelo Saraiva, Pedro H. V. de Freitas, Lucas Kido, Guilherme Sonego, Ricardo V. Godoy, Marcelo Becker

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Im leisen Summen eines Lagers oder in den vollgestellten Ecken eines Hauses lernt eine neue Art von Roboter, zuzuhören. Seit Jahren versuchen Wissenschaftler, Maschinen beizubringen, menschliche Sprache zu verstehen und nach ihr zu handeln – ein Feld, das als Vision-Language Navigation bekannt ist. Die Idee ist simpel: Eine Person sagt: „Geh zum roten Stuhl“, und der Roboter findet heraus, wo sich dieser Stuhl befindet, und fliegt oder fährt dorthin. Während dies in kontrollierten Computersimulationen gut funktioniert, sieht die Realität bei einem echten fliegenden Roboter ganz anders aus. Der Roboter muss die Welt sehen, die Worte verstehen, einen sicheren Pfad durch die Luft planen und seine Motoren steuern, während er gleichzeitig seinen eigenen Computer und seine Batterie mit sich trägt. Wenn der Roboter die Worte missversteht oder eine Kurve falsch berechnet, könnte er abstürzen. Die Herausforderung besteht darin, ein System zu bauen, das intelligent genug ist, um Anweisungen zu folgen, aber sicher genug, um ohne ständige menschliche Aufsicht zu fliegen.

Ein Forscherteam der Universität von São Paulo hat ein System namens „VLN on the Fly“ entwickelt, um dieses Problem zu lösen. Anstatt zu versuchen, ein einziges, massives Computerprogramm zu lehren, alles auf einmal zu erleden, haben sie die Aufgabe in drei klare Schritte unterteilt, die wie bei einem Staffellauf zusammenarbeiten. Zuer das betrachtet ein spezialisiertes Sprachmodell den Kamerafeed und die gesprochene Anweisung, um einen allgemeinen Bereich zu finden, in dem sich das Zielobjekt befinden könnte. Zweitens nimmt ein Planungssystem diesen allgemeinen Bereich und nutzt Tiefeninformationen, um einen glatten, sicheren 3D-Pfad durch die Luft zu berechnen. Drittens nimmt eine trainierte Steuerungsstrategie diesen Pfad und gibt direkt Befehle an die Motoren der Drohne weiter, um diesem zu folgen. Dieser schrittweise Ansatz ermöglicht es den Forschern, jeden Teil des Prozesses zu überprüfen und sicherzustellen, dass das System genau weiß, wo das Problem liegt, falls ein Schritt fehlschlägt, und so einen Absturz verhindern kann.

Die Forscher testeten dieses System an einer kleinen Quadrotor-Drohne, die mit einer Kamera und einem kompakten Onboard-Computer ausgestattet war. Sie platzierten Alltagsgegenstände wie einen Mülleimer, einen Stuhl und einen Feuerlöscher in einem Raum und baten die Drohne, basIn der leisen Untermalung eines Lagers oder in den vollgestellten Ecken eines Hauses lernt eine neue Art von Roboter, zuzuhören. Seit Jahren versuchen Wissenschaftler, Maschinen beizubringen, menschliche Sprache zu verstehen und nach ihr zu handeln – ein Feld, das als Vision-Language Navigation bekannt ist. Die Idee ist simpel: Eine Person sagt: „Geh zum roten Stuhl“, und der Roboter findet heraus, wo sich dieser Stuhl befindet, und fliegt oder fährt dorthin. Während dies in kontrollierten Computersimulationen gut funktioniert, sieht die Realität bei einem echten fliegenden Roboter ganz anders aus. Der Roboter muss die Welt sehen, die Worte verstehen, einen sicheren Pfad durch die Luft planen und seine Motoren steuern, während er gleichzeitig seinen eigenen Computer und seine Batterie mit sich trägt. Wenn der Roboter die Worte missversteht oder eine Kurve falsch berechnet, könnte er abstürzen. Die Herausforderung besteht darin, ein System zu bauen, das intelligent genug ist, um Anweisungen zu folgen, aber sicher genug, um ohne ständige menschliche Aufsicht zu fliegen.

Ein Forscherteam der Universität von São Paulo hat ein System namens „VLN on the Fly“ entwickelt, um dieses Problem zu lösen. Anstatt zu versuchen, ein einziges, massives Computerprogramm zu lehren, alles auf einmal zu erledend, haben sie die Aufgabe in drei klare Schritte unterteilt, die wie bei einem Staffellauf zusammenarbeiten. Erstens betrachtet ein spezialisiertes Sprachmodell den Kamerafeed und die gesprochene Anweisung, um einen allgemeinen Bereich zu finden, in dem sich das Zielobjekt befinden könnte. Zweitens nimmt ein Planungssystem diesen allgemeinen Bereich und nutzt Tiefeninformationen, um einen glatten, sicheren 3D-Pfad durch die Luft zu berechnen. Drittens nimmt eine trainierte Steuerungsstrategie diesen Pfad und gibt direkt Befehle an die Motoren der Drohne weiter, um diesem zu folgen. Dieser schrittweise Ansatz ermöglicht es den Forschern, jeden Teil des Prozesses zu überprüfen und sicherzustellen, dass das System genau weiß, wo das Problem liegt, falls ein Schritt fehlschlägt, und so einen Absturz verhindern kann.

Die Forscher testeten dieses System an einer kleinen Quadrotor-Drohne, die mit einer Kamera und einem kompakten Onboard-Computer ausgestattet war. Sie platzierten Alltagsgegenstände wie einen Mülleimer, einen Stuhl und einen Feuerlöscher in einem Raum und baten die Drohne, basierend auf Sprachbefehlen zu ihnen zu fliegen. In fünfzehn separaten Flügen erreichte die Drohne ihr Ziel in dreizehn Fällen. Bei der Ankunft war sie im Durchschnitt weniger als sechs Zentimeter vom beabsichtigten Ort entfernt. Das System funktionierte gut, selbst wenn die Drohne Hindernissen ausweichen musste, indem sie Pfade plante, die Kollisionen in einer unordentlichen Umgebung vermieden. Der gesamte Prozess lief auf der Drohne selbst ab und verbrauchte etwa 39 Prozent der Leistung des Onboard-Computers, was genügend Spielraum für andere Aufgaben lässt.

Eine der wichtigsten Erkenntnisse war, wie das System mit Unsicherheit umgeht. Das Sprachmodell versucht nicht, den exakten Pixel eines Objekts zu bestimmen, was fehleranfällig sein kann. Stattdessen unterteilt es die Kameraansicht in ein einfaches Gitter und wählt die allgemeine Zelle aus, in der sich das Objekt wahrscheinlich befindet. Dieser grobe Ansatz erwies sich als wesentlich zuverlässiger. Wenn das System in einem Raum voller Hindernisse getestet wurde, vermied es in den meisten Versuchen erfolgreich Kollisionen. In den wenigen Fällen, in denen es das Ziel nicht erreichte, lag dies meist daran, dass das Objekt aus dem Sichtfeld der Kamera geriet oder der Tiefensensor nicht weit genug sehen konnte, und nicht daran, dass die Drohne die Kontrolle verlor. Die Forscher fanden auch heraus, dass das System zwischen verschiedenen Objekten unterscheiden konnte, indem es korrekt einen Stuhl identifizierte, wenn nach einem Stuhl gefragt wurde, und einen Mülleimer, wenn nach einem Behälter gefragt wurde, selbst wenn beide im selben Raum standen.

Der Erfolg dieses Projekts unterstreicht einen Wandel in der Art und Weise, wie autonome Roboter gebaut werden. Anstatt sich auf ein einziges, komplexes neuronales Netzwerk zu verlassen, das versucht, alles gleichzeitig zu lernen, zeigt diese Arbeit, dass die Trennung der Aufgaben – Verstehen, Planen und Steuern – zu sichereren und zuverlässigeren Ergebnissen führt. Indem die Forscher die Schritte klar voneinander abgrenzten, konnten sie verifizieren, dass die Drohne nicht bloß rät, sondern tatsächlich einem logischen Pfad vom gesprochenen Wort bis zur physischen Bewegung folgt. Obwohl das System noch Grenzen hat, wie etwa die Notwendigkeit, das Objekt zu sehen, um es zu finden, und die Abhängigkeit von der Reichweite des Tiefensensors, zeigt es, dass fliegende Roboter bald in der Lage sein werden, komplexen Innenräumen unter Verwendung einfacher menschlicher Sprache zu navigieren, was die Tür für zukünftige Anwendungen in der Inspektion, Lieferung und bei Such- und Rettungseinsätzen öffnet.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →