VEGA: Learning Navigation VLAs from In-the-Wild Egocentric Video with Geometric Trajectory Supervision
VEGA führt eine Methode zum Training von Navigations-Vision-Language-Action-Modellen aus unbeschrifteten egozentrischen Videos ein, indem die lokale Szenengeometrie rekonstruiert wird, um hindernisbewusste Trajektorien für die Supervision zu generieren, wodurch signifikante Verbesserungen bei der Kollisionsvermeidung und den Erfolgsraten im Vergleich zu bestehenden Baselines erzielt werden.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie möchten einem Roboter beibringen, durch einen belebten Raum zu laufen, ohne gegen Stühle, Menschen oder Tische zu stoßen. Normalerweise müssen Sie einem Roboter dies beibringen, indem Sie entweder:
- Einen Menschen aufnehmen, der durch genau diesen Raum läuft, während der Roboter zusieht, oder
- Den Roboter manuell so programmieren, dass er bestimmte Hindernisse umgeht.
Beides ist langsam, teuer und schwer skalierbar. Man kann nicht für jeden möglichen Raum auf der Welt eine Aufnahme eines Menschen erstellen, der hindurchläuft.
Hier kommt VEGA ins Spiel.
Die Forscher hinter dieser Arbeit haben einen cleveren Weg gefunden, um Roboter die Navigation mithilfe von Milliarden von „In-the-Wild“-Videos aus dem Internet beizubringen (wie zum Beispiel Videos von Menschen, die durch ihre Häuser laufen, auf Wanderwegen wandern oder durch belebte Straßen gehen). Diese Videos sind großartig, weil sie echte, unordentliche, überladene Umgebungen zeigen, aber sie haben ein großes Problem: Sie sagen dem Roboter nicht, wohin er gehen soll oder wie er Hindernissen ausweichen muss. Sie sind lediglich „aktionsfreie“ Videos.
So verwandelt VEGA diese zufälligen Videos in einen Navigationslehrer, indem es einige kreative Schritte nutzt:
1. Der „Mentale Karten“-Trick
Zuerst betrachtet VEGA einen einzelnen Frame eines Videos und nutzt eine spezielle KI, um eine 3D-mentale Karte des Raumes zu erstellen. Es findet heraus, wo der Boden ist, wo die Wände sind und wo die Hindernisse (wie ein Couchtisch oder ein Hund) stehen. Es erstellt eine „Sicherheitskarte“, die genau weiß, wie viel Platz zum Gehen zur Verfügung steht.
2. Das „Was wäre wenn?“-Spiel
Sob�in der Karte wird VEGA ein Spiel namens „Was wäre wenn?“ spielen:
- Was wäre, wenn der Roboter zu diesem roten Stuhl wollte?
- Was wäre, wenn er zur Tür wollte?
- Was wäre, wenn er einfach zu einem leeren Fleck auf dem Teppich laufen wollte?
Für jedes mögliche Ziel berechnet VEGA mithilfe eines mathematischen Planers den perfekten, sicheren Pfad, um dorthin zu gelangen, ohne etwas zu treffen. Dies geschieht Millionen Male, wodurch eine riesige Bibliothek aus „Ziel + Sicherer Pfad“-Paaren entsteht.
3. Der „Schüler“-Roboter
Nun trainiert VEGA ein Robotergehirn (ein sogenanntes VLA- oder Vision-Language-Action-Modell). Dieser Schüler-Roboter schaut sich das Originalvideo an und sieht den von VEGA berechneten „Sicheren Pfad“.
- Die Lektion: „Hier ist das, was du siehst (das Video), hier ist, wohin du willst (das Ziel), und hier ist der sichere Pfad, den du nehmen solltest.“
- Das Ergebnis: Der Roboter lernt, eine Szene zu betrachten, ein Ziel zu verstehen (wie „gehe in die Küche“ oder „gehe zu diesem Bild“) und sofort einen sicheren Pfad zu finden, indem er nur den Kamera-Feed nutzt. Er braucht die 3D-Karte nicht mehr, sobald er trainiert ist; er nutzt einfach seine Augen und sein Gehirn.
Warum ist das eine große Sache?
Denken Sie an das Erlernen des Autofahrens.
- Der alte Weg: Sie lernen das Autofahren nur, indem ein Fahrlehrer neben Ihnen in einem ganz bestimmten Auto auf einer ganz bestimmten Straße sitzt und Ihnen genau sagt, wann Sie abbiegen müssen.
- Der VEGA-Weg: Sie schauen sich Millionen Stunden von Dashcam-Aufnahmen aus der ganzen Welt an. Sie nutzen einen Computer, um für jedes mögliche Ziel in diesen Videos die „perfekten Fahrlinien“ zu berechnen. Dann trainieren Sie Ihr Gehirn, diese perfekten Linien nachzuahmen.
Die Ergebnisse
Die Forscher haben dies an einem echten Roboter in unordentlichen, überladenen Räumen mit beweglichen Hindernissen getestet. Im Vergleich zu anderen Top-Navigationssystemen für Roboter:
- Erfolg: Der Roboter erreichte sein Ziel viel häufiger (mindestens 150 % besser).
- Sicherheit: Er stieß 66 % seltener gegen Gegenstände.
- Platz: Er ließ sich selbst mehr Platz zum Manövrieren und vermied enge Passagen um 60 % häufiger.
Sie haben auch einen riesigen Test namens VEGA-Bench erstellt (mit 250.000 Szenen und 5 Millionen Zielen), um zu beweisen, dass ihre Methode besser als die Konkurrenz darin ist, Kollisionen zu vermeiden und spezifische Ziele zu erreichen.
Kurz gesagt: VEGA nimmt das Chaos der Videothek des Internets, verwandelt es mithilfe von Geometrie in ein strukturiertes „Sicherheitshandbuch“ und bringt Robotern bei, in der realen Welt zu navigieren, ohne dass teure, händisch aufgezeichnete Trainingssitzungen nötig sind.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.