← Neueste Arbeiten
💻 computer science

Embodied Agents Take Control: Minimal-Interface Zero-Shot Agents Rival Industrial-Scale Policies in Vision-and-Language Navigation

Diese Arbeit zeigt, dass Zero-Shot-Embodied-Agenten, die eine allgemeine agentische Steuerung mit minimalen Schnittstellen nutzen, bei der Vision-and-Language-Navigation mit industriellen Modellen konkurrieren können, wobei sie bis zu 78 % Erfolgsquote erreichen und gleichzeitig hervorheben, dass die Modellwahl der primäre Leistungsfaktor gegenüber spezifischen Software-Harnesses ist.

Ursprüngliche Autoren: Jian Zhou, Xunyi Zhao, Gengze Zhou, Zerui Li, Sihao Lin, Jiajun Liu, Qi Wu

Veröffentlicht 2026-07-30
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Jian Zhou, Xunyi Zhao, Gengze Zhou, Zerui Li, Sihao Lin, Jiajun Liu, Qi Wu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich eine Welt vor, in der Ihr Toaster nicht nur Brot toasten kann, sondern auch entscheiden kann, welche Scheibe er toastet, prüft, ob die Küche sauber ist, und herausfindet, wie er das Brot auf den Tisch bringt, ohne das Haus niederzubrennen. Dies ist der Traum der Embodied AI (verkörperte KI): Computern einen physischen Körper (wie einen Roboter) zu geben und ihnen die geistige Kapazität zu verleihen, eigenständig durch die reale Welt zu navigieren. Lange Zeit haben Wissenschaftler versucht, diese Roboter entweder zu „trainieren“ wie Hunde (indem sie dieselbe Aufgabe tausendfach wiederholen, bis sie sie richtig beherrschen) oder ihnen ein strenges „Skript“ zu geben (eine vom Menschen geschriebene Liste von Regeln wie „Wenn du eine Tür siehst, öffne sie“). Aber was wäre, wenn wir einfach einem superintelligenten Computer eine Kamera und ein paar grundlegende Knöpfe gaben, ihm sagten: „Geh die Küche finden“, und ihn den Rest selbst herausfinden ließen? Das ist die große Frage, die dieses Paper stellt: Kann eine universell einsetzbare KI, ohne spezielles Robotertraining, das Steuer übernehmen und sich selbst durch ein Haus steuern?

Die Forscher hinter dieser Studie entschieden sich, diese Idee mithilfe eines digitalen Roboters in einem simulierten Haus zu testen. Sie entfernten all die ausgeklügelten Werkzeuge, die normalerweise für die Navigation verwendet werden – keine Karten, kein GPS, keine vorprogrammierten Pfade und kein spezielles „Robotergehirn“-Training. Stattdessen gaben sie der KI eine einzige Kamera, die nur sieht, was direkt vor ihr liegt (wie ein Mensch, der durch ein Guckloch schaut), und vier einfache Befehle: vorwärts bewegen, nach links drehen, nach rechts drehen und anhalten. Dann baten sie die KI, komplexen Sprachanweisungen zu folgen, wie zum Beispiel: „Gehe am Pool vorbei, gehe zwischen der Bar und den Stühlen hindurch und halte an der Ecke an.“ Das Ziel war es zu sehen, ob die KI als echter „Agent“ agieren konnte – ein Entscheidungsträger, der beobachtet, denkt, handelt und seine eigenen Fehler korrigiert, ohne dass ein Mensch ihm die Hand hält.

Die Ergebnisse waren überraschend spannend, aber auch demütigend. Das Team stellte fest, dass diese „Zero-Shot“-Agenten (was bedeutet, dass sie zuvor noch nie einen Roboter gesehen hatten) tatsächlich recht gut navigieren konnten. Unter Verwendung eines leistungsstarken KI-Modells namens fable-5 erreichte der Roboter sein Ziel in 78 % der Fälle im Standardtest, obwohl er über keine Karten oder spezielles Training verfügte. Dies ist eine große Sache, da es die Leistung teurer, industrieller Roboter erreicht, die auf Millionen von Beispielen trainiert wurden. Es deutet darauf hin, dass das „Gehirn“ selbst die meiste Arbeit leistet und nicht die spezielle Software, die um es herum gebaut wurde.

Das Paper zieht jedoch auch eine klare Linie. Während die KI bei kurzen Strecken großartig ist, gerät sie ins Straucheln, wenn die Reise länger wird. Wenn die Aufgabe erfordert, durch viele Räume zu laufen oder sich zu erinnern, wo sie vor fünf Minuten war, sinkt die Erfolgsquote drastlich auf zwischen 26 % und 39 %. Die KI wird verwirrt, weil sie alles, was sie gesehen hat, im Gedächtnis behalten muss, und ihr „Gedächtnis“ wird zu überfüllt. Zudem, als die Forscher dies an einem echten, physischen Roboterhund testeten, konnte die KI zwar perfekt schlussfolgern, prallte aber ständig gegen Wände, weil sie nicht verstand, wie viel Platz ihr eigener Körper einnimmt. Sie wusste, wohin sie gehen sollte, aber nicht, wie sie durch die Tür passen würde.

Am Ende legt das Paper nahe, dass wir an der Schwelle zu einer neuen Ära stehen. Wir müssen nicht unbedingt für jede Aufgabe ein neues, spezielles Robotergehirn bauen; wir müssen vielleicht nur unsere bestehenden superintelligenten KIs die Kontrolle übernehmen lassen, vorausgesetzt, wir geben ihnen die richtigen Werkzeuge, um ihr eigenes Gedächtnis zu verwalten und ihren physischen Körper zu verstehen. Es ist ein Schritt in Richtung der Zeit, in der Ihr Roboter nicht nur Befehle befolgt, sondern tatsächlich sein eigenes Abenteuer selbst in die Hand nimmt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →