← Neueste Arbeiten
💻 computer science

Closing the Lab-to-Store Gap: A Data-Efficient Post-Training and Experience-Driven Learning VLA Framework for Retail Humanoids

Dieses Paper stellt DEED vor, ein Framework auf Systemebene, das die Lücke zwischen Labor-Benchmarks und realen Einzelhandelsabläufen für humanoide Roboter schließt, indem es dateneffizientes Post-Training, erfahrungsbasierte Verfeinerung und Latent-Space-Analyse kombiniert, um eine robuste Leistung bei einer Chip-Restocking-Aufgabe mit minimalen Rechenressourcen zu erreichen.

Ursprüngliche Autoren: Roger Sala Sisó, Tiago Silvério, Jakob Sand, Tran Nguyen Le

Veröffentlicht 2026-07-23
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Roger Sala Sisó, Tiago Silvério, Jakob Sand, Tran Nguyen Le

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einem Roboter eine Aufgabe beizubringen, wie zum Beispiel Wäsche zu falten oder ein Regal aufzufüllen. Man könnte denken, der schwierigste Teil sei der Bau des Gehirns des Roboters, damit er die Welt „sieht“ und „versteht“. Doch in der Welt der Robotik gibt es eine knifflige Lücke zwischen dem, was in einem perfekten, kontrollierten Labor geschieht, und dem, was in einem unordentlichen, echten Supermarkt passiert. Im Labor wirken Roboter oft wie Genies, aber bringt man sie vor die Tür, stolpern sie vielleicht über einen Teppich oder lassen einen Gegenstand fallen, weil sich das Licht geändert hat oder ein Karton leicht schief steht.

Um diese Lücke zu schließen, nutzen Wissenschaftler etwas, das man ein Vision-Language-Action-Modell (VLA) nennt. Betrachten Sie ein VLA als ein superintelligentes Robotergehirn, das das gesamte Internet gelesen hat. Es weiß, wie eine „Chipstüte“ aussieht, es versteht den Satz „Leg das ins Regal“ und es weiß, wie es seine Arme bewegen muss, um dies zu tun. Diese Modelle sind leistungsstark, aber sie sind wie Schüler, die bisher nur aus Lehrbüchern gelernt haben. Sie haben die Hausaufgaben in der realen Welt noch nicht tatsächlich gemacht. Sie haben Schwierigkeiten, wenn Dinge nicht exakt nach Plan laufen, und sie können nicht aus ihren eigenen Fehlern lernen, sobald sie eingeschaltet sind. Die große Frage, die sich Forscher stellen, ist: Wie nehmen wir diese brillanten, aber unerfahrenen Robotergehirne und verwandeln sie in zuverlässige Arbeiter, ohne dafür Millionen von Dollar an Supercomputern zu benötigen?

Dieses Paper stellt eine neue Methode namens DEED (Data-Efficient Post-Training and Experience-Driven Learning) vor, um genau dieses Problem zu lösen. Die Forscher testeten ihre Idee an einem Unitree G1-Edu Roboter, einem humanoiden Roboter, der einer menschlichen Gestalt ähnelt und versucht, eine sehr spezifische Aufgabe zu erfüllen: Chipstüten in einem Supermarkt aufzufüllen. Sie fanden heraus, dass das Geheimnis, den Roboter zum Arbeiten zu bringen, nicht darin bestand, eine neue, komplexere Gehirnarchitektur zu erfinden. Stattdessen ging es darum, ein sehr sorgfältiger Lehrer zu sein.

Zuerheerst stellten sie fest, dass es nicht funktionierte, einfach ein vortrainiertes Robotergehirn herunterzuladen und ihm zu sagen: „Los geht’s“; der Roboter scheiterte komplett. Das Problem war, dass der Roboter versuchte, aus unordentlichen, inkonsistenten Daten zu lernen, und durch das Timing seiner Kameras und Bewegungen verwirrt war. Das Team behob dies, indem sie ein „dateneffizientes“ Rezept erstellten. Sie bereinigten die Trainingsvideos, um Zögern und Fehler zu entfernen, synchronisierten die Geschwindigkeit der Kamera des Roboters mit seiner Bewegungsgeschwindigkeit (damit er nicht schneller versucht, sich zu bewegen, als er sehen kann), und nutzten sogar ein Hilfswerkzeug, um hervorzuheben, wo der Roboter genau hinschauen sollte, wie etwa das Zeichnen eines grünen Kastens um die leere Stelle im Regal. Sie vereinfachten auch die Aufgabe des Roboters, indem sie seine Hand wie einen einfachen Ein/Aus-Schalter behandelten, anstatt zu versuchen, jeden winzigen Muskel zu steuern. Mit nur diesen sorgfältigen Anpassungen und einer einzigen Grafikkarte verwandelten sie einen Roboter, der einen Erfolg von 0 % hatte, in einen, der in 32 % der Fälle Chips auffüllen konnte.

Als Nächstes versuchten sie, den Roboter noch besser zu machen, indem sie ihn von seiner eigenen Erfahrung lernen ließen – ein Prozess, der als „Experience-Driven Learning“ bezeichnet wird. Sie ließen den Roboter die Aufgabe alleine versuchen, und wenn er Fehler machte, griff ein Mensch ein, um ihn zu korrigieren. Der Roboter nutzte diese Korrekturen dann, um sein Gehirn zu aktualisieren. Das funktionierte! Nach einer Runde dieser Übung sprang die Erfolgsquote des Roboters auf 42 %, und seine Bewegungen wurden schneller und direkter.

Das Paper deutet jedoch auch eine Warnung an, dies zu oft zu tun. Als sie versuchten, eine zweite Runde des Übens durchzuführen, wurde der Roboter tatsächlich schlechter und fiel auf 22 % Erfolg zurück. Die Autoren vermuten, dass dies geschah, weil der Roboter begann, sich zu sehr auf seine eigenen „Halluzinationen“ darüber zu verlassen, was funktioniert hätte, anstatt auf die soliden Beispiele, die der menschliche Lehrer gab. Es ist, als ob ein Schüler nur üben würde, indem er die Antworten auf seine eigenen erfundenen Tests rät; irgendwann vergisst er schließlich die echten Regeln. Das Team baute zudem ein spezielles Werkzeug, um in das Gehirn des Roboters in Echtzeit zu schauen und zu messen, wie „seltsam“ seine aktuelle Situation im Vergleich zu dem war, wofür er trainiert worden war. Dieses Werkzeug half ihnen zu sehen, wann genau der Roboter in gefährliches, unbekanntes Terrain abdriftete.

Letztendlich legt das Paper nahe, dass die größte Hürde für den Einsatz von humanoiden Robotern in Geschäften nicht der Bau eines klügeren Gehirns ist, sondern der Bau eines besseren Trainingssystems. Indem wir die Daten sorgfältig kuratieren und wissen, wann wir den Roboter vom „Üben“ auf eigene Faust abhalten müssen, können wir ein tollpatschiges, vortrainiertes Modell mit sehr wenig Rechenleistung in einen kompetenten Arbeiter verwandeln. Die Forscher fanden heraus, dass zwar eine Runde der Selbstkorrektur hilft, zu viel davon aber schaden kann, und dass der Schlüssel zum Erfolg im Ausbalancieren der eigenen Erfahrungen des Roboters mit der zuverlässigen Anleitung durch menschliche Demonstrationen liegt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →