← Neueste Arbeiten
💻 computer science

ExToken: Structured Exploration for Efficient Vision-Language-Action Reinforcement Fine-tuning

Dieses Paper führt ExToken ein, ein Reinforcement-Learning-Framework, das die Stichprobeneffizienz und Konvergenz von Vision-Language-Action-Modellen verbessert, indem es Policies auf diskreten Verhaltens-Priors für strukturierte Exploration bedingt und einen zustandsbedingten Token-Selector nutzt, um die Trainingsdiversität mit deterministischer Bereitstellung zu überbrücken.

Ursprüngliche Autoren: Yilun Kong, Yunpeng Qing, Guozheng Ma, Haoyu Wang, Li Shen, Zhi Hou, Dacheng Tao

Veröffentlicht 2026-07-15
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Yilun Kong, Yunpeng Qing, Guozheng Ma, Haoyu Wang, Li Shen, Zhi Hou, Dacheng Tao

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie bringen einem Roboter bei, ein Hemd zu falten oder einen Tisch abzuwischen. Sie möchten, dass der Roboter durch Ausprobieren lernt, Dinge versucht und sieht, was funktioniert. Das nennt man Reinforcement Learning (RL). Aber hier ist der Haken: Roboter sind teuer, und die reale Welt ist chaotisch. Wenn man einen Roboter einfach alles „ausprobieren“ lässt, könnte er Stunden damit verbringen, exakt denselben dummen Fehler immer und immer wieder zu wiederholen. Er bleibt in einer Schleife stecken, wie ein Hamster auf einem Laufrad, der nirgendwohin läuft.

Die Autoren dieser Arbeit, ExToken, haben bemerkt, dass dieses „Steckenbleiben“-Verhalten ein riesiges Problem ist. Sie fanden heraus, dass die Aktionen eines Roboters in der aktuellen Roboter-Trainingsphase sehr schnell langweilig ähnlich werden. Sie nennen das „Action Mode Collapse“. Es ist wie ein Schüler, der, nachdem er einmal eine Mathearbeit verhauene hat, beschließt, einfach bei jeder zukünftigen Prüfung dieselbe falsche Antwort zu kopieren, weil sich das sicher anfühlt. Der Roboter hört auf, neue Wege zu finden, um das Problem zu lösen.

Die große Entdeckung: Vielfalt schlägt Quantität

Die Forscher stellten eine einfache Frage: Ist es besser, eine Million Versuche zu haben, die alle gleich sind, oder ein paar hundert Versuche, die alle unterschiedlich sind?

Um das herauszufinden, ließen sie eine Simulation laufen. Sie verglichen drei Gruppen von Robotern:

  1. Eine Gruppe, die 1.024 Mal unter Verwendung von standardmäßiger, zufälliger Exploration versuchte.
  2. Eine Gruppe, die nur 512 Mal versuchte (die Hälfte so viele).
  3. Eine Gruppe, die 1.024 Mal versuchte, aber die langweiligen, repetitiven Versuche wegwarf und nur die 512 am meisten unterschiedlichen und einzigartigen Versuche behielt.

Das Ergebnis war überraschend. Die Gruppe, die nur die 512 einzigartigen, vielfältigen Versuche behielt, schnitt genauso gut ab wie die Gruppe, die 1.024 Mal versuchte. Tatsächlich schnitt sie viel besser ab als die Gruppe, die 512 Mal mit der standardmäßigen, langweiligen Methode versuchte. Das Paper legt nahe, dass die Diversität der Versuche weitaus wichtiger ist als die bloße Anzahl der Versuche. Wenn man immer wieder dasselbe versucht, lernt man nicht; man übt nur, steckenzubleiben.

Die Lösung: ExToken (Das „Verhaltensmenü“)

Wie verhindert man also, dass ein Roboter in einer Schleife stecken bleibt? Die Autoren führten einen cleveren Trick namens ExToken ein.

Stellen Sie sich vor, Sie geben einem Roboter ein Menü mit verschiedenen „Persönlichkeiten“ oder „Stilen“ zum Ausprobieren. Anstatt nur zu sagen: „Geh und versuche, das Hemd zu falten“, bekommt der Roboter ein spezielles Token (ein kleines digitales Etikett), das sagt: „Heute versuche, es wie ein professioneller Koch zu falten“, oder „Heute versuche, es wie ein gehetzter Teenager zu falten“, oder „Heute versuche, es vorsichtig zu falten“.

So haben sie dieses Menü aufgebaut:

  1. Die Bibliothek: Sie betrachteten eine Menge Videos von Menschen, die Aufgaben ausführten (wie das Falten von Kleidung).
  2. Die Sortierung: Sie nutzten ein Computergehirn, um diese Videos basierend darauf, wie die Menschen sich bewegten, in Cluster einzuteilen. Vielleicht war eine Gruppe „langsam und vorsichtig“ und eine andere „schnell und direkt“.
  3. Die Tokens: Jede Gruppe erhielt ein Token. Diese Tokens repräsentieren verschiedene Arten, die Aufgabe zu erledigen.
  4. Das Training: Wenn der Roboter übt, wählt der Computer zufällig ein Token aus dem Menü aus und sagt dem Roboter: „Nutze diesen Stil heute!“ Dies zwingt den Roboter, verschiedene Bewegungsabläufe zu erforschen, um sicherzustellen, dass er nicht in einer langweiligen Schleife stecken bleibt.

Der magische Schalter: Der Token-Selektor

Es gibt ein Problem mit diesem Menü-Ansatz: Während des eigentlichen Jobs (wie in einer echten Küche) kann man nicht einfach einen zufälligen Stil wählen. Man muss genau wissen, welcher Stil für dieses spezifische Hemd auf diesem spezifischen Tisch am besten funktioniert.

Um dies zu lösen, fügt ExToken einen „Token Selector“ hinzu. Denken Sie an einen smarten Manager, der die Szene betrachtet (das Hemd, den Tisch, die Beleuchtung) und sofort das perfekte Token aus dem Menü auswählt.

  • Während des Trainings: Probiert der Manager verschiedene Tokens aus, um zu sehen, was funktioniert.
  • Während des eigentlichen Jobs: Betrachtet der Manager die Situation und entscheidet selbstbewusst: „Okay, für dieses spezifische Durcheinander nutzen wir das Token ‚Vorsichtiger Koch‘.“

Dies ermöglicht es dem Roboter, während des Lernens wild und kreativ zu explorieren, aber bei der eigentlichen Arbeit mit perfekter, deterministischer Präzision zu agieren.

Was die Zahlen sagen

Das Paper testete diese Idee auf zwei Arten: in Computersimulationen und an echten Robotern.

  • In Simulationen: Sie verwendeten einen Benchmark namens LIBERO mit vier verschiedenen Aufgabentypen (Spatial, Object, Goal und Long).

    • Der Standardroboter (RLinf-GRPO) erreichte eine durchschnittliche Erfolgsquote von 96,8 %.
    • Der ExToken-Roboter erreichte 98,2 %.
    • Bei der schwierigsten Aufgabe (LIBERO-Long) erreichte der Standardroboter 95,2 %, während ExToken auf 97,8 % sprang.
    • Entscheidend war, dass sie dies unter einem strengen Limit taten: Der Roboter durfte nur 512 Versuche pro Schritt sammeln. Selbst mit diesem engen Budget gewann ExToken.
  • In der realen Welt: Sie testeten dies bei vier realen Aufgaben: Kleidung falten, einen Tisch abwischen, Wasser eingießen und einen Stift in einen Halter legen.

    • Bei der Aufgabe „Kleidung falten“ erreichte die Standardmethode eine Erfolgsquote von 90 %. ExToken erreichte 95 %.
    • Wenn sie die Umgebung änderten (wie ein anderes Hemd oder einen anderen Tischhintergrund), sank die Leistung der Standardmethoden um 10 % bis 20 %. ExToken sank nur um 5 % bis 10 %, was zeigt, dass es viel robuster ist.

Was sie (noch) nicht wissen

Das Paper merkt vorsichtig an, dass dies kein Allheilmittel für alles ist.

  • Granularität: Sie testeten die Verwendung von 3, 6 oder 10 verschiedenen Tokens. Die Ergebnisse waren zwischen 3 und 6 recht stabil, aber die Leistung sank bei 10 leicht ab. Sie vermuten, dass es schwierig für den Roboter sein könnte, zu lernen, wenn es zu viele winzige Kategorien gibt.
  • Extreme Limits: Wenn sie das Budget auf nur 128 Versuche senkten, wurde das System instabil. Die Autoren vermuten, dass dies daran liegt, dass es einfach nicht genug Ausgangspunkte gibt, um eine so große Vielfalt an Tokens zu unterstützen.
  • Menschliche Interpretierbarkeit: Sie fanden heraus, dass einige der „Stile“, die der Roboter lernte, keinen klaren menschlichen Namen hatten (wie „der seltsame, verdrehte Falz“). Aber das spielte keine Rolle! Solange die Tokens unterschiedliche physische Bewegungen erzeugten, halfen sie dem Roboter beim Lernen.

Das Fazit

Das Paper legt nahe, dass man, wenn man Roboter effizient trainieren will, aufhören sollte, ihnen einfach nur mehr Daten vorzuwerfen. Konzentrieren Sie sich statattdessen darauf, sicherzustellen, dass die Daten divers sind. Indem Sie ExToken verwenden, um den Roboter während der Übung zu zwingen, verschiedene „Persönlichkeiten“ auszuprobieren, können Sie ihn schneller trainieren, mit weniger Versuchen und ihn besser darin machen, mit Überraschungen in der realen Welt umzugehen. Es geht nicht darum, wie oft man es versucht; es geht darum, wie viele verschiedene Arten man ausprobiert.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →