← Neueste Arbeiten
💻 computer science

Before Parc Fermé: RL-Time Pruning for Efficient Embodied LLMs in Autonomous Driving

Das Paper schlägt „Before Parc Fermé“ (BPF) vor, eine neuartige Pruning-Strategie, die während des Reinforcement Learning eine iterative Modellkompression durchführt, um Embodied-LLM-Controller für das autonome Fahren zu optimieren, wobei sie im Vergleich zu Post-Training-Pruning oder der Auswahl kleinerer dichter Modelle eine überlegene Performance-Speicher-Abwägung und einen bis zu 27 % höheren Decode-Durchsatz erzielt.

Ursprüngliche Autoren: Luca Benfenati, Ali Azimi, Matteo Risso, Fabio Carapellese, Daniele Jahier Pagliari, Alessio Burrello

Veröffentlicht 2026-06-01
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Luca Benfenati, Ali Azimi, Matteo Risso, Fabio Carapellese, Daniele Jahier Pagliari, Alessio Burrello

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie haben einen brillanten, superintelligenten Roboterfahrer namens RobotxR1. Dieser Fahrer wird von einem „Gehirn“ angetrieben, einem Large Language Model (LLM). Stellen Sie sich dieses Gehirn wie einen Weltklasse-Formel-1-Ingenieur vor, der jedes Buch über das Fahren gelesen hat, die Physik jedes Autos kennt und jede Anweisung, die Sie ihm in einfachem Englisch geben, verstehen kann.

Es gibt jedoch ein Problem: Dieser Ingenieur ist zu groß. Er trägt einen massiven Rucksack voller Bücher (Gedächtnis) mit sich herum und braucht lange, um nachzudenken, bevor er Anweisungen gibt (Latenz). Wenn Sie versuchen, diesen schweren Rucksack auf ein kleines, schnelles Rennauto (den eigentlichen Roboter) zu packen, wird das Auto zu langsam, um in Echtzeit zu fahren. Es ist, als würde man versuchen, einen Marathon zu laufen, während man ein Klavier trägt.

Das Problem: Wann verkleinert man das Gehirn?

Um den Roboter schneller zu machen, versuchen Ingenieure normalerweise, das Gehirn zu „beschneiden“ (Pruning). Das Beschneiden ist wie das Editieren eines Manuskripts: Man streicht Sätze, Absätze oder ganze Kapitel, die nicht notwendig sind, wodurch das Buch kürzer und leichter wird.

Aber hier liegt der knifflige Teil: Wann führt man diese Bearbeitung durch?

  1. Nachdem das Rennen beendet ist? (Post-Training): Man trainiert das vollständige Gehirn, lässt es alles lernen und versucht dann, es zu verkleinern. Das Problem ist, dass das Gehirn bereits die „falschen“, schweren Teile auswendig gelernt hat, und das Wegschneiden dieser Teile könnte seine Fähigkeit zu fahren beeinträchtigen.
  2. Bevor das Training beginnt? (Pre-Training): Man schneidet das Gehirn zuerst zurecht und trainiert es dann. Das Problem ist, dass man noch nicht weiß, welche Teile tatsächlich nutzlos sind, bis das Gehirn versucht hat zu fahren.

Die Lösung: „Before Parc Fermé“ (BPF)

Die Autoren dieses Papers schlagen eine neue Strategie vor, die Before Parc Fermé (BPF) genannt wird.

Um den Namen zu verstehen, stellen Sie sich den Formel-1-Rennsport vor. Vor einem Rennen fahren die Autos in ein „Parc Fermé“ (eine gesperrte Garage), wo sie versiegelt werden. Niemand darf die Autos mehr berühren oder modifizieren. Das Auto, das in die Garage fährt, ist das Auto, das das Rennen fährt.

In der Welt des KI-Trainings ist das „Parc Fermé“ der Moment, in dem das Training abgeschlossen ist und das Modell festgeschrieben wird. Die Autoren argumenten, dass man nicht warten sollte, bis das Modell im Garagenbereich eingesperrt ist, um mit dem Editieren zu beginnen. Stattdessen sollte man mit dem Editieren beginnen, während das Auto noch auf der Strecke abgestimmt wird.

Sie nennen dies RL-Time Pruning (Reinforcement Learning Time Pruning).

Wie es funktioniert: Die zwei Varianten

Das Paper testet zwei Wege, dieses „On-the-Track“-Editieren durchzuführen:

  1. BPF-RL (Das iterative Editieren): Stellen Sie sich vor, der Roboterfahrer lernt, eine Rennstrecke zu fahren. Alle paar Runden steigen die Ingenieure ein, schauen in die Notizen des Fahrers und sagen: „Du brauchst diesen spezifischen Absatz über den Reifendruck nicht; lass uns ihn herausschneiden.“ Dann fährt der Fahrer die nächsten paar Runden mit den leichteren Notizen weiter und lernt, sich an die fehlenden Informationen anzupassen. Sie wiederholen diesen Prozess, bis die Notizen genau die richtige Größe haben.
  2. BPF-SFT/RL (Das Zwei-Stufen-Editieren): Zuerlich führen sie ein leichtes Editieren durch, während der Fahrer die grundlegenden Regeln lernt (Supervised Fine-Tuning). Sobald der Fahrer dann beginnt, in Echtzeit-Simulationen zu fahren (Reinforcement Learning), führen sie das schwere Editieren durch und schneiden mehr „Füllmaterial“ heraus, während der Fahrer aktiv auf die Strecke reagiert.

Die Ergebnisse: Leichter, schneller und klüger

Die Forscher testeten dies an einem echten autonomen Fahrsystem mit zwei Teilen:

  • DecisionxR1: Das „Gehirn“, das entscheidet, was zu tun ist.
  • MPCxR1: Die „Hände“, die das Auto tatsächlich lenken.

Hier ist, was sie herausgefunden haben:

  • Bessere Kompromisse: Wenn man einfach ein natürlich kleineres, schwächeres Gehirn (ein 1,5B-Modell) anstelle eines großen Modells gewählt hätte, wäre das Auto schlechter gefahren. Aber wenn sie das große Gehirn nahmen und die BPF-SFT/RL-Methode anwandten, um es zu verkleinern, war das resultierende „Mini-Gehirn“ 1,69-mal besser darin, die Balance zwischen Größe und Leistung zu halten, als wenn man einfach das kleine Gehirn von vornherein gewählt hätte. Es behielt die „Intelligenz“ des großen Modells, aber das „Gewicht“ des kleinen Modells.
  • Reale Geschwindigkeit: Als sie diese beschnittenen Modelle auf einem echten Roboterauto mit einem Jetson AGX Orin Computer einsetzten, waren die beschnittenen Modelle 27 % schneller beim Generieren von Anweisungen.
  • Die „Verbose“-Falle: Sie entdeckten eine überraschende Wendung. Manchmal machte es das System nicht schneller, wenn man das Modell kleiner machte. Warum? Weil das kleinere Modell manchmal anfing, längere Sätze zu schreiben, um seine Entscheidungen zu erklären. Es ist wie ein leichter Läufer, der anfängt, die ganze Zeit mit sich selbst zu reden, was ihn verlangsamt. Dies lehrte sie, dass man nicht nur die Modellgröße betrachten darf; man muss die gesamte Pipeline beobachten.

Das Fazit

Das Paper behauptet, dass für Roboter, die in Echtzeit denken und handeln müssen (wie selbstfahrende Autos), man nicht warten sollte, bis das Training beendet ist, um die KI kleiner zu machen. Stattdessen sollte man sie während des Lernens verkleinern, damit der Roboter sich an seine eigene „Operation“ in Echtzeit anpassen kann.

Dieser „Before Parc Fermé“-Ansatz erschafft einen Roboterfahrer, der leicht genug ist, um schnell zu sein, aber klug genug, um komplexe Fahraufgaben zu bewältigen, und übertrifft dabei sowohl die schweren Originalmodelle als auch die natürlich kleinen Modelle.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →