← Neueste Arbeiten
💻 computer science

SeeQ: Training Generalist Value Functions for Long-Horizon Robotic Manipulation

Das Papier stellt SeeQ vor, ein Framework, das generalistische Value-Funktionen trainiert, indem es aktive Subtasks in natürlicher Sprache autoregressiv vorhersagt, um lange Credit-Assignment-Horizonte zu überwinden und das Policy-Steering bei komplexen, langfristigen robotischen Manipulationsaufgaben unter Verwendung von Offline-Daten zu verbessern.

Ursprüngliche Autoren: Saksham Singh, Zheyuan Hu, Max Sobol Mark, Jeffrey Yu, Zackory Erickson, Aviral Kumar

Veröffentlicht 2026-09-21
📖 1 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Saksham Singh, Zheyuan Hu, Max Sobol Mark, Jeffrey Yu, Zackory Erickson, Aviral Kumar

Originalarbeit unter CC0 1.0 der Gemeinfreiheit gewidmet (http://creativecommons.org/publicdomain/zero/1.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Technisches Resümee: SeeQ: Training von generalistischen Value-Funktionen für langfristige robotische Manipulation

Problemstellung

Generalistische Roboter-Policies, die häufig mittels Imitation Learning trainiert werden, haben Schwierigkeiten mit komplexen, langfristigen Manipulationsaufgaben (long-horizon tasks). Diese Aufgaben beinhalten oft mehrere Stadien oder erfordern wiederholte Versuche und Abwägungen bei spezifischen Phasen vor dem Erfolg. In solchen Szenarien summieren sich Fehler über die Zeit auf, und Erholungsverhaltensweisen (recovery behaviors) sind in Experten-Datensätzen unterrepräsentiert. Während Q-Wert-Funktionen einen Mechanismus bieten, um Policies durch das Ranking von Kandidaten-Aktionen zu steuern, ist deren Erlernen für langfristige Aufgaben eine Herausforderung. Bestehende Ansätze stehen vor drei primären Hürden:

  1. Langfristige Credit-Assignment-Horizonte: Das Lernen aus spärlichen (sparse), aufgabenbezogenen Belohnungen (Erfolg/Misserfolg am Ende der Sequenz) erfordert die Propagierung von Signalen über lange Sequenzen, was zu schwierigen Bellman-Backups führt.
  2. Datenabdeckung: Offline-Datensätze weisen oft keine ausreichende Abdeckung der vielfältigen Zustands-Aktions-Paare auf, die während langfristiger Trajektorien auftreten, was das Temporal-Difference (TD) Lernen unzuverlässig macht.
  3. Fragilität: Ohregent ohne effektives Value-Learning können Policies nicht zwischen Aktionen unterscheiden, die Fortschritt erzielen, und solchen, die zum Scheitern führen, insbesondere bei präzisionsintensiven oder mehrstufigen Aufgaben.

Bestehende Methoden vermeiden entweder das TD-Lernen (indem sie Monte-Carlo-Returns verwenden, was die Verbesserung der Policy über die Datenverteilung hinaus einschränkt) oder verlassen sich auf TD-Lernen über den gesamten Aufgabenhorizont, was dem Kumulieren von Fehlern unterliegt.

Methodik: SeeQ (Subtask-elicited Q-functions)

Die Autoren schlagen SeeQ vor, ein Framework zum Training von generalistischen Q-Wert-Funktionen, das den Lernhorizont verkürzt, indem es sich auf die derzeit aktive Teilaufgabe (subtask) konzentriert, anstatt auf die gesamte Aufgabe.

Kernarchitektur und Training

SeeQ nutzt ein vortrainiertes Vision-Language-Model (VLM) Backbone (speziell ein 3B PaliGemma Modell) und führt einen zweistufigen Trainingsprozess ein:

  1. Generalistisches Pretraining: Das Modell wird auf diversen, Open-Source-Robotermanipulations-Datensätzen (z. B. RoboCOIN) vortrainiert, die Subtask-Annotationen enthalten. Diese Phase reguliert das Verständnis des Modells für den Aufgabenfortschritt und die Aktionskonditionierung über verschiedene Embodiments hinweg.
  2. Downstream Finetuning: Das Modell wird auf spezifische Zielaufgaben feinjustiert.

Zentrale technische Innovationen

  • Subtask-Level Value Prediction: Anstatt den Return zum endgültigen Abschluss der Aufgabe vorherzusagen, schätzt die Q-Funktion den erwarteten Return für die aktive Teilaufgabe (l~t\tilde{l}_t). Dies reduziert den Vorhersagehorizont, wodurch das TD-Lernen stabiler und effektiver wird.
  • Autoregressive Subtask-Dekodierung: Um die Notwendigkeit von menschlichen Annotationen oder externen Subtask-Prädiktoren zur Testzeit zu eliminieren, wird die Q-Funktions-Architektur so modifiziert, dass sie die aktive Teilaufgabe autoregressiv in natürlicher Sprache vorhersagt, bevor sie deren Wert schätzt.
    • Während des Trainings wird das Modell mit einem Next-Token-Prediction-Loss auf den Ground-Truth-Subtask-Annotationen überwacht.
    • Während der Inferenz generiert das Modell den Subtask-Text (l^t\hat{l}_t) basierend auf dem aktuellen Zustand und der Aufgabeninstruktion und konditioniert die Wertvorhersage auf diesen generierten Text.
  • TD-BoN (Temporal-Difference with Best-of-N) Lernen: Das Trainingsziel kombelt Subtask-Level TD-Lernen mit einer „Best-of-N“-Backup-Strategie.
    • Kandidaten-Aktions-Chunks werden aus einer Basis-Policy (πbase\pi_{base}) gesampelt.
    • Der Zielwert (target value) wird mit dem Aktions-Chunk berechnet, der unter den NN Kandidaten den höchsten geschätzten Wert aufweist.
    • Dieser Ansatz richtet das Trainings-Backup an dem Testzeit-Steuerungsverfahren aus und ermöglicht es der Q-Funktion, Aktionen besser zu bewerten als jene, die im Datensatz beobachtet wurden.
  • Kein Bootstrapping über Grenzen hinweg: Das TD-Target bootstrapt nicht über Subtask-Grenzen hinweg. Wenn eine Subtask innerhalb des Aktions-Chunk-Horizonts endet, wird der Backup-Term auf Null gesetzt, um sicherzustellen, dass die Value-Funktion strikt den Fortschritt der aktuellen Subtask widerspiegelt.

Die Gesamtfunktion des Verlusts (Loss) kombiniert den TD-Loss für den Subtask-Wert und den Next-Token-Prediction-Loss für den Subtask-Text:
LSeeQ(θ)=LTD(θ)+λsubtaskLsubtask(θ) \mathcal{L}_{SeeQ}(\theta) = \mathcal{L}_{TD}(\theta) + \lambda_{subtask}\mathcal{L}_{subtask}(\theta)

Inferenz zur Testzeit

Bei der Bereitstellung steuert SeeQ eine Basis-Policy (πbase\pi_{base}) via Best-of-N Selektion:

  1. Gegeben ein Zustand sts_t und eine Aufgabeninstruktion ll, sagt das Modell autoregressiv die aktive Teilaufgabe l^t\hat{l}_t voraus.
  2. Die Basis-Policy schlägt NN Kandidaten-Aktions-Chunks vor.
  3. Die Q-Funktion bewertet jeden Chunk konditioniert auf sts_t, ll und die vorhergesagte l^t\hat{l}_t.
  4. Der Aktions-Chunk mit dem höchsten Score wird ausgeführt.

Zentrale Beiträge

  1. Subtask-Level Formulierung: Die Arbeit führt eine Methode ein, um das langfristige Value-Learning als kurzfristiges, Subtask-Level Learning umzuformulieren, wodurch die Herausforderungen spärlicher Belohnungen über lange Horizonte effektiv umgangen werden.
  2. Sprachkonditionierte Subtask-Inferenz: Eine neuartige Architektur, die die aktive Teilaufgabe explizit in natürlicher Sprache vorhersagt und somit die Notwendigkeit modularer Subtask-Prädiktionssysteme oder menschlicher Annotationen zur Testzeit eliminiert.
  3. Generalistisches Pretraining-Strategie: Zeigt, dass das Pretraining eines VLM-Backbones auf diversen Roboterdaten entscheidend ist, um robustes Aktions-Conditioning zu lernen und das Overfitting auf spezifische Bildmerkmale während des Downstream-Finetunings zu reduzieren.
  4. Empirische Validierung: Umfangreiche Evaluierung auf vier realen bimanualen Manipulationsaufgaben (Hemd aufhängen, Deckel versiegeln, Lebensmittel verpacken, Lego-Demontage) auf zwei Roboterplattformen.

Ergebnisse

Die Autoren evaluierten SeeQ auf vier realen Aufgaben, die deformierbare Objekte, präzise Ausrichtung und mehrstufige Koordination beinhalten.

  • Policy Steering Performance: SeeQ verbesserte die Erfolgsraten der Basis-Policies in allen Aufgaben erheblich.
    • Shirt-hang: Verbesserte sich von 10/24 (41,7 %) auf 22/24 (91,7 %).
    • Lid-sealing: Verbesserte sich von 10/24 (41,7 %) auf 15/24 (62,5 %).
    • Grocery-packing: Verbesserte sich von 9/24 (37,5 %) auf 17/24 (70,8 %).
    • Lego-disassembly: Verbesserte sich von 5/24 (20,8 %) auf 10/24 (41,7 %).
    • Insgesamt stieg die durchschnittliche Erfolgsrate von 35,4 % auf 66,7 % (eine 1,88-fache Verbesserung).
  • Ablationsstudien:
    • Pretraining: Das Entfernen des Roboterdaten-Pretrainings verursachte einen signifikanten Leistungsabfall (von 22/24 auf 8/24 bei Shirt-hang), was die Notwendigkeit diverser Daten für die Generalisierung unterstreicht.
    • Subtask-Conditioning: Die explizite Dekodierung und Konditionierung auf die Subtask war entscheidend. Das Entfernen der Subtask-Vorhersage führte zu einer Performance unter der Basis-Policy (8/24), während das Hinzufügen der Vorhersage ohne Konditionierung die Leistung auf 15/24 verbesserte. Das vollständige SeeQ erreichte 22/24.
    • Vergleich mit Baselines: SeeQ übertraf Task-Level Monte Carlo Regression, Task-Level TD-Learning und Subtask-Level SARSA (welches Datensatz-Aktionen für Backups statt Best-of-N Sampling verwendet).

Bedeutung und Behauptungen

Das Paper behauptet, dass Subtask-Level Werte ein effektiveres Lernziel bieten als spärliche, langfristige Erfolgs-Signale beim Training von generalistischen Q-Funktionen. Durch die Nutzung der natürlichen Zerlegung von Manipulationsaufgaben in Zwischenmeilensteine ermöglicht SeeQ effektives TD-Lernen ohne das typischerweise mit langen Horizonten verbundene Kumulieren von Fehlern.

Die Autoren betonen, dass ihr Ansatz ein generalistisches Value-Learning ermöglicht, das auf neue Aufgaben mit minimalem Finetuning angewendet werden kann, sofern diese Aufgaben in Subtasks zerlegt werden können. Die explizite Verwendung von Sprache zur Vorhersage von Subtasks bringt die Value-Schätzung mit den Textgenerierungs-Fähigkeiten des VLM in Einklang und verbessert die Robustheit nahe der Subtask-Übergänge.

Die Arbeit legt nahe, dass die Kombination von kurzfristigen Lernzielen mit sprachstrukturierter Inferenz ein gangbarer Weg zu robusteren, langfristigen robotischen Manipulationen ist, insbesondere wenn große scale Pretraining auf diversen Roboterdaten genutzt wird. Die Autoren räumen Einschränkungen wie die Ambiguität von Subtask-Grenzen und die Abhängigkeit von der Qualität der Kandidaten-Aktionen der Basis-Policy ein, positionieren ihren Rahmen jedoch als einen bedeutenden Schritt zur Praktikabilität von Value-Funktionen für komplexe reale Robotik.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →