← Nieuwste papers
💻 computer science

SeeQ: Training Generalist Value Functions for Long-Horizon Robotic Manipulation

Het artikel introduceert SeeQ, een framework dat generalistische waardefuncties traint door autoregressief actieve subtaken in natuurlijke taal te voorspellen om lange credit-assignment-horizons te overwinnen en de beleidssturing op complexe, langdurige robotische manipulatietaken met behulp van offline data te verbeteren.

Oorspronkelijke auteurs: Saksham Singh, Zheyuan Hu, Max Sobol Mark, Jeffrey Yu, Zackory Erickson, Aviral Kumar

Gepubliceerd 2026-09-21
📖 1 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Saksham Singh, Zheyuan Hu, Max Sobol Mark, Jeffrey Yu, Zackory Erickson, Aviral Kumar

Oorspronkelijk artikel vrijgegeven aan het publieke domein onder CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Technische Samenvatting: SeeQ: Training van Generalistische Waardefuncties voor Lange-Horizon Robotische Manipulatie

Probleemstelling

Generalistische robotbeleid (policies), vaak getraind via imitatie-leren, hebben moeite met complexe, lange-horizon manipulatietaken. Deze taken bevatten vaak meerdere fasen of vereisen herhaalde pogingen en overweging van specifieke fasen voordat succes wordt bereikt. In dergelijke omgevingen stapelen fouten zich in de loop van de tijd op, en zijn herstelgedragingen ondervertegenwoordigd in expert-datasets. Hoewel Q-waardefuncties een mechanisme bieden om beleid te sturen door kandidaat-acties te rangschikken, is het leren ervan voor lange-horizon taken uitdagend. Standaard benaderingen worden geconfronteerd met drie primaire hindernissen:

  1. Lange Credit-Assignment Horizons: Leren van ijle (sparse) taakniveau-beloningen (succes/falen aan het einde) vereist het propageren van signalen over lange sequenties, wat leidt tot moeilijke Bellman-backups.
  2. Data Dekking: Offline datasets missen vaak voldoende dekking van de diverse staat-actie paren die tijdens lange trajecten worden aangetroffen, waardoor Temporal-Difference (TD) leren onbetrouwbaar wordt.
  3. Broosheid: Zonder effectief waardeleer kan beleid niet onderscheid maken tussen acties die progressie maken en acties die leiden tot falen, vooral bij precisie-gevoelige of meerfasige taken.

Bestaande methoden vermijden ofwel TD-leren (door Monte Carlo-returns te gebruiken, wat de verbetering van het beleid buiten de datadistributie beperkt) of vertrouwen op TD-leren over de volledige taakhorizon, wat lijdt onder foutstapeling.

Methodologie: SeeQ (Subtask-elicited Q-functions)

De auteurs stellen SeeQ voor, een framework voor het trainen van generalistische Q-waardefuncties die de leerhorizon verkorten door zich te concentreren op de momenteel actieve subtaak in plaats van de gehele taak.

Kernarchitectuur en Training

SeeQ maakt gebruik van een voorgetrainde Vision-Language Model (VLM) backbone (specifiek een 3B PaliGemma model) en introduceert een tweefasig trainingsproces:

  1. Generalistische Pretraining: Het model wordt voorgetraind op diverse, open-source robotmanipulatie-datasets (bijv. RoboCOIN) die voorzien zijn van subtaak-annotaties. Deze fase regulariseert het begrip van het model over taakprogressie en actie-conditionering over verschillende embodiment-vormen heen.
  2. Downstream Finetuning: Het model wordt gefinetuned op specifieke doeltaken.

Belangrijke Technische Innovaties

  • Subtask-Level Waardevoorspelling: In plaats van de return naar de uiteindelijke taakvoltooiing te voorspellen, schat de Q-functie de verwachte return voor de actieve subtaak (l~t\tilde{l}_t). Dit verkort de voorspellingshorizon, waardoor TD-leren stabieler en effectiever wordt.
  • Autoregressieve Subtaak Decodering: Om de noodzaak van menselijke annotaties of externe subtaak-voorspellers tijdens de testfase te elimineren, wordt de Q-functie architectuur aangepast om de actieve subtaak autoregressief in natuurlijke taal te voorspellen voordat de waarde wordt geschat.
    • Tijdens de training wordt het model gesuperviseerd met een next-token prediction loss op de grondwaarheid subtaak-annotaties.
    • Tijdens de inferentie genereert het model de subtaaktekst (l^t\hat{l}_t) op basis van de huidige staat en de taakinstructie, en conditioneert vervolgens de waardevoorspelling op deze gegenereerde tekst.
  • TD-BoN (Temporal-Difference met Best-of-N) Leren: De trainingsdoelstelling combineert subtaak-niveau TD-leren met een "Best-of-N" backup strategie.
    • Kandidaat-actiechunks worden gesampled uit een basisbeleid (πbase\pi_{base}).
    • De target waarde wordt berekend met de actiechunk met de hoogste geschatte waarde onder de NN kandidaten.
    • Deze benadering brengt de training-backup in lijn met de test-tijd sturende procedure en stelt de Q-functie in staat om acties te evalueren die beter zijn dan die in de dataset zijn waargenomen.
  • Geen Bootstrapping over Grenzen: De TD-target bootstrapt niet over subtaak-grenzen heen. Als een subtaak eindigt binnen de actiechunk-horizon, wordt de backup-term op nul gezet, wat ervoor zorgt dat de waardefunctie strikt de progressie van de huidige subtaak weerspiegelt.

De totale loss-functie combineert de TD-loss voor de subtaakwaarde en de next-token prediction loss voor de subtaaktekst:
LSeeQ(θ)=LTD(θ)+λsubtaskLsubtask(θ) \mathcal{L}_{SeeQ}(\theta) = \mathcal{L}_{TD}(\theta) + \lambda_{subtask}\mathcal{L}_{subtask}(\theta)

Test-tijd Inferentie

Bij implementatie stuurt SeeQ een basisbeleid (πbase\pi_{base}) aan via Best-of-N selectie:

  1. Gegeven een staat sts_t en taakinstructie ll, voorspelt het model autoregressief de actieve subtaak l^t\hat{l}_t.
  2. Het basisbeleid stelt NN kandidaat-actiechunks voor.
  3. De Q-functie scoort elke chunk geconditioneerd op sts_t, ll, en de voorspelde l^t\hat{l}_t.
  4. De actiechunk met de hoogste score wordt uitgevoerd.

Belangrijkste Bijdragen

  1. Subtask-Level Formulering: Het artikel introduceert een methode om het leren van lange-horizon waarden te herformuleren als korte-horizon, subtaak-niveau leren, wat de uitdagingen van ijle beloningen over lange horizons effectief omzeilt.
  2. Taal-geconditioneerde Subtaak Inferentie: Een innovatieve architectuur die expliciet de actieve subtaak in natuurlijke taal voorspelt, waardoor de noodzaak voor modulaire subtaak-voorspellingssystemen of menselijke annotaties tijdens de testtijd vervalt.
  3. Generalistische Pretraining Strategie: Demonstreert dat het voortrainen van een VLM-backbone op diverse robotdata cruciaal is voor het leren van robuuste actie-conditionering en het verminderen van overfitting op specifieke beeldkenmerken tijdens downstream finetuning.
  4. Empirische Validatie: Uitgebreide evaluatie op vier real-world bimanuele manipulatietaken (shirt-hanging, lid-sealing, grocery-packing, Lego-disassembly) op twee robotplatforms.

Resultaten

De auteurs evalueerden SeeQ op vier real-world taken waarbij vervormbare objecten, precieze uitlijning en meerfasige coördinatie betrokken waren.

  • Beleid Sturing Prestaties: SeeQ verbeterde de succesratio's van basisbeleid aanzienlijk over alle taken.
    • Shirt-hang: Verbeterde van 10/24 (41,7%) naar 22/24 (91,7%).
    • Lid-sealing: Verbeterde van 10/24 (41,7%) naar 15/24 (62,5%).
    • Grocery-packing: Verbeterde van 9/24 (37,5%) naar 17/24 (70,8%).
    • Lego-disassembly: Verbeterde van 5/24 (20,8%) naar 10/24 (41,7%).
    • Gemiddeld steeg het succespercentage van 35,4% naar 66,7% (een 1,88x verbetering).
  • Ablatie Studies:
    • Pretraining: Het verwijderen van robotdata pretraining veroorzaakte een significante daling in prestaties (van 22/24 naar 8/24 op shirt-hang), wat het belang van diverse data voor generalisatie benadrukt.
    • Subtaak Conditionering: Expliciet decoderen en conditioneren op de subtaak was cruciaal. Het verwijderen van subtaak-voorspelling leidde tot prestaties onder het basisbeleid (8/24), terwijl het toevoegen van voorspelling zonder conditionering de prestatie verbeterde naar 15/24. Volledige SeeQ bereikte 22/24.
    • Vergelijking met Baselines: SeeQ presteerde beter dan taak-niveau Monte Carlo regressie, taak-niveau TD-leren en subtaak-niveau SARSA (dat dataset-acties gebruikt voor backups in plaats van Best-of-N sampling).

Betekenis en Claims

Het artikel beweert dat subtaak-niveau waarden een effectiever leerdoel bieden dan ijle, lange-horizon succes-signalen bij het trainen van generalistische Q-functies. Door gebruik te maken van de natuurlijke decompositie van manipulatietaken in tussenliggende mijlpalen, maakt SeeQ effectief TD-leren mogelijk zonder de foutstapeling die gewoonlijk geassocieerd wordt met lange horizons.

De auteurs benadrukken dat hun benadering generalistisch waardeleer mogelijk maakt dat toegepast kan worden op nieuwe taken met minimale finetuning, mits de taken in subtaken kunnen worden opgedeeld. Het expliciete gebruik van taal voor het voorspellen van subtaken stemt de waardeschatting af op de tekstgeneratie-capaciteiten van de VLM, wat de robuustheid nabij subtaak-overgangen verbetert.

Het werk suggereert dat het combineren van korte-horizon leerdoelstellingen met taal-gestructureerde inferentie een levensvatbaar pad is naar robuustere, lange-horizon robotische manipulatie, vooral wanneer men gebruik maakt van grootschalige pretraining op diverse robotdata. De auteurs erkennen beperkingen, zoals de ambiguïteit van subtaak-grenzen en de afhankelijkheid van de kwaliteit van de kandidaat-acties van het basisbeleid, maar stellen dat hun framework een belangrijke stap voorwaarts is in het praktisch bruikbaar maken van waardefuncties voor complexe real-world robotica.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →