← Ultimi articoli
💻 computer science

SeeQ: Training Generalist Value Functions for Long-Horizon Robotic Manipulation

Il documento introduce SeeQ, un framework che addestra funzioni di valore generaliste prevedendo autoregressivamente sottotask attivi in linguaggio naturale per superare gli orizzonti di assegnazione del credito prolungati e migliorare il controllo della policy in compiti di manipolazione robotica complessi e a lungo termine utilizzando dati offline.

Autori originali: Saksham Singh, Zheyuan Hu, Max Sobol Mark, Jeffrey Yu, Zackory Erickson, Aviral Kumar

Pubblicato 2026-09-21
📖 1 min di lettura☕ Lettura da pausa caffè

Autori originali: Saksham Singh, Zheyuan Hu, Max Sobol Mark, Jeffrey Yu, Zackory Erickson, Aviral Kumar

Articolo originale dedicato al pubblico dominio sotto CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Riepilogo Tecnico: SeeQ: Addestramento di Funzioni di Valore Generaliste per la Manipolazione Robotica a Lungo Orizzonte

Definizione del Problema

Le policy robotiche generaliste, spesso addestrate tramite l'apprendimento per imitazione, faticano con compiti di manipolazione complessi e a lungo orizzonte. Questi compiti spesso coinvolgono più fasi o richiedono tentativi ripetuti e deliberazione su fasi specifiche prima del successo. In tali contesti, gli errori si accumulano nel tempo e i comportamenti di recupero sono sottorappresentati nei dataset degli esperti. Sebbene le funzioni di valore Q offrano un meccanismo per guidare le policy classificando le azioni candidate, apprenderle per compiti a lungo orizzonte è una sfida. Gli approcci standard affrontano tre ostacoli primari:

  1. Orizzonti di Assegnazione del Credito Lunghi: L'apprendimento da ricompense a livello di task sparse (successo/fallimento alla fine del processo) richiede la propagazione dei segnali su lunghe sequenze, portando a complessi backup di Bellman.
  2. Copertura dei Dati: I dataset offline spesso mancano di una copertura sufficiente delle diverse coppie stato-azione incontrate durante le traiettorie lunghe, rendendo l'apprendimento Temporal-Difference (TD) inaffidabile.
  3. Fragilità: Senza un apprendimento del valore efficace, le policy non possono distinguere tra azioni che fanno progredire il compito e quelle che portano al fallimento, particolarmente in compiti ad alta precisione o multi-fase.

I metodi esistenti evitano l'apprendimento TD (usando i ritorni Monte Carlo, il che limita il miglioramento della policy oltre la distribuzione dei dati) o si affidano all'apprendimento TD sull'intero orizzonte del compito, che soffre dell'accumulo di errori.

Metodologia: SeeQ (Funzioni Q elicitate tramite Subtask)

Gli autori propongono SeeQ, un framework per l'addestramento di funzioni Q generaliste che accorcia l'orizzonte di apprendimento concentrandosi sulla subtask attualmente attiva invece che sull'intero compito.

Architettura Core e Addestramento

SeeQ utilizza un backbone basato su un Vision-Language Model (VLM) preaddestrato (specificamente un modello PaliGemma da 3B) e introduce un processo di addestramento in due fasi:

  1. Preaddestramento Generalista: Il modello viene preaddestrato su diversi dataset di manipolazione robotica open-source (es. RoboCOIN) contenenti annotazioni di subtask. Questa fase regolarizza la comprensione del modello riguardo al progresso del compito e al condizionamento dell'azione attraverso varie embodiment.
  2. Finetuning su Compiti Specifici: Il modello viene sottoposto a finetuning su specifici task target.

Innovazioni Tecniche Chiave

  • Predizione del Valore a Livello di Subtask: Inveve di predire il ritorno al completamento finale del compito, la funzione Q stima il ritorno atteso per la subtask attiva (l~t\tilde{l}_t). Ciò riduce l'orizzonte di predizione, rendendo l'apprendimento TD più stabile ed efficace.
  • Decodifica Autoregressiva della Subtask: Per eliminare la necessità di annotazioni umane o predittori di subtask esterni durante il test, l'architettura della funzione Q è modificata per predire autoregressivamente la subtask attiva in linguaggio naturale prima di stimarne il valore.
    • Durante l'addestramento, il modello è supervisionato con una perdita di predizione del next-token sulle annotazioni ground-truth delle subtask.
    • Durante l'inferenza, il modello genera il testo della subtask (l^t\hat{l}_t) basandosi sullo stato corrente e sull'istruzione del compito, quindi condiziona la predizione del valore su questo testo generato.
  • Apprendimento TD-BoN (Temporal-Difference con Best-of-N): L'obiettivo di addestramento combina l'apprendimento TD a livello di subtask con una strategia di backup "Best-of-N".
    • I chunk di azioni candidate vengono campionati da una policy di base (πbase\pi_{base}).
    • Il valore target è calcolato utilizzando il chunk di azione con il valore stimato più alto tra i NN candidati.
    • Questo approccio allinea il backup di addestramento con la procedura di steering al tempo di test e permette alla funzione Q di valutare azioni migliori di quelle osservate nel dataset.
  • Nessun Bootstrapping attraverso i Confini: Il target TD non effettua bootstrapping attraverso i confini delle subtask. Se una subtask termina entro l'orizzonte del chunk di azione, il termine di backup viene azzerato, garantendo che la funzione di valore rifletta strettamente il progresso della subtask corrente.

La funzione di perdita totale combina la perdita TD per il valore della subtask e la perdita di predizione del next-token per il testo della subtask:
LSeeQ(θ)=LTD(θ)+λsubtaskLsubtask(θ) \mathcal{L}_{SeeQ}(\theta) = \mathcal{L}_{TD}(\theta) + \lambda_{subtask}\mathcal{L}_{subtask}(\theta)

Inferenza al Tempo di Test

Al momento del deployment, SeeQ guida una policy di base (πbase\pi_{base}) tramite la selezione Best-of-N:

  1. Dato uno stato sts_t e un'istruzione del compito ll, il modello predice autoregressivamente la subtask attiva l^t\hat{l}_t.
  2. La policy di base propone NN chunk di azioni candidate.
  3. La funzione Q valuta ogni chunk condizionandola a sts_t, ll, e alla subtask l^t\hat{l}_t predetta.
  4. Il chunk di azione con il punteggio più alto viene eseguito.

Contributi Chiave

  1. Formulazione a Livello di Subtask: Il paper introduce un metodo per ricondurre l'apprendimento del valore a lungo orizzonte in un apprendimento a breve orizzonte, a livello di subtask, aggirando efficacemente le sfide delle ricompense sparse su lunghi orizzonti.
  2. Inferenza della Subtask Condizionata al Linguaggio: Un'architettura innovativa che predice esplicitamente la subtask attiva in linguaggio naturale, eliminando la necessità di sistemi modulari di predizione delle subtask o annotazioni umane durante il test.
  3. Strategia di Preaddestramento Generalista: Dimostra che il preaddestramento di un backbone VLM su dati robotici diversificati è critico per apprendere un robusto condizionamento dell'azione e ridurre l'overfitting alle specifiche feature d'immagine durante il finetuning su task specifici.
  4. Validazione Empirica: Valutazione estesa su quattro compiti di manipolazione bimanuale nel mondo reale (appendere una camicia, sigillare un coperchio, confezionare la spesa, smontare i Lego) su due piattaforme robotiche.

Risultati

Gli autori hanno valutato SeeQ su quattro compiti reali che coinvolgono oggetti deformabili, allineamento preciso e coordinazione multi-fase.

  • Performance di Steering della Policy: SeeQ ha migliorato sostanzialmente i tassi di successo delle policy di base in tutti i compiti.
    • Appendere la camicia (Shirt-hang): Migliorato da 10/24 (41.7%) a 22/24 (91.7%).
    • Sigillare il coperchio (Lid-sealing): Migliorato da 10/24 (41.7%) a 15/24 (62.5%).
    • Confezionare la spesa (Grocery-packing): Migliorato da 9/24 (37.5%) a 17/24 (70.8%).
    • Smontare i Lego (Lego-disassembly): Migliorato da 5/24 (20.8%) a 10/24 (41.7%).
    • Il tasso di successo medio complessivo è aumentato dal 35.4% al 66.7% (un miglioramento di 1.88x).
  • Studi di Ablazione:
    • Preaddestramento: Rimuovere il preaddestramento sui dati robotici ha causato un calo significativo delle prestazioni (da 22/24 a 8/24 su shirt-hang), evidenziando la necessità di dati diversificati per la generalizzazione.
    • Condizionamento della Subtask: La decodifica esplicita e il condizionamento sulla subtask sono stati critici. Rimuovere la predizione della subtask ha portato a prestazioni inferiori alla policy di base (8/24), mentre aggiungere la predizione senza condizionamento ha portato a 15/24. Il sistema SeeQ completo ha raggiunto 22/24.
    • Confronto con i Baseline: SeeQ ha superato la regressione Monte Carlo a livello di task, l'apprendimento TD a livello di task e il SARSA a livello di subtask (che utilizza le azioni del dataset per i backup invece del campionamento Best-of-N).

Significato e Rivendicazioni

Il paper sostiene che i valori a livello di subtask forniscono un obiettivo di apprendimento più efficace rispetto ai segnali di successo sparse a lungo orizzonte quando si addestra una funzione Q generalista. Sfruttando la decomposizione naturale dei compiti di manipolazione in pietre miliari intermedie, SeeQ consente un apprendimento TD efficace senza l'accumulo di errori tipicamente associato ai lunghi orizzonti.

Gli autori sottolineano che il loro approccio permette un apprendimento del valore generalista che può essere applicato a nuovi compiti con un finetuning minimo, a patto che i compiti possano essere scomposti in subtask. L'uso esplicito del linguaggio per predire le subtask allinea l'inferenza della stima del valore con le capacità di generazione testuale del VLM, migliorando la robustezza vicino alle transizioni di subtask.

Il lavoro suggerisce che combinare obiettivi di apprendimento a breve orizzonte con un'inferenza strutturata sul linguaggio sia una via percorribile verso una manipolazione robotica più robusta e a lungo orizzonte, specialmente quando si sfrutta il preaddestramento su larga scala su dati robotici diversificati. Gli autori riconoscono limitazioni, come l'ambiguità dei confini delle subtask e la dipendenza dalla qualità dei chunk di azione della policy di base, ma pongono il loro framework come un passo significativo verso la rendere le funzioni di valore pratiche per la robotica complessa nel mondo reale.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →