← Últimos artigos
💻 computer science

SeeQ: Training Generalist Value Functions for Long-Horizon Robotic Manipulation

O artigo introduz o SeeQ, um framework que treina funções de valor generalistas ao prever autorregressivamente subtarefas ativas em linguagem natural para superar horizontes de atribuição de crédito longos e melhorar o direcionamento de políticas em tarefas de manipulação robótica complexas e de longo horizonte usando dados offline.

Autores originais: Saksham Singh, Zheyuan Hu, Max Sobol Mark, Jeffrey Yu, Zackory Erickson, Aviral Kumar

Publicado 2026-09-21
📖 1 min de leitura☕ Leitura rápida

Autores originais: Saksham Singh, Zheyuan Hu, Max Sobol Mark, Jeffrey Yu, Zackory Erickson, Aviral Kumar

Artigo original dedicado ao domínio público sob CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Resumo Técnico: SeeQ: Treinando Funções de Valor Generalistas para Manipulação Robótica de Longo Horizonte

Declaração do Problema

Políticas robóticas generalistas, frequentemente treinadas via aprendizado por imitação, têm dificuldade com tarefas de manipulação complexas e de longo horizonte. Essas tarefas frequentemente envolvem múltiplos estágios ou exigem tentativas repetidas e deliberação sobre estágios específicos antes do sucesso. Em tais configurações, os erros se acumulam ao longo do tempo, e comportamentos de recuperação são sub-representados nos conjuntos de dados de especialistas. Embora as funções de valor Q ofereçam um mecanismo para orientar políticas através do ranqueamento de ações candidatas, aprendê-las para tarefas de longo horizonte é desafiador. Abordagens padrão enfrentam três obstáculos principais:

  1. Longos Horizontes de Atribuição de Crédito: Aprender a partir de recompensas de nível de tarefa esparsas (sucesso/falha no final do processo) requer a propagação de sinais ao longo de sequências longas, levando a retroalimentações (backups) de Bellman difíceis.
  2. Cobertura de Dados: Conjuntos de dados offline frequentemente carecem de cobertura suficiente dos diversos pares estado-ação encontrados durante trajetórias longas, tornando o aprendizado de Diferença Temporal (TD) pouco confiável.
  3. Fragilidade: Sem o aprendizado de valor eficaz, as políticas não conseguem distinguir entre ações que progridem e aquelas que levam ao erro, particularmente em tarefas de alta precisão ou de múltiplos estágios.

Métodos existentes ou evitam o aprendizado TD (usando retornos de Monte Carlo, o que limita a melhoria da política além da distribuição dos dados) ou dependem do aprendizado TD sobre todo o horizonte da tarefa, o que sofre com o acúmulo de erros.

Metodologia: SeeQ (Funções Q elicitadas por Subtarefas)

Os autores propõem o SeeQ, um framework para treinar funções Q generalistas que encurta o horizonte de aprendizado ao focar na subtarefa atualmente ativa em vez de toda a tarefa.

Arquitetura Central e Treinamento

O SeeQ utiliza um backbone de Modelo de Linguagem-Visão (VLM) pré-treinado (especificamente um modelo PaliGemma de 3B) e introduz um processo de treinamento de dois estágios:

  1. Pré-treinamento Generalista: O modelo é pré-treinado em diversos conjuntos de dados de manipulação robótica de código aberto (ex: RoboCOIN) contendo anotações de subtarefas. Este estágio regulariza a compreensão do modelo sobre o progresso da tarefa e o condicionamento de ação através de diversas formas (embodiments).
  2. Ajuste Fino (Finetuning) de Tarefas Específicas: O modelo é ajustado para tarefas alvo específicas.

Inovações Técnicas Principais

  • Predição de Valor em Nível de Subtarefa: Em vez de prever o retorno para a conclusão final da tarefa, a função Q estima o retorno esperado para a subtarefa ativa (l~t\tilde{l}_t). Isso reduz o horizonte de predição, tornando o aprendizado TD mais estável e eficaz.
  • Decodificação Autoregressiva de Subtarefa: Para eliminar a necessidade de anotações humanas ou preditores de subtarefa externos no momento do teste, a arquitetia da função Q é modificada para predizer a subtarefa ativa de forma autoregressiva em linguagem natural antes de estimar seu valor.
    • Durante o treinamento, o modelo é supervisionado com uma perda de predição do próximo token sobre as anotações de subtarefa reais (ground-truth).
    • Durante a inferência, o modelo gera o texto da subtarefa (l^t\hat{l}_t) baseado no estado atual e na instrução da tarefa, então condiciona a predição de valor a este texto gerado.
  • Aprendizado TD-BoN (Temporal-Difference com Best-of-N): O objetivo de treinamento combina o aprendizado TD de nível de subtarefa com uma estratégia de backup "Best-of-N".
    • Blocos de ação candidatos (action chunks) são amostrados de uma política base (πbase\pi_{base}).
    • O valor alvo é computado usando o bloco de ação com o maior valor estimado entre os NN candidatos.
    • Esta abordagem alinha o backup de treinamento com o procedimento de orientação (steering) em tempo de teste e permite que a função Q avalie ações melhores do que aquelas observadas no conjunto de dados.
  • Sem Bootstrapping entre Fronteiras: O alvo de TD não realiza bootstrapping através das fronteiras de subtarefa. Se uma subtarefa termina dentro do horizonte do bloco de ação, o termo de backup é zerado, garantindo que a função de valor reflita estritamente o progresso da subtarefa atual.

A função de perda total combina a perda de TD para o valor da subtarefa e a perda de predição do próximo token para o texto da subtarefa:
LSeeQ(θ)=LTD(θ)+λsubtaskLsubtask(θ) \mathcal{L}_{SeeQ}(\theta) = \mathcal{L}_{TD}(\theta) + \lambda_{subtask}\mathcal{L}_{subtask}(\theta)

Inferência em Tempo de Teste

No deploy, o SeeQ orienta uma política base (πbase\pi_{base}) via seleção Best-of-N:

  1. Dado um estado sts_t e uma instrução de tarefa ll, o modelo prediz autoregressivamente a subtarefa ativa l^t\hat{l}_t.
  2. A política base propõe NN blocos de ação candidatos.
  3. A função Q pontua cada bloco condicionando-o a sts_t, ll e à subtarefa l^t\hat{l}_t predita.
  4. O bloco de ação com a pontuação mais alta é executado.

Principais Contribuições

  1. Formulação de Nível de Subtarefa: O artigo introduz um método para reestruturar o aprendizado de valor de longo horizonte como aprendizado de curto horizonte em nível de subtarefa, contornando efetivamente os desafios de recompensas esparsas em horizontes longos.
  2. Inferência de Subtarefa Condicionada por Linguagem: Uma arquitetura inovadora que prediz explicitamente a subtarefa ativa em linguagem natural, removendo a necessidade de sistemas modulares de predição de subtarefa ou anotações humanas no tempo de teste.
  3. Estratégia de Pré-treinamento Generalista: Demonstra que o pré-treinamento de um backbone VLM em dados robóticos diversos é crítico para aprender condicionamento de ação robusto e reduzir o overfitting a características de imagem específicas durante o ajuste fino de tarefas downstream.
  4. Validação Empírica: Avaliação extensiva em quatro tarefas de manipulação bimanual do mundo real (pendurar camisa, selar tampa, empacotar mantimentos, desmontar Lego) em duas plataformas robóticas.

Resultados

Os autores avaliaram o SeeQ em quatro tarefas do mundo real envolvendo objetos deformáveis, alinhamento preciso e coordenação de múltiplos estágios.

  • Desempenho de Orientação de Política (Policy Steering): O SeeQ melhorou substancialmente as taxas de sucesso das políticas base em todas as tarefas.
    • Pendurar camisa (Shirt-hang): Melhorou de 10/24 (41.7%) para 22/24 (91.7%).
    • Selar tampa (Lid-sealing): Melhorou de 10/24 (41.7%) para 15/24 (62.5%).
    • Empacotar mantimentos (Grocery-packing): Melhorou de 9/24 (37.5%) para 17/24 (70.8%).
    • Desmontar Lego (Lego-disassembly): Melhorou de 5/24 (20.8%) para 10/24 (41.7%).
    • No geral, a taxa de sucesso média aumentou de 35.4% para 66.7% (um aumento de 1.88x).
  • Estudos de Ablação:
    • Pré-treinamento: Remover o pré-treinamento de dados robóticos causou uma queda significativa no desempenho (de 22/24 para 8/24 em pendurar camisa), destacando a necessidade de dados diversos para generalização.
    • Condicionamento de Subtarefa: Decodificar e condicionar explicitamente na subtarefa foi crítico. Remover a predição de subtarefa levou ao desempenho abaixo da política base (8/24), enquanto adicionar a predição sem o condicionamento melhorou para 15/24. O SeeQ completo alcançou 22/24.
    • Comparação com Baselines: O SeeQ superou a regressão de Monte Carlo de nível de tarefa, o aprendizado TD de nível de tarefa e o SARSA de nível de subtarefa (que usa ações do dataset para backups em vez de amostragem Best-of-N).

Significância e Alegações

O artigo afirma que valores de nível de subtarefa fornecem um alvo de aprendizado mais eficaz do que sinais de sucesso esparsos de longo horizonte ao treinar funções Q generalistas. Ao alavancar a decomposição natural das tarefas de manipulação em marcos intermediários, o SeeQ permite um aprendizado TD eficaz sem o acúmulo de erros tipicamente associado a longos horizontes.

Os autores enfatizam que sua abordagem permite o aprendizado de valor generalista que pode ser aplicado a novas tarefas com ajuste fino mínimo, desde que as tarefas possam ser decompostas em subtarefas. O uso explícito de linguagem para predizer subtarefas alinha a estimativa de valor com as capacidades de geração de texto do VLM, melhorando a robustez próximo às transições de subtarefa.

O trabalho sugere que combinar objetivos de aprendizado de curto horizonte com inferência estruturada por linguagem é um caminho viável para uma manipulação robótica de longo horizonte mais robusta, especialmente ao utilizar pré-treinamento em larga escala em dados robóticos diversos. Os autores reconhecem limitações, como a ambiguidade das fronteiras de subtarefa e a dependência da qualidade das ações candidatas da política base, mas posicionam seu framework como um passo significativo para tornar as funções de valor práticas para a robótica complexa do mundo real.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →