SeeQ: Training Generalist Value Functions for Long-Horizon Robotic Manipulation
O artigo introduz o SeeQ, um framework que treina funções de valor generalistas ao prever autorregressivamente subtarefas ativas em linguagem natural para superar horizontes de atribuição de crédito longos e melhorar o direcionamento de políticas em tarefas de manipulação robótica complexas e de longo horizonte usando dados offline.
Artigo original dedicado ao domínio público sob CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Resumo Técnico: SeeQ: Treinando Funções de Valor Generalistas para Manipulação Robótica de Longo Horizonte
Declaração do Problema
Políticas robóticas generalistas, frequentemente treinadas via aprendizado por imitação, têm dificuldade com tarefas de manipulação complexas e de longo horizonte. Essas tarefas frequentemente envolvem múltiplos estágios ou exigem tentativas repetidas e deliberação sobre estágios específicos antes do sucesso. Em tais configurações, os erros se acumulam ao longo do tempo, e comportamentos de recuperação são sub-representados nos conjuntos de dados de especialistas. Embora as funções de valor Q ofereçam um mecanismo para orientar políticas através do ranqueamento de ações candidatas, aprendê-las para tarefas de longo horizonte é desafiador. Abordagens padrão enfrentam três obstáculos principais:
- Longos Horizontes de Atribuição de Crédito: Aprender a partir de recompensas de nível de tarefa esparsas (sucesso/falha no final do processo) requer a propagação de sinais ao longo de sequências longas, levando a retroalimentações (backups) de Bellman difíceis.
- Cobertura de Dados: Conjuntos de dados offline frequentemente carecem de cobertura suficiente dos diversos pares estado-ação encontrados durante trajetórias longas, tornando o aprendizado de Diferença Temporal (TD) pouco confiável.
- Fragilidade: Sem o aprendizado de valor eficaz, as políticas não conseguem distinguir entre ações que progridem e aquelas que levam ao erro, particularmente em tarefas de alta precisão ou de múltiplos estágios.
Métodos existentes ou evitam o aprendizado TD (usando retornos de Monte Carlo, o que limita a melhoria da política além da distribuição dos dados) ou dependem do aprendizado TD sobre todo o horizonte da tarefa, o que sofre com o acúmulo de erros.
Metodologia: SeeQ (Funções Q elicitadas por Subtarefas)
Os autores propõem o SeeQ, um framework para treinar funções Q generalistas que encurta o horizonte de aprendizado ao focar na subtarefa atualmente ativa em vez de toda a tarefa.
Arquitetura Central e Treinamento
O SeeQ utiliza um backbone de Modelo de Linguagem-Visão (VLM) pré-treinado (especificamente um modelo PaliGemma de 3B) e introduz um processo de treinamento de dois estágios:
- Pré-treinamento Generalista: O modelo é pré-treinado em diversos conjuntos de dados de manipulação robótica de código aberto (ex: RoboCOIN) contendo anotações de subtarefas. Este estágio regulariza a compreensão do modelo sobre o progresso da tarefa e o condicionamento de ação através de diversas formas (embodiments).
- Ajuste Fino (Finetuning) de Tarefas Específicas: O modelo é ajustado para tarefas alvo específicas.
Inovações Técnicas Principais
- Predição de Valor em Nível de Subtarefa: Em vez de prever o retorno para a conclusão final da tarefa, a função Q estima o retorno esperado para a subtarefa ativa (). Isso reduz o horizonte de predição, tornando o aprendizado TD mais estável e eficaz.
- Decodificação Autoregressiva de Subtarefa: Para eliminar a necessidade de anotações humanas ou preditores de subtarefa externos no momento do teste, a arquitetia da função Q é modificada para predizer a subtarefa ativa de forma autoregressiva em linguagem natural antes de estimar seu valor.
- Durante o treinamento, o modelo é supervisionado com uma perda de predição do próximo token sobre as anotações de subtarefa reais (ground-truth).
- Durante a inferência, o modelo gera o texto da subtarefa () baseado no estado atual e na instrução da tarefa, então condiciona a predição de valor a este texto gerado.
- Aprendizado TD-BoN (Temporal-Difference com Best-of-N): O objetivo de treinamento combina o aprendizado TD de nível de subtarefa com uma estratégia de backup "Best-of-N".
- Blocos de ação candidatos (action chunks) são amostrados de uma política base ().
- O valor alvo é computado usando o bloco de ação com o maior valor estimado entre os candidatos.
- Esta abordagem alinha o backup de treinamento com o procedimento de orientação (steering) em tempo de teste e permite que a função Q avalie ações melhores do que aquelas observadas no conjunto de dados.
- Sem Bootstrapping entre Fronteiras: O alvo de TD não realiza bootstrapping através das fronteiras de subtarefa. Se uma subtarefa termina dentro do horizonte do bloco de ação, o termo de backup é zerado, garantindo que a função de valor reflita estritamente o progresso da subtarefa atual.
A função de perda total combina a perda de TD para o valor da subtarefa e a perda de predição do próximo token para o texto da subtarefa:
Inferência em Tempo de Teste
No deploy, o SeeQ orienta uma política base () via seleção Best-of-N:
- Dado um estado e uma instrução de tarefa , o modelo prediz autoregressivamente a subtarefa ativa .
- A política base propõe blocos de ação candidatos.
- A função Q pontua cada bloco condicionando-o a , e à subtarefa predita.
- O bloco de ação com a pontuação mais alta é executado.
Principais Contribuições
- Formulação de Nível de Subtarefa: O artigo introduz um método para reestruturar o aprendizado de valor de longo horizonte como aprendizado de curto horizonte em nível de subtarefa, contornando efetivamente os desafios de recompensas esparsas em horizontes longos.
- Inferência de Subtarefa Condicionada por Linguagem: Uma arquitetura inovadora que prediz explicitamente a subtarefa ativa em linguagem natural, removendo a necessidade de sistemas modulares de predição de subtarefa ou anotações humanas no tempo de teste.
- Estratégia de Pré-treinamento Generalista: Demonstra que o pré-treinamento de um backbone VLM em dados robóticos diversos é crítico para aprender condicionamento de ação robusto e reduzir o overfitting a características de imagem específicas durante o ajuste fino de tarefas downstream.
- Validação Empírica: Avaliação extensiva em quatro tarefas de manipulação bimanual do mundo real (pendurar camisa, selar tampa, empacotar mantimentos, desmontar Lego) em duas plataformas robóticas.
Resultados
Os autores avaliaram o SeeQ em quatro tarefas do mundo real envolvendo objetos deformáveis, alinhamento preciso e coordenação de múltiplos estágios.
- Desempenho de Orientação de Política (Policy Steering): O SeeQ melhorou substancialmente as taxas de sucesso das políticas base em todas as tarefas.
- Pendurar camisa (Shirt-hang): Melhorou de 10/24 (41.7%) para 22/24 (91.7%).
- Selar tampa (Lid-sealing): Melhorou de 10/24 (41.7%) para 15/24 (62.5%).
- Empacotar mantimentos (Grocery-packing): Melhorou de 9/24 (37.5%) para 17/24 (70.8%).
- Desmontar Lego (Lego-disassembly): Melhorou de 5/24 (20.8%) para 10/24 (41.7%).
- No geral, a taxa de sucesso média aumentou de 35.4% para 66.7% (um aumento de 1.88x).
- Estudos de Ablação:
- Pré-treinamento: Remover o pré-treinamento de dados robóticos causou uma queda significativa no desempenho (de 22/24 para 8/24 em pendurar camisa), destacando a necessidade de dados diversos para generalização.
- Condicionamento de Subtarefa: Decodificar e condicionar explicitamente na subtarefa foi crítico. Remover a predição de subtarefa levou ao desempenho abaixo da política base (8/24), enquanto adicionar a predição sem o condicionamento melhorou para 15/24. O SeeQ completo alcançou 22/24.
- Comparação com Baselines: O SeeQ superou a regressão de Monte Carlo de nível de tarefa, o aprendizado TD de nível de tarefa e o SARSA de nível de subtarefa (que usa ações do dataset para backups em vez de amostragem Best-of-N).
Significância e Alegações
O artigo afirma que valores de nível de subtarefa fornecem um alvo de aprendizado mais eficaz do que sinais de sucesso esparsos de longo horizonte ao treinar funções Q generalistas. Ao alavancar a decomposição natural das tarefas de manipulação em marcos intermediários, o SeeQ permite um aprendizado TD eficaz sem o acúmulo de erros tipicamente associado a longos horizontes.
Os autores enfatizam que sua abordagem permite o aprendizado de valor generalista que pode ser aplicado a novas tarefas com ajuste fino mínimo, desde que as tarefas possam ser decompostas em subtarefas. O uso explícito de linguagem para predizer subtarefas alinha a estimativa de valor com as capacidades de geração de texto do VLM, melhorando a robustez próximo às transições de subtarefa.
O trabalho sugere que combinar objetivos de aprendizado de curto horizonte com inferência estruturada por linguagem é um caminho viável para uma manipulação robótica de longo horizonte mais robusta, especialmente ao utilizar pré-treinamento em larga escala em dados robóticos diversos. Os autores reconhecem limitações, como a ambiguidade das fronteiras de subtarefa e a dependência da qualidade das ações candidatas da política base, mas posicionam seu framework como um passo significativo para tornar as funções de valor práticas para a robótica complexa do mundo real.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.