← Últimos artículos
💻 computer science

SeeQ: Training Generalist Value Functions for Long-Horizon Robotic Manipulation

El artículo presenta SeeQ, un marco de trabajo que entrena funciones de valor generalistas mediante la predicción autorregresiva de subtareas activas en lenguaje natural para superar los horizontes de asignación de crédito prolongados y mejorar el control de políticas en tareas de manipulación robótica complejas y de largo alcance utilizando datos fuera de línea.

Autores originales: Saksham Singh, Zheyuan Hu, Max Sobol Mark, Jeffrey Yu, Zackory Erickson, Aviral Kumar

Publicado 2026-09-21
📖 1 min de lectura☕ Lectura para el café

Autores originales: Saksham Singh, Zheyuan Hu, Max Sobol Mark, Jeffrey Yu, Zackory Erickson, Aviral Kumar

Artículo original dedicado al dominio público bajo CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Resumen Técnico: SeeQ: Entrenamiento de Funciones de Valor Generalistas para Manipulación Robótica de Largo Alcance

Declaración del Probleo

Las políticas robóticas generalistas, a menudo entrenadas mediante aprendizaje por imitación, tienen dificultades con tareas de manipulación complejas y de largo alcance. Estas tareas frecuentemente involucran múltiples etapas o requieren intentos repetidos y deliberación sobre etapas específicas antes de alcanzar el éxito. En tales entornos, los errores se acumulan con el tiempo y los comportamientos de recuperación están subrepresentados en los conjuntos de datos de expertos. Si bien las funciones de valor Q ofrecen un mecanismo para dirigir las políticas mediante la clasificación de acciones candidatas, aprenderlas para tareas de largo alcance es un desafío. Los enfoques estándar enfrentan tres obstáculos principales:

  1. Horizontes de Asignación de Crédito Largos: Aprender de recompensas a nivel de tarea dispersas (éxito/fracaso al final del proceso) requiere propagar señales a través de secuencias largas, lo que conduce a retroalimentaciones (backups) de Bellman difíciles.
  2. Cobertura de Datos: Los conjuntos de datos offline a menudo carecen de una cobertura suficiente de los diversos pares estado-acción encontrados durante las trayectorias largas, lo que hace que el aprendizaje de Diferencia Temporal (TD) sea poco confiable.
  3. Fragilidad: Sin un aprendizaje de valor efectivo, las políticas no pueden distinguir entre acciones que progresan y aquellas que conducen al fracaso, particularmente en tareas de alta precisión o de múltiples etapas.

Los métodos existentes evitan el aprendizaje TD (usando retornos de Monte Carlo, lo que limita la mejora de la política más allá de la distribución de los datos) o dependen del aprendizaje TD sobre el horizonte completo de la tarea, lo cual sufre de la acumulación de errores.

Metodología: SeeQ (Funciones Q elicitadas por Subtareas)

Los autores proponen SeeQ, un marco para entrenar funciones Q generalistas que acorta el horizonte de aprendizaje al enfocarse en la subtarea actualmente activa en lugar de la tarea completa.

Arquitectura Central y Entrenamiento

SeeQ utiliza un núcleo de Modelo de Lenguaje-Visión (VLM) preentrenado (específicamente un modelo PaliGemma de 3B) e introduce un proceso de entrenamiento de dos etapas:

  1. Preentrenamiento Generalista: El modelo es preentrenado en diversos conjuntos de datos de manipulación robótica de código abierto (por ejemplo, RoboCOIN) que contienen anotaciones de subtareas. Esta etapa regulariza la comprensión del modelo sobre el progreso de la tarea y el condicionamiento de la acción a través de diversas embodiments (formas físicas).
  2. Finetuning de Tarea Específica: El modelo es ajustado (finetuned) en tareas objetivo específicas.

Innovaciones Técnicas Clave

  • Predicción de Valor a Nivel de Subtarea: En lugar de predecir el retorno hacia la finalización de la tarea final, la función Q estima el retorno esperado para la subtarea activa (l~t\tilde{l}_t). Esto reduce el horizonte de predicción, haciendo que el aprendizaje TD sea más estable y efectivo.
  • Decodificación Autorregresiva de Subtareas: Para eliminar la necesidad de anotaciones humanas o predictores de subtareas externos en el tiempo de prueba, la arquitectura de la función Q se modifica para predecir autorregresivamente la subtarea activa en lenguaje natural antes de estimar su valor.
    • Durante el entrenamiento, el modelo es supervisado con una pérdida de predicción del siguiente token sobre las anotaciones de subtareas reales.
    • Durante la inferencia, el modelo genera el texto de la subtarea (l^t\hat{l}_t) basado en el estado actual y la instrucción de la tarea, y luego condiciona la predicción del valor sobre este texto generado.
  • Aprendizaje TD-BoN (Diferencia Temporal con Best-of-N): El objetivo de entrenamiento combina el aprendizaje TD a nivel de subtarea con una estrategia de backup "Best-of-N".
    • Se muestrean fragmentos de acciones candidatos (action chunks) de una política base (πbase\pi_{base}).
    • El valor objetivo se calcula utilizando el fragmento de acción con el valor estimado más alto entre los NN candidatos.
    • Este enfoque alinea el backup de entrenamiento con el procedimiento de dirección en el tiempo de prueba y permite que la función Q evalúe acciones mejores que las observadas en el conjunto de datos.
  • Sin Bootstrapping a través de Fronteras: El objetivo TD no realiza bootstrapping a través de las fronteras de las subtareas. Si una subtarea termina dentro del horizonte del fragmento de acción, el término de backup se establece en cero, asegurando que la función de valor refleje estrictamente el progreso de la subtarea actual.

La función de pérdida total combina la pérdida TD para el valor de la subtarea y la pérdida de predicción del siguiente token para el texto de la subtarea:
LSeeQ(θ)=LTD(θ)+λsubtaskLsubtask(θ) \mathcal{L}_{SeeQ}(\theta) = \mathcal{L}_{TD}(\theta) + \lambda_{subtask}\mathcal{L}_{subtask}(\theta)

Inferencia en Tiempo de Prueba

En el despliegue, SeeQ dirige una política base (πbase\pi_{base}) mediante la selección Best-of-N:

  1. Dado un estado sts_t y una instrucción de tarea ll, el modelo predice autorregresivamente la subtarea activa l^t\hat{l}_t.
  2. La política base propone NN fragmentos de acciones candidatos.
  3. La función Q califica cada fragmento condicionado en sts_t, ll, y la l^t\hat{l}_t predicha.
  4. Se ejecuta el fragmento de acción con la puntuación más alta.

Contribuciones Clave

  1. Formulación a Nivel de Subtarea: El artículo introduce un método para reformular el aprendizaje de valor de largo alcance como un aprendizaje de corto alcance a nivel de subtarea, evitando eficazmente los desafíos de las recompensas dispersas en horizontes largos.
  2. Inferencia de Subtarea Condicionada por Lenguaje: Una arquitectura novedosa que predice explícitamente la subtarea activa en lenguaje natural, eliminando la necesidad de sistemas modulares de predicción de subtareas o anotaciones humanas en el tiempo de prueba.
  3. Estrategia de Preentrenamiento Generalista: Demuestra que el preentrenamiento de un núcleo VLM en datos robóticos diversos es crítico para aprender un condicionamiento de acción robusto y reducir el sobreajuste a características de imagen específicas durante el finetuning de tareas descendentes.
  4. Validación Empírica: Evaluación extensiva en cuatro tareas de manipulación bimanual en el mundo real (colgar camisas, sellar tapas, empacar comestibles, desensamblar Lego) a través de dos plataformas robóticas.

Resultados

Los autores evaluaron SeeQ en cuatro tareas del mundo real que involucran objetos deformables, alineación precisa y coordinación de múltiples etapas.

  • Rendimiento de Dirección de la Política: SeeQ mejoró sustancialmente las tasas de éxito de las políticas base en todas las tareas.
    • Colgar camisa (Shirt-hang): Mejoró de 10/24 (41.7%) a 22/24 (91.7%).
    • Sellar tapa (Lid-sealing): Mejoró de 10/24 (41.7%) a 15/24 (62.5%).
    • Empacar comestibles (Grocery-packing): Mejoró de 9/24 (37.5%) a 17/24 (70.8%).
    • Desensamblar Lego (Lego-disassembly): Mejoró de 5/24 (20.8%) a 10/24 (41.7%).
    • En general, la tasa de éxito promedio aumentó de 35.4% a 66.7% (una mejora de 1.88x).
  • Estudios de Ablación:
    • Preentrenamiento: Eliminar el preentrenamiento de datos robóticos causó una caída significativa en el rendimiento (de 22/24 a 8/24 en colgar camisa), resaltando la necesidad de datos diversos para la generalización.
    • Condicionamiento de Subtarea: Decodificar y condicionar explícitamente en la subtarea fue crítico. Eliminar la predicción de la subtarea llevó al rendimiento por debajo de la política base (8/24), mientras que añadir la predicción sin el condicionamiento lo mejoró a 15/24. El SeeQ completo alcanzó 22/24.
    • Comparación con Baselines: SeeQ superó a la regresión de Monte Carlo a nivel de tarea, al aprendizaje TD a nivel de tarea y a SARSA a nivel de subtarea (que utiliza acciones del conjunto de datos para los backups en lugar de muestreo Best-of-N).

Significancia y Reivindicaciones

El artículo afirma que los valores a nivel de subtarea proporcionan un objetivo de aprendizaje más efectivo que las señales de éxito dispersas de largo alcance al entrenar funciones Q generalistas. Al aprovechar la descomposición natural de las tareas de manipulación en hitos intermedios, SeeQ permite un aprendizaje TD efectivo sin la acumulación de errores típicamente asociada con los horizontes largos.

Los autores enfatizan que su enfoque permite el aprendizaje de valor generalista que puede aplicarse a nuevas tareas con un finetuning mínimo, siempre que las tareas puedan descomponerse en subtareas. El uso explícito del lenguaje para predecir subtareas alinea la estimación de valor con las capacidades de generación de texto del VLM, mejorando la robustez cerca de las transiciones de subtarea.

El trabajo sugiere que combinar objetivos de aprendizaje de corto alcance con inferencia estructurada por lenguaje es un camino viable hacia una manipulación robótica de largo alcance más robusta, especialmente al aprovechar el preentrenamiento a gran escala en datos robóticos diversos. Los autores reconocen limitaciones, como la ambigüedad de los límites de las subtareas y la dependencia de la calidad de las acciones candidatas de la política base, pero postulan que su marco ofrece un paso significativo para hacer que las funciones de valor sean prácticas para la robótica compleja del mundo real.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →