← Últimos artículos
💻 computer science

Closing the Lab-to-Store Gap: A Data-Efficient Post-Training and Experience-Driven Learning VLA Framework for Retail Humanoids

Este artículo presenta DEED, un marco de nivel de sistemas que cierra la brecha entre los bancos de pruebas de laboratorio y las operaciones minoristas del mundo real para robots humanoides mediante la combinación de postentrenamiento eficiente en datos, refinamiento basado en la experiencia y análisis del espacio latente para lograr un rendimiento robusto en una tarea de reabastecimiento de chips utilizando recursos computacionales mínimos.

Autores originales: Roger Sala Sisó, Tiago Silvério, Jakob Sand, Tran Nguyen Le

Publicado 2026-07-23
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Roger Sala Sisó, Tiago Silvério, Jakob Sand, Tran Nguyen Le

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot a realizar una tarea doméstica, como doblar la ropa o reponer un estante. Podrías pensar que la parte más difícil es construir el cerebro del robot para que pueda "ver" y "entender" el mundo. Pero en el mundo de la robótica, hay una brecha complicada entre lo que sucede en un laboratorio perfecto y controlado y lo que sucede en una tienda real y desordenada. En el laboratorio, los robots suelen parecer genios, pero sácalos por la puerta y podrían tropezar con una alfombra o dejar caer un objeto porque la iluminación cambió o una caja estaba ligeramente torcida.

Para cerrar esta brecha, los científicos utilizan algo llamado un modelo de Visión-Lenguaje-Acción (VLA). Piensa en un VLA como un cerebro de robot superinteligente que ha leído todo el internet. Sabe cómo se ve una "bolsa de papas fritas", entiende la frase "pon esto en el estante" y sabe cómo mover sus brazos para hacerlo. Estos modelos son poderosos, pero son como estudiantes que solo han estudiado de libros de texto. No han hecho realmente la tarea en el mundo real. Tienen dificultades cuando las cosas no salen exactamente como se planearon y no pueden aprender de sus propios errores una vez que se encienden. La gran pregunta que se hacen los investigadores es: ¿Cómo tomamos estos cerebros de robot brillantes pero inexpertos y los convertimos en trabajadores confiables sin necesidad de millones de dólares en supercomputadoras?

Este artículo presenta un nuevo método llamado DEED (Aprendizaje Impulsado por la Experiencia y Post-Entrenamiento Eficiente en Datos) para resolver exactamente ese problema. Los investigadores probaron su idea en un robot Unitree G1-Edu, un humanoide que se parece un poco a un humano, intentando realizar una tarea muy específica: reponer bolsas de papas fritas en un supermercado. Descubrieron que el secreto para hacer que el robot funcionara no era inventar un cerebro nuevo y más complejo. En su lugar, se trataba de ser un maestro muy cuidadoso.

Primero, se dieron cuenta de que simplemente descargar un cerebro de robot pre-entrenado y decirle "ve" no funcionaba; el robot fallaba por completo. El problema era que el robot estaba tratando de aprender de datos desordenados e inconsistentes y se confundía por el tiempo de sus cámaras y movimientos. El equipo solucionó esto creando una receta "Eficiente en Datos". Limpiaron los videos de entrenamiento para eliminar dudas y errores, sincronizaron la velocidad de la cámara del robot con su velocidad de movimiento (para que no intentara moverse más rápido de lo que podía ver) e incluso utilizaron una herramienta de ayuda para resaltar exactamente dónde debería mirar el robot, como dibujar un cuadro verde alrededor del espacio vacío en el estante. También simplificaron el trabajo del robot tratando su mano como un simple interruptor de encendido/apagado en lugar de intentar controlar cada pequeño músculo. Con solo estos ajustes cuidadosos y una sola tarjeta gráfica, convirtieron un robot con un 0% de éxito en uno que podía reponer papas fritas el 32% de las veces.

Después, intentaron que el robot fuera aún mejor permitiéndole aprender de su propia experiencia, un proceso llamado "Aprendizaje Impulsado por la Experiencia". Dejaron que el robot intentara la tarea por su cuenta y, cuando fallaba, un humano intervenía para corregirlo. El robot luego utilizó estas correcciones para actualizar su cerebro. ¡Esto funcionó! Después de una ronda de esta práctica, la tasa de éxito del robot saltó al 42%, y se volvió más rápido y directo en sus movimientos.

Sin embargo, el artículo sugiere una advertencia sobre hacer esto demasiado. Cuando intentaron una segunda ronda de práctica, el robot en realidad empeoró, cayendo de nuevo al 22% de éxito. Los autores sospechan que esto sucedió porque el robot comenzó a confiar demasiado en sus propias "alucinaciones" de lo que funcionaba, en lugar de los ejemplos sólidos dados por el maestro humano. Es como si un estudiante solo practicara adivinando las respuestas a sus propios exámenes inventados; eventualmente, empiezan a olvidar las reglas reales. El equipo también construyó una herramienta especial para observar el cerebro del robot en tiempo real, midiendo qué tan "extraña" era su situación actual en comparación con aquello para lo que había sido entrenado. Esta herramienta les ayudó a ver exactamente cuándo el robot estaba derivando hacia territorio desconocido y peligroso.

En última instancia, el artículo sugiere que el mayor obstáculo para poner robots humanoides en las tiendas no es construir un cerebro más inteligente, sino construir un mejor sistema de entrenamiento. Al curar cuidadosamente los datos y saber cuándo detener al robot de "practicar" por su cuenta, podemos convertir un modelo pre-entrenado torpe en un trabajador competente utilizando muy poca potencia de cómputo. Los investigadores descubrieron que, si bien una ronda de autocorrección ayuda, demasiada puede perjudicar, y la clave del éxito reside en equilibrar las propias experiencias del robot con la guía confiable de las demostraciones humanas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →