← Últimos artículos
💻 computer science

DREAM: Deployment-Time Demonstration Generation via Real-to-Sim for Scalable Policy Adaptation

DREAM es un marco de trabajo que permite la adaptación escalable de modelos de visión-lenguaje-acción a nuevos espacios de trabajo mediante la generación automática de datos de ajuste fino a través de la reconstrucción de real-a-simulación, la planificación de tareas impulsada por LLM y el renderizado de trayectorias, eliminando así la necesidad de costosas demostraciones de teleoperación humana.

Autores originales: Makoto Sato, Tatsuya Matsushima, Yutaka Matsuo, Yusuke Iwasawa

Publicado 2026-09-01
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Makoto Sato, Tatsuya Matsushima, Yutaka Matsuo, Yusuke Iwasawa

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los robots han sido durante mucho tiempo maestros de la repetición, realizando el mismo movimiento preciso miles de veces en una fábrica, pero tienen dificultades cuando se les pide que se adapten a una nueva habitación o a una disposición ligeramente diferente de los objetos. Para enseñar a un robot una nueva tarea, los ingenieros recurren tradicionalmente a un método llamado teleoperación, donde un humano guía físicamente a la máquina a través de los pasos, registrando cada movimiento para crear un conjunto de datos de entrenamiento. Aunque es efectivo, este proceso es lento, costoso y requiere la presencia de una persona para cada nuevo entorno. El campo de la robótica está girando hacia un enfoque diferente: el uso de modelos de inteligencia artificial que pueden comprender el lenguaje y la visión simultáneamente. Estos modelos, entrenados en vastas cantidades de datos, ya pueden adivinar cómo mover un brazo robótico basándose en una frase sencilla como "pon el bloque azul en el cuenco". Sin embargo, incluso estos sistemas avanzados suelen fallar cuando se colocan en un entorno del mundo real que nunca han visto, porque la disposición específica de la habitación, la iluminación y la posición exacta de los objetos crean un desafío único que el entrenamiento genérico no puede resolver.

Investigadores de la Universidad de Tokio han desarrollado un sistema llamado DREAM para resolver este problema sin necesidad de que un humano guíe al robot. En lugar de pedir a una persona que demuestre la tarea, el sistema toma un video corto del espacio de trabajo vacío y una instrucción de texto sencilla. Luego, construye una copia digital precisa de esa habitación, completa con los ángulos de cámara exactos que el robot utilizará para ver. Utilizando un sofisticado motor de planificación, la computadora calcula una secuencia lógica de movimientos para lograr el objetivo, como recoger un objeto y colocarlo en algún otro lugar. Luego genera miles de variaciones de esta tarea, simulando diferentes posiciones iniciales para los objetos y registrando los movimientos exitosos del robot en este mundo virtual. Estos movimientos simulados se convierten luego en imágenes realistas y datos de acción, que se utilizan para perfeccionar el cerebro del robot antes de que toque el mundo real.

El núcleo de este método reside en la creación de un "gemelo digital" del espacio físico. Los investigadores comienzan grabando un breve video de la mesa o el espacio de trabajo con una cámara de mano estándar. El sistema analiza estas imágenes para reconstruir la escena en tres dimensiones, capturando la textura y la posición de cada superficie y objeto. Crucialmente, alinea esta reconstrucción digital con el propio sistema de coordenadas del robot, asegurando que la cámara virtual vea el mundo exactamente como lo harán las cámaras del robot real. Esto permite que el sistema genere datos de entrenamiento que se ven y se sienten como el entorno real, cerrando la brecha entre la simulación por computadora y el mundo físico. Una vez construido el entorno, el sistema utiliza un modelo de lenguaje extenso para traducir la instrucción humana en un conjunto de metas lógicas. Por ejemplo, si la instrucción es empacar fruta, el sistema entiende que primero debe alcanzar el plátano, luego el durazno y finalmente colocarlos en el plato.

Con las metas definidas, el sistema emplea un planificador de tareas y movimientos para determinar los pasos físicos necesarios para tener éxito. Este planificador actúa como un ingeniero altamente lógico, desglosando la tarea en una secuencia de acciones y calculando los movimientos exactos de las articulaciones que el robot necesita realizar para evitar colisiones y alcanzar sus objetivos. Genera un pequeño conjunto de trayectorias iniciales exitosas, conocidas como demostraciones de origen. Para crear suficientes datos para entrenar un robot robusto, el sistema expande estos pocos ejemplos en un conjunto de datos masivo. Toma los movimientos exitosos y los aplica a cientos de nuevos escenarios aleatorizados donde los objetos están en diferentes lugares. Verifica cada nuevo intento para asegurar que sea físicamente posible y seguro, descartando cualquiera que falle. Finalmente, renderiza estos intentos exitosos en fotogramas de video fotorrealistas, creando un conjunto completo de pares de imagen y acción de los cuales el robot puede aprender.

Los investigadores probaron este enfoque en un brazo robótico real realizando dos tareas distintas: colocar un bloque azul en un cuenco rojo, y empacar un plátano y un durazno en un plato en un orden específico. Compararon robots entrenados con datos generados por DREAM frente a robots entrenados con datos recolectados por operadores humanos guiando a la máquina. Los resultados mostraron que el gemelo digital era un predictor fiable del rendimiento en el mundo real; si un robot funcionaba bien en la simulación, funcionaba bien en el mundo real. Más importante aún, el sistema demostró ser altamente escalable. Mientras que un operador humano podía producir alrededor de cien demostraciones en un tiempo razonable, el sistema DREAM generó mil ejemplos de entrenamiento de alta calidad. Al ser entrenados con este mayor volumen de datos generados automáticamente, los robots alcanzaron tasas de éxito más altas que aquellos entrenados con el conjunto más pequeño de demostraciones humanas.

El estudio destaca un cambio significativo en la forma en que los robots aprenden. Si bien la teleoperación humana sigue siendo una forma válida de recolectar datos, está limitada por el tiempo y la atención del operador. El sistema DREAM, por el contrario, requiere solo una captura de video y una instrucción de texto para producir una vasta biblioteca de ejemplos de entrenamiento. La configuración inicial toma unos minutos, pero una vez que el sistema está en funcionamiento, puede generar miles de escenarios de entrenamiento en el tiempo que le toma a un humano registrar solo un puñado. Los investigadores encontraron que para tareas simples, los datos generados automáticamente permitieron al robot tener éxito con más frecuencia que los datos recolectados por humanos, simplemente porque el volumen de práctica era mucho mayor. Para tareas más complejas de varios pasos, el sistema aún superó la recolección de datos humanos, aunque la complejidad de la tarea requería más tiempo computacional para planificar los movimientos iniciales.

Este trabajo sugiere un futuro donde los robots puedan ser desplegados en nuevos entornos con una intervención humana mínima. En lugar de esperar a que un especialista pase horas enseñando a un robot cómo navegar en una cocina o taller específico, un usuario podría simplemente mostrarle la habitación al robot y decirle qué hacer. El sistema se encargaría entonces del trabajo pesado de crear los datos de entrenamiento, asegurando que el robot esté preparado para los desafíos específicos de ese espacio. Los investigadores reconocen que su sistema actual funciona mejor con objetos rígidos sobre mesas estáticas, y que el trabajo futuro deberá abordar escenarios más complejos que involucren objetos blandos o en movimiento. Sin embargo, la capacidad de convertir un simple video y una oración en una política de robot totalmente entrenada representa un paso importante hacia hacer que los asistentes robóticos sean verdaderamente adaptables y accesibles para el uso diario.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →