← Últimos artículos
🤖 machine learning

Dynin-Robotics: Omnimodal Unified Diffusion Vision-Language-Action Model

Dynin-Robotics presenta un modelo de difusión unificado omnimodal que trata el lenguaje, la visión y las acciones como tokens discretos para aprender conjuntamente la predicción de objetivos, el modelado de la dinámica y la generación de acciones, logrando un rendimiento competitivo en múltiples bancos de pruebas mediante el modelado de trayectorias compartidas y el escalado en tiempo de prueba.

Autores originales: Hoeun Lee, Jaeik Kim, Jusang Oh, Jinhyeok Kim, Geon Choi, Hyeonggeun Kim, Jaeyoung Do

Publicado 2026-09-14
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Hoeun Lee, Jaeik Kim, Jusang Oh, Jinhyeok Kim, Geon Choi, Hyeonggeun Kim, Jaeyoung Do

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los robots han luchado durante mucho tiempo por comprender el mundo de la misma manera que lo hacen los humanos. Si bien se puede programar a una máquina para mover su brazo a una coordenada específica, a menudo falla cuando la tarea requiere comprender una instrucción vaga como "pásame algo para cortar el paquete". Para resolver esto, los investigadores están construyendo sistemas que conectan el lenguaje, la visión y el movimiento físico en un solo cerebro. Estos sistemas, conocidos como modelos de visión-lenguaje-acción, intentan aprender no solo qué es un objeto, sino cómo se comporta y cómo manipularlo. El desafío ha sido que la mayoría de los enfoques actuales tratan estas habilidades por separado: una parte del sistema podría entender las palabras, otra podría reconocer la imagen y una tercera podría calcular los comandos motores. Esta separación a menudo deja al robot confundido cuando el mundo real cambia o cuando las instrucciones se formulan de maneras inesperadas.

Un equipo de investigadores de la Universidad Nacional de Seúl ha introducido un nuevo enfoque llamado Dynin-Robotics que unifica estas habilidades separadas en un único modelo cohesivo. En lugar de construir un cerebro robótico con diferentes módulos para diferentes tareas, crearon un sistema único que aprende a predecir el futuro de múltiples formas a la vez. Imagine un robot que, al recibir una tarea, no solo calcula el siguiente movimiento, sino que también imagina cómo se verá la escena después de ese movimiento, cuál debería ser el estado final del objetivo y cómo describir la tarea con palabras. Al entrenar un solo modelo para manejar todas estas predicciones simultáneamente, los investigadores descubrieron que el robot se vuelve mucho mejor siguiendo instrucciones, incluso cuando esas instrucciones se formulan de manera diferente a la que fue entrenado.

El núcleo de este sistema es un método llamado difusión enmascarada. En términos sencillos, este es un proceso de aprendizaje donde el modelo se le muestra una secuencia de información —como un video de una tarea, una instrucción escrita y los movimientos del robot— pero algunas partes de esa secuencia están ocultas o "enmascaradas". El trabajo del modelo es observar las partes visibles y adivinar cuáles deberían ser las partes ocultas. Por ejemplo, puede ver una imagen de una taza y las palabras "recoger la taza", pero los datos de movimiento están ocultos, por lo que debe predecir el movimiento correcto. En otro escenario, puede ver el movimiento y la instrucción, pero la imagen final de la taza en la mano está oculta, por lo que debe predecir el resultado. Al practicar estos diferentes tipos de juegos de adivinación en un conjunto masivo de datos de más de 1.3 millones de trayectorias robóticas, el modelo aprende una comprensión profunda de cómo se conectan el lenguaje, la visión y la acción.

Lo que hace que este enfoque sea único es que el mismo modelo puede cambiar entre estos diferentes roles instantáneamente. Puede actuar como una política, decidiendo qué acción tomar a continuación; como un modelo de mundo, prediciendo qué verá la cámara después de una acción; como un predictor de objetivos, visualizando el estado de éxito final de una tarea; o como un maestro, reconstruyendo la instrucción original a partir de un video del robot trabajando. Esta flexibilidad permite que el sistema utilice sus propias predicciones para mejorar su desempeño. Por ejemplo, antes de que el robot decida cómo mover su brazo, primero puede predecir cómo se ve el estado del objetivo. Luego utiliza ese objetivo predicho como guía para refinar su plan de acción. Este proceso de mirar hacia adelante y ajustar el plan en tiempo real ayuda al robot a manejar tareas complejas que requieren una alineación precisa, como insertar una flor en un florero o apilar bloques en un orden específico.

Los investigadores probaron este sistema en una variedad de pruebas de referencia para ver cómo se desempeñaba en comparación con otros modelos robóticos líderes. En tareas de simulación estándar, el modelo alcanzó una tasa de éxito del 98.1%, posicionándose entre los mejores exponentes en el campo. Más importante aún, cuando se probó en tareas donde las instrucciones fueron cambiadas para ser más indirectas o abstractas, el sistema mostró una capacidad significativa de adaptación. En un conjunto de experimentos, el modelo fue probado en una tarea donde tenía que seleccionar una fruta basándose en una descripción como "algo naturalmente dulce y jugoso" en lugar de un comando directo como "recoger la manzana". Mientras que otros modelos tuvieron dificultades con estos cambios de lenguaje, Dynin-Robotics mantuvo una alta tasa de éxito, demostrando que había aprendido el concepto subyacente de la tarea en lugar de solo memorizar frases específicas.

El sistema también demostró ser efectivo en el mundo real. Los investigadores desplegaron el modelo en un brazo robótico físico conocido como Franka Research 3. En una serie de pruebas en el mundo real que involucraban recoger frutas, clasificar cubos de colores y apilarlos en órdenes específicos, el robot logró una tasa de éxito promedio del 78.4% a través de cuatro diferentes condiciones de manipulación. Este desempeño fue particularmente fuerte en tareas que requerían seguir una secuencia de pasos, como apilar cubos en un orden de color especificado por el usuario. La capacidad de visualizar el objetivo y los pasos intermedios permitió al robot corregir su curso si cometía un error, una capacidad que suele faltar en sistemas más simples.

Más allá de su capacidad para controlar un robot, el modelo demostró una sorprendente capacidad para comprender y generar descripciones. Al mostrarle un video de un robot realizando una tarea, el sistema podía describir con precisión lo que estaba sucediendo, utilizando verbos como "recoger", "colocar" y "doblar", e identificando objetos por su color y ubicación. Inversamente, al recibir una descripción de una tarea, podía generar una predicción visual de cómo se vería la escena final. Estas capacidades sugieren que el modelo ha construido una representación interna rica del mundo físico que va más allá del simple control motor.

Para que este sistema sea lo suficientemente rápido para su uso en tiempo real, los investigadores también desarrollaron un método especializado para ejecutar el modelo. Debido a que el modelo trabaja refinando iterativamente sus suposiciones, puede ser lento si tiene que procesar cada paso uno por uno. El equipo creó una técnica que permite al modelo predecir y comprometerse con múltiples pasos de movimiento al mismo tiempo. Esta optimización aceleró el proceso de toma de decisiones del robot casi 30 veces en comparación con el método estándar, haciendo que sea factible ejecutar el complejo modelo en un hardware que pueda seguir el ritmo de la velocidad de un robot físico.

Los hallazgos de este trabajo sugieren que tratar el aprendizaje robótico como un problema de predicción unificada es una estrategia poderosa. Al combinar la capacidad de entender el lenguaje, predecir cambios visuales y generar acciones en un solo marco, los investigadores han creado un sistema que es más robusto y adaptable que los modelos anteriores. El éxito de Dynin-Robotics indica que cuando un robot puede imaginar el futuro y entender el contexto de una tarea, se vuelve mucho más capaz de manejar la naturaleza impredecible del mundo real. Aunque queda trabajo por hacer, particularmente en extender estas capacidades a secuencias de acciones más largas y complejas, este enfoque ofrece un camino prometedor hacia robots que realmente puedan entender e interactuar con su entorno.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →