CLAP: Cross-Embodiment Video World Models are Zero-Shot Physical Simulators
CLAP es un marco novedoso que permite la simulación física zero-shot a través de diversas encarnaciones de robots y humanos mediante el entrenamiento en videos heterogéneos a escala de internet, reconciliando espacios de acción dispares a través de una receta de aprendizaje basada en currículo para lograr un rendimiento de vanguardia en la adaptación few-shot y en la comprensión generalizable de la física.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Los robots han luchado durante mucho tiempo por comprender el mundo físico de la misma manera que lo hacen los humanos. Mientras que un niño aprende que una taza se caerá si se empuja fuera de una mesa o que una toalla puede doblarse tirando de sus esquinas, los robots a menudo requieren miles de ejemplos específicos para aprender incluso una de estas reglas simples. Esta dificultad surge del hecho de que la mayoría de los sistemas de aprendizaje robótico se entrenan con datos de un único tipo de máquina. Un robot con un brazo largo y delgado aprende la física de forma diferente a un robot con una pinza o una mano humana, lo que crea una barrera donde el conocimiento adquirido por uno no puede compartirse fácilmente con otro. Para superar esto, los científicos han comenzado a mirar hacia los modelos de generación de video, que son programas informáticos capaces de imaginar qué sucede después en una escena. Si un robot pudiera observar un video y predecir el movimiento futuro de los objetos, podría planificar sus acciones sin necesidad de probarlas físicamente primero. Sin embargo, estos modelos predictivos se han visto históricamente limitados a tipos de robots únicos, lo que impide que aprendan de la vasta y diversa biblioteca de videos de humanos y robots disponible en internet.
Un equipo de investigadores de la Universidad de Princeton ha desarrollado un nuevo marco llamado CLAP para cerrar esta bregap. Su trabajo demuestra que un único modelo de video puede aprender las leyes universales de la física entrenándose en una mezcla masiva de videos que presentan tanto a humanos como a muchos tipos diferentes de robots. La idea central es que, aunque una mano humana, un brazo robótico y una pinza se ven diferentes, todos obedecen las mismas reglas físicas al mover objetos. Al enseñar a una computadora a predecir el futuro de una escena independientemente de quién o qué esté realizando la acción, los investigadores crearon un sistema que comprende la mecánica subyacente del mundo en lugar de solo los movimientos específicos de una máquina. Este enfoque permite que el modelo aprenda de videos de internet no etiquetados, donde no se proporcionan instrucciones, así como de datos detallados de robots, creando una comprensión mucho más rica de cómo se mueven e interactúan las cosas.
Los investigadores enfrentaron un obstáculo significativo porque los datos que querían utilizar eran desordenados e inconsistentes. Los videos de humanos no vienen con instrucciones sobre cómo se movieron sus manos, y diferentes robots utilizan diferentes formas de describir sus movimientos. Para resolver esto, el equipo creó un método para traducir todos estos diferentes lenguajes de movimiento en un formato común. Utilizaron tres herramientas principales: la posición precisa de la mano de un robot, descripciones de texto simples del movimiento y una representación de acción oculta y aprendida que la computadora descubre por sí misma. La estrategia más efectiva involucró un proceso de aprendizaje paso a paso. Primero, el modelo aprendió las reglas básicas de la física observando videos no etiquetados utilizando las representaciones de acción ocultas. Una vez que comprendió la dinámica fundamental, los investigadores refinaron su conocimiento utilizando datos precisos de robots con movimientos etiquetados. Este enfoque de dos etapas permitió que el sistema escalara utilizando la vasta cantidad de video de internet, manteniendo al mismo tiempo la precisión suficiente para controlar robots reales.
Los resultados de este trabajo muestran que el nuevo sistema rinde tan bien como, y a menudo mejor que, los mejores modelos existentes que fueron entrenados solo en un único tipo de robot. En entornos de prueba desafiantes, el modelo pudo predecir los fotogramas futuros de un video con alta precisión, simulando correctamente cómo los objetos caen, se deslizan o son manipulados. Crucialmente, el sistema fue capaz de generalizar este conocimiento a tareas del mundo real sin necesidad de ser reentrenado para cada nuevo robot. Cuando se probó en un robot de un solo brazo, el sistema ayudó con éxito a un robot a planificar sus acciones para recoger diversos objetos, tales como cinta, pescado o langosta, superando las políticas robóticas estándar. Aún más impresionante, el sistema pudo aplicarse a un robot de dos brazos y a un robot humanoide con una estructura corporal diferente, a pesar de no haber sido entrenado con datos de esas máquinas específicas. Simplemente ajustando la capa final del modelo para que coincida con los movimientos del nuevo robot, el sistema mantuvo su profunda comprensión de la física y continuó realizando predicciones precisas.
Esta investigación sugiere que el camino hacia robots más capaces no requiere construir un cerebro único para cada nueva máquina. En su lugar, al entrenar con una mezcla diversa de datos, un único modelo puede aprender un conjunto general de principios físicos que se aplican a casi cualquier agente. Los investigadores descubrieron que, mientras que los movimientos relativos, que describen el cambio en lugar de la posición, funcionaban bien para las instrucciones basadas en texto, las posiciones absolutas eran necesarias para el control preciso con brazos robóticos. También descubrieron que, si bien los videos humanos eran excelentes para enseñar al modelo los conceptos básicos de la física, los datos de robots reales eran esenciales para traducir ese conocimiento en acciones exitosas en el mundo real. El trabajo establece una nueva forma de entrenar robots, alejándose de sistemas aislados y de un solo propósito hacia un enfoque más unificado donde el aprendizaje de una encarnación puede beneficiar directamente a otra. Aunque el sistema no es perfecto y a veces puede cometer errores en sus predicciones, representa un paso significativo hacia la enseñanza de las máquinas para comprender el mundo físico a través de la observación y la imaginación.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.