← Últimos artículos
🤖 AI

WA-JEPA: Rethinking the Video JEPA Paradigm for World-Action Modeling in Autonomous Driving

El artículo presenta WA-JEPA, un nuevo modelo de mundo-acción que replantea el paradigma Video JEPA mediante el empleo de un preentrenamiento híbrido de enmascaramiento futuro y el ajuste de flujo condicional para generar latentes futuros plausibles, logrando así un rendimiento de vanguardia en la planificación de la conducción autónoma en bancos de pruebas como NAVSIM y HUGSIM.

Autores originales: Xinlin Wang, Yujiao Xiang, Yuheng Zhou, Jingqi Wang, Minqing Huang, Jiajie Huang, Dongxu Wei, Tingguang Zhou, Xiyang Wang, Gong Chen, Zhi Xu, Feiyang Tan, Hangning Zhou, Mu Yang

Publicado 2026-08-24
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Xinlin Wang, Yujiao Xiang, Yuheng Zhou, Jingqi Wang, Minqing Huang, Jiajie Huang, Dongxu Wei, Tingguang Zhou, Xiyang Wang, Gong Chen, Zhi Xu, Feiyang Tan, Hangning Zhou, Mu Yang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los coches autónomos han dependido durante mucho tiempo de un enfoque modular, donde una parte del software ve la carretera, otra decide qué hacer y una tercera conduce el vehículo. Esta separación a menudo provoca que los errores se acumulen, como en un juego del teléfono escacharrado donde el mensaje se distorsiona en cada turno. Para resolver esto, los investigadores han estado desarrollando sistemas de extremo a extremo que aprenden a conducir directamente desde imágenes de cámara hacia comandos de dirección, de forma muy similar a un conductor humano que ve una situación y reacciona sin descomponerla conscientemente en pasos. Sin embargo, estos sistemas suelen tener dificultades con escenarios raros o complejos porque carecen de la capacidad de "pensar por adelantado" sobre lo que podría pasar después. Ven el presente con claridad, pero les cuesta imaginar el futuro, lo cual es esencial para una navegación segura.

Una nueva y prometedora dirección involucra los "modelos de mundo", que son programas informáticos entrenados para predecir cómo cambiará una escena con el tiempo. Al aprender a pronosticar los próximos segundos de un vídeo, estos modelos pueden comprender la dinámica del tráfico y utilizar esa previsión para planificar sus propios movimientos. No obstante, una brecha significativa ha persistido entre las potentes técnicas de predicción de vídeo utilizadas en la investigación y las necesidades específicas de la conducción autónoma. Muchos métodos existentes intentan rellenar las partes faltantes de un vídeo de forma aleatoria, lo cual es bueno para comprender el pasado pero malo para predecir el futuro. Otros dependen de representaciones simplificadas y comprimidas del mundo que pierden demasiado detalle para ser útiles en la toma de decisiones complejas. El desafío ha sido crear un sistema que pueda comprender tanto la realidad rica y detallada de la carretera como generar de forma fiable futuros plausibles para guiar sus acciones.

Investigadores de Afari Intelligent Drive y diversas universidades han abordado esto replanteando una arquitectura específica conocida como Arquitectura Predictiva de Incrustación Conjunta de Vídeo, o V-JEPA. Esta tecnología está diseñada para aprender patrones profundos y significativos de vídeos sin necesidad de etiquetas humanas, pero en su forma original, fue construida para completar piezas faltantes de un vídeo en lugar de mirar hacia adelante en el tiempo. El equipo se dio cuenta de que, para que un coche conduzca solo, necesita mirar hacia adelante, no solo rellenar huecos. Desarrollaron un nuevo sistema llamado WA-JEPA, que adapta las potentes capacidades de aprendizaje de V-JEPA específicamente para la tarea de la conducción. En lugar de adivinar aleatoriamente partes faltantes de un vídeo, su modelo es entrenado para observar la carretera actual y predecir exactamente cómo se verá la escena en el futuro, mientras decide simultáneamente qué debe hacer el coche.

El núcleo de su innovación reside en cómo enseñan al modelo a pensar en el tiempo. En la primera etapa de entrenamiento, el sistema se le muestra una secuencia de fotogramas de vídeo de múltiples cámaras de un coche. Luego, se le pide que imagine los fotogramas futuros que vienen después del último momento visible. A diferencia de los métodos anteriores que podrían intentar adivinar un fotograma faltante en medio de un vídeo, este modelo es forzado a mirar estrictamente hacia adelante, aprendiendo las relaciones de causa y efecto del tráfico. Para que estas predicciones sean más realistas, los investigadores reemplazaron un enfoque matemático estándar con una técnica llamada "flow matching" (ajuste de flujo). Esto permite al modelo generar un camino suave y continuo de posibilidades futuras, en lugar de simplemente adivinar un único resultado estático. Esto es crucial porque el futuro rara vez es un único punto fijo; es un rango de posibilidades por el que el coche debe navegar.

En la segunda etapa, los investigadores conectaron esta capacidad de ver el futuro directamente con los controles del coche. Construyeron un sistema único y unificado que predice tanto el aspecto futuro de la carretera como las acciones futuras del coche al mismo tiempo. Al entrenar estas dos tareas juntas, el modelo aprende que la forma en que el mundo cambia está directamente ligada a cómo se mueve el coche. Si el coche gira, la vista cambia de una manera específica; si el coche se detiene, el mundo se comporta de manera diferente. Este estrecho acoplamiento significa que el modelo no solo ve el mundo, sino que comprende cómo sus propias acciones moldean ese mundo. El resultado es un sistema que puede razonar sobre situaciones de tráfico complejas simulando el futuro en su mente antes de realizar un movimiento.

El equipo probó su nuevo sistema en un benchmark estándar llamado NAVSIM, que utiliza datos de conducción del mundo real para evaluar qué tan bien los vehículos autónomos pueden navegar. En la prueba NAVSIM-v2, WA-JEPA alcanzó una puntuación de 91.7, superando a los mejores métodos de conducción de extremo a extremo existentes y a otros enfoques de modelos de mundo. Esta mejora indica que el sistema es mejor evitando colisiones y siguiendo las reglas de tráfico. Quizás de manera más impresionante, los investigadores probaron el modelo en un simulador de bucle cerrado completamente diferente llamado HUGSIM sin darle entrenamiento adicional en ese entorno específico. En esta prueba "zero-shot", donde el coche tenía que conducir continuamente y reaccionar a sus propios errores en tiempo real, WA-JEPA logró una puntuación alta de 0.4462, superando por un margen significativo a todos los demás métodos. Esto sugiere que la capacidad de predecir el futuro y planificar acciones conjuntamente crea una comprensión robusta de la conducción que se transfiere bien a situaciones nuevas y no vistas.

Los hallazgos sugieren que la clave para una mejor conducción autónoma puede no estar en añadir más sensores o más reglas complejas, sino en enseñar al sistema a imaginar el futuro con mayor precisión. Al cambiar el enfoque de simplemente completar datos de vídeo faltantes a predecir activamente lo que viene después, y al vincular esa predicción directamente con las decisiones del coche, los investigadores han creado un modelo que conduce con un sentido de previsión más humano. Este enfoque cierra la brecha entre comprender el mundo visual y tomar medidas, ofreciendo un camino hacia vehículos que puedan manejar la naturaleza impredecible de las carreteras del mundo real con mayor confianza y seguridad.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →