← Últimos artículos
🤖 AI

Imitation Learning for Autonomous Driving in CARLA

Este artículo presenta una política de clonación de comportamiento multimodal compacta, entrenada en 236.882 ventanas de demostraciones de expertos en CARLA, que conduce de forma autónoma con éxito durante horas sin colisiones tanto en rutas de entrenamiento como en rutas no vistas, demostrando un desempeño efectivo en bucle cerrado y una transferencia cualitativa a nuevos entornos.

Autores originales: Jordy Kieto

Publicado 2026-09-17
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Jordy Kieto

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El sueño de enseñar a un coche a conducir por sí mismo ha dependido durante mucho tiempo de una idea sencilla e intuitiva: si una máquina puede observar a un conductor experto y copiar cada uno de sus movimientos, eventualmente debería aprender a conducir por su cuenta. Este enfoque, conocido como aprendizaje por imitación, trata el complejo desafío de girar, frenar y acelerar como un ejercicio de reconocimiento de patrones. Una computadora observa horas de video y datos de sensores de un humano o de un programa informático perfecto, aprendiendo a predecir qué acción tomar a continuación basándose en lo que ve. La dificultad reside en la brecha entre observar y hacer. Cuando un humano aprende a conducir, practica en un bucle; si se desvía ligeramente del curso, lo corrige y aprende de esa corrección. Sin embargo, una máquina entrenada únicamente con ejemplos perfectos nunca ha visto qué sucede cuando comete un error. Si se desvía aunque sea un poco, entra en una situación que el experto nunca demostró y, sin una guía, ese pequeño error puede derivar en un accidente. La pregunta que enfrentan los investigadores es si un sistema puede aprender lo suficiente de una biblioteca estática de conducciones perfectas para manejar la realidad desordenada e impredecible de conducir por su cuenta.

En un estudio reciente utilizando un sofisticado simulador de conducción llamado CARLA, un investigador llamado Jordy Kieto exploró precisamente esta cuestión. El objetivo no era inventar un nuevo tipo de cerebro informático, sino ver cuánta habilidad de conducción real podía adquirir un sistema relativamente simple y compacto a partir de una biblioteca cuidadosamente seleccionada de conducciones expertas. El investigador construyó una política —un conjunto de instrucciones para el coche— que podía observar un flujo de imágenes de una cámara, un mapa de vista aérea creado por un escáner láser y una lista de próximas direcciones viales. Al alimentar este sistema con cinco segundos de historial a la vez, el equipo lo entrenó para predecir el acelerador, el freno y los movimientos del volante de un conductor experto. Los datos de entrenamiento provinieron de una fuente única: un proceso sistemático que generó miles de clips cortos de conducción, asegurando que el coche viera una mezcla equilibrada de carreteras rectas, giros a la izquierda y giros a la derecha, en lugar de solo los caminos fáciles y rectos que suelen dominar los registros de conducción.

Los resultados de este experimento fueron sorprendentemente robustos. Una vez entrenada con aproximadamente tres horas y media de estos clips de conducción verificados, la política fue colocada en el simulador para conducir por su cuenta, sin un humano y sin una red de seguridad que interviniera. En esta prueba de bucle cerrado, donde cada giro que el coche realizaba determinaba lo que vería a continuación, el sistema condujo durante horas en las mismas carreteras en las que había sido entrenado, y también en carreteras completamente diferentes que nunca había visto. Navegó curvas, gestionó intersecciones y se mantuvo dentro de su carril sin un solo colisión en las ejecuciones del autor. Quizás lo más notable es que el sistema mostró una capacidad para recuperarse de errores grandes. Cuando el coche era colocado muy lejos de la carretera o apuntaba en la dirección incorrecta —situaciones que nunca se le enseñó explícamente a corregir—, a menudo lograba maniobrar para volver a la superficie de conducción y reanudar su trayecto. Esta recuperación ocurrió sin que el sistema hubiera visto jamás una demostración de "recuperación" en sus datos de entrenamiento; simplemente generalizó a partir de las pequeñas correcciones que había aprendido durante el proceso de entrenamiento.

Sin embargo, el estudio es cuidadoso al distinguir entre lo que se observó y lo que se demostró. Las hazañas de conducción descritas aquí tuvieron lugar enteramente dentro de un simulador de computadora, un entorno controlado libre de peatones, semáforos o clima impredecible. El éxito del sistema dependió en gran medida de una pieza de información "privilegiada": una ruta precisa y precalculada de marcas de carril proporcionada por el mapa interno del simulador, la cual el coche podía ver pero un conductor real no tendría acceso de la misma manera. Los investigadores señalaron explícitamente que, si bien el coche funcionó bien, no afirmaron haber resuelto el problema de conducir en el mundo real. También señalaron que la capacidad del sistema para realizar giros seguía siendo la parte más desafiante, siendo los errores al girar más frecuentes que los errores al conducir en línea recta. El estudio sirve como una poderosa demostración de que un sistema simple, alimentado con datos de alta calidad y diversos, puede aprender a conducir de forma autónoma en una simulación durante períodos prolongados, pero se detiene antes de declarar esto un producto terminado para la carretera abierta.

La importancia de este trabajo reside menos en la arquitectura informática específica utilizada y más en el método de preparación. El investigador trató los datos mismos como la variable principal, pasando de un conjunto pequeño y desordenado de conducciones manuales a un proceso riguroso y automatizado que generó y verificó cada uno de los clips de entrenamiento. Al asegurar que los datos de entrenamiento cubrieran maniobras específicas e incluyeran variaciones aleatorias leves en las posiciones de inicio, el sistema aprendió a manejar una gama más amplia de situaciones de lo que habría hecho con un conjunto de datos estándar. El estudio concluye que, si bien el entrenamiento fuera de línea —aprender de una biblioteca estática— puede producir un conductor que funcione bien en un bucle, la verdadera prueba de competencia sigue siendo la capacidad de manejar lo inesperado. Los investigadores han publicado todo su código, datos y el propio modelo entrenado, invitando a otros a probar estos hallazgos, medir las tasas de recuperación con mayor precisión y explorar cuánto de este éxito depende de la información del mapa privilegiado frente a la comprensión visual de la carretera.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →