← Últimos artículos
💻 computer science

A Multi-Modal Perception Pipeline for Object Detection and Tracking in Autonomous Racing

Este artículo presenta un robusto flujo de trabajo de percepción de fusión tardía multimodal que integra datos de cámara, LiDAR y RADAR con un marco de seguimiento especializado para lograr la detección y el seguimiento de objetos fiables en carreras autónomas bajo condiciones de alta velocidad, adversas y de casos límite.

Autores originales: Davide Malvezzi, Michele Pestarino, Vittoria Cavicchioli, Valentina La Gamba, Silvia Severi, Fabio Bagni, Luca Bartoli, Massimiliano Bosi, Francesco Gatti, Micaela Verucchi, Ayoub Raji, Marko Bertogna

Publicado 2026-09-09
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Davide Malvezzi, Michele Pestarino, Vittoria Cavicchioli, Valentina La Gamba, Silvia Severi, Fabio Bagni, Luca Bartoli, Massimiliano Bosi, Francesco Gatti, Micaela Verucchi, Ayoub Raji, Marko Bertogna

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde los coches compiten a velocidades que harían sudar a un piloto de Fórmula Uno, pero sin que ningún humano esté al volante. En este entorno extremo, el margen de error se mide en pulgadas y milisegundos. A velocidades cercanas a los 80 metros por segundo, un retraso de solo una décima de segundo significa que un coche recorre casi ocho metros sin saber dónde está o qué hay delante de él. Esta es la realidad de las carreras autónomas, un campo que lleva la tecnología de percepción a su límite absoluto. Para navegar este caos, un vehículo debe actuar como sus propios ojos y cerebro, escaneando constantemente la pista para encontrar otros coches, predecir sus movimientos y decidir cuándo acelerar, frenar o esquivar. El desafío no es solo ver, sino ver con claridad a través del movimiento borroso, los sensores vibrantes y la aparición repentina de obstáculos, todo ello operando en condiciones que confundirían incluso a los sentidos humanos más avanzados.

Un equipo de investigadores de la Universidad de Módena y Reggio Emilia, trabajando con HiPeRT Srl, ha desarrollado un nuevo sistema diseñado para resolver estos problemas para la Liga de Carreras Autónomas de Abu Dabi 2025. Su trabajo, presentado en un artículo reciente, se centra en un "pipeline de percepción": una cadena compleja de software y hardware que convierte los datos brutos de los sensores del coche en un mapa fiable del mundo. El enfoque del equipo se basa en la idea de que ningún tipo de sensor es perfecto. Las cámaras son excelentes reconociendo formas, pero tienen dificultades con la distancia en la oscuridad o con mal tiempo. Los sensores LiDAR, que utilizan pulsos láser para construir un mapa 3D, son precisos pero pueden verse abrumados por el polvo o la lluvia. Las unidades RADAR son excelentes midiendo la velocidad, pero a menudo carecen de detalle. Los investigadores se dieron cuenta de que, para sobrevivir al caos de alta velocidad de una carrera, un coche necesita combinar todos estos sentidos en una visión única y unificada, un método que llaman "fusión tardía" (late fusion). Esto significa que el coche procesa los datos de cada sensor de forma independiente primero, y luego reúne los resultados para formar una imagen completa, en lugar de intentar fusionar los flujos de datos brutos inmediatamente.

El vehículo utilizado en este estudio, el Dallara EAV-24, está equipado con un sofisticado despliegue de herramientas: tres sensores LiDAR, siete cámaras y cuatro unidades RADAR, todos sincronizados con un reloj preciso. El sistema funciona haciendo que cada tipo de sensor busque a otros vehículos por su cuenta. Las cámaras utilizan una red neuronal para detectar los contornos 2D de los vehículos en la transmisión de vídeo. Los LiDAR escanean el aire con láseres para encontrar formas 3D, mientras que los RADAR detectan la velocidad y la presencia de objetos basándose en ondas de radio. Una vez realizadas estas detecciones independientes, el módulo de "fusión" del sistema actúa como un casamentero. Observa los datos de diferentes sensores y pregunta: "¿Es esta mancha del LiDAR el mismo coche que esa caja de la cámara?". Si el tiempo y la ubicación coinciden, el sistema los fusiona, creando una estimación robusta de dónde está el otro coche y a qué velocidad se mueve. Este proceso es crítico porque, si el sistema dependiera de un solo sensor, un fallo momentáneo o un punto ciego podría provocar un fallo catastrófico. Al combinarlos, el sistema garantiza que, si un sensor falla o queda bloqueado, los demás puedan mantener seguro al coche.

Sin embargo, ver el coche es solo la mitad de la batalla; saber dónde estará una fracción de segundo después es la otra mitad. Los investigadores descubrieron que, a velocidades de carrera, incluso un pequeño retraso en el procesamiento puede hacer que el coche piense que un obstáculo está en un lugar cuando en realidad se ha movido varios metros. Para solucionar esto, su sistema de seguimiento incluye un mecanismo de "compensación de retraso". Observa el momento exacto en que un sensor vio un objeto y calcula dónde debe estar ese objeto ahora mismo, teniendo en cuenta el tiempo que tardaron los datos en viajar a través del ordenador. Además, el sistema no solo adivina; utiliza una comprensión profunda de cómo se comportan los coches de carreras. Sabe que los coches generalmente siguen rutas específicas alrededor de la pista, llamadas líneas de carrera, y que frenan en las curvas y aceleran en las rectas. Al introducir este conocimiento en sus cálculos, el sistema puede predecir la posición futura de un coche con mucha mayor precisión que un rastreador estándar que asume que los coches se mueven en línea recta a velocidades constantes.

El equipo probó este sistema en condiciones reales durante el evento de carreras de 2025, enfrentando a su coche autónomo contra otros en el Circuito Yas Marina. Pusieron a prueba el sistema en tres escenarios específicos de alto estrés para ver cómo resistía. En la primera prueba, simularon un coche deteniéndose repentinamente en la pista mientras el vehículo autónomo se aproximaba a alta velocidad. El sistema detectó el coche detenido desde unos 80 metros de distancia y, en pocos cientos de milisegundos, estimó correctamente que no se estaba moviendo, dando al software de planificación tiempo suficiente para frenar o esquivar con seguridad. En el segundo escenario, probaron cómo el sistema manejaba una situación de "punto ciego" donde un coche bloqueaba la vista de otro. Cuando el coche que bloqueaba se movió, el sistema detectó inmediatamente al vehículo recién revelado y comenzó a rastrearlo sin vacilación, demostrando que podía manejar la aparición repentina de obstáculos. Finalmente, probaron un adelantamiento lado a lado, donde dos coches compitieron a centímetros de distancia. Aunque el sistema mostró un ligero sesgo en la estimación de la posición exacta del otro coche dependiendo de si estaba delante o detrás, la precisión general fue suficiente para completar la maniobra sin colisión.

Los resultados de estas pruebas confirmaron que combinar múltiples sensores es muy superior a depender de uno solo. Cuando los investigadores eliminaron los sensores LiDAR de la ecuación, la capacidad del sistema para juzgar la distancia disminuyó significamente. Cuando eliminaron el RADAR, el sistema tuvo dificultades para adivinar la velocidad de otros coches con precisión. Solo cuando los tres tipos de sensores trabajaron juntos, el sistema logró el mejor equilibrio entre precisión y alcance. El estudio concluye que, para que los vehículos autónomos operen de forma segura a velocidades extremas, no solo deben ver el mundo a través de muchos ojos, sino también pensar en el mundo de una manera que tenga en cuenta la física de las carreras. Aunque el sistema no es perfecto —todavía tiene dificultades con la geometría exacta de un coche cuando se ve desde un lateral—, representa un paso significativo hacia adelante. Demuestra que, al fusionar diferentes tipos de datos y comprender el contexto de la carrera, las máquinas pueden aprender a navegar en los entornos más peligrosos y exigentes de la Tierra.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →