← Últimos artículos
💻 computer science

RedLight-VLA: Models for traffic-rule grounding and behavioral emphasis in driving policies

RedLight-VLA es un nuevo objetivo de entrenamiento para políticas de conducción de Visión-Lenguaje-Acción que combina el reponderado conductual derivado de la trayectoria y cabezales auxiliares paralelos para mejorar el cumplimiento de las reglas y el énfasis conductual en intersecciones semaforizadas, reduciendo significativamente el exceso de paso de luz roja y los errores de trayectoria sin requerir anotaciones de reglas manuales adicionales.

Autores originales: Bala Murali Manoghar Sai Sudhakar, Sourab Bapu Sridhar, Sandipan Das, Rahul Ahuja, Meda Lazar, Ashish Garg, Pratik Likhar, Senthil Yogamani

Publicado 2026-09-01
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Bala Murali Manoghar Sai Sudhakar, Sourab Bapu Sridhar, Sandipan Das, Rahul Ahuja, Meda Lazar, Ashish Garg, Pratik Likhar, Senthil Yogamani

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Conducir un coche por una ciudad es una negociación constante entre un movimiento suave y predecible y paradas repentinas y críticas. En la mayor parte del tiempo, un vehículo circula por una autopista o se serpentea suavemente entre el tráfico, manteniendo una velocidad constante. Estos momentos de conducción rutinaria constituyen la gran mayoría del tiempo que un coche pasa en la carretera. Sin embargo, los momentos que realmente ponen a prueba la habilidad y la seguridad de un conductor son las excepciones raras: el frenado brusco cuando un peatón se cruza, el arranque repentino desde un semáforo o la detención cuidadosa ante una señal roja. Cuando los ingenieros enseñan a las computadoras a conducir mostrándoles miles de horas de conducción humana grabada, la computadora ve principalmente las partes fáciles y aburridas. Aprende a navegar bien, pero a menudo tiene dificultades con las maniobras raras y de alto riesgo porque aparecen con mucha poca frecuencia en los datos. Este desequilibrio crea un punto ciego donde la computadora podría no frenar con suficiente fuerza o dudar al volver a arrancar, lo que conduce a un comportamiento inseguro en las intersecciones.

Investigadores de Qualcomm y Arriver han desarrollado un nuevo enfoque para solucionar esta debilidad específica en el software de conducción autónoma, conocido como modelos de Visión-Lenguaje-Acción (Vision-Language-Action). Estos sistemas están diseñados para comprender el mundo visual, interpretar las normas de tráfico y decidir cómo mover el coche. El equipo, liderado por Bala Murali Manoghar Sai Sudhakar y colegas, se dio cuenta de que simplemente mostrarle a la computadora más datos de conducción no era suficiente. En su lugar, crearon un método de entrenamiento que obliga a la computadora a prestar especial atención a los momentos raros y difíciles, mientras también le enseña a reconocer explícitamente las señales de tráfico y las líneas de parada. Llaman a su sistema RedLight-VLA. Al ajustar la forma en que la computadora aprende de sus errores y darle una forma dedicada de "leer" los semáforos, lograron que el vehículo fuera significativamente mejor al detenerse ante una luz roja y al arrancar en verde, sin necesidad de etiquetar manualmente cada una de las reglas de tráfico en los videos de entrenamiento.

El problema central que los investigadores abordaron es que el entrenamiento estándar trata cada segundo de video de conducción como igualmente importante. En un conjunto de datos típico, un coche puede circular el noventa y ocho por ciento del tiempo y solo frenar bruscamente el dos por ciento. Si la computadora se entrena para minimizar su error promedio a través de todos estos segundos, los eventos raros de frenado quedan ahogados por los miles de segundos de conducción suave. La computadora aprende a ser buena en el caso promedio, pero falla en los casos límite críticos. Para resolver esto, el equipo introdujo una técnica llamada reponderación conductual (behavioral reweighting). Imagine a un profesor calificando la tarea de un estudiante que decide que acertar un solo problema matemático difícil vale tantos puntos como acertar diez problemas fáciles. De la misma manera, los investigadores programaron el sistema para asignar una importancia mucho mayor a los momentos raros de frenado brusco y aceleración rápida. Cuando la computadora comete un error durante estos momentos críticos, siente un "empuje" mucho más fuerte para corregirse. Este ajuste se realiza automáticamente analizando la velocidad y la aceleración del conductor experto en la grabación, de modo que ningún humano necesita revisar y marcar qué clips son importantes.

La segunda parte de su solución aborda un problema diferente: la computadora necesita saber por qué debe detenerse. En muchos sistemas actuales, la decisión de detenerse es solo un subproducto de la trayectoria que el coche intenta seguir. Los investigadores querían que la computadora comprendiera explícitamente el estado del semáforo y la posición de la línea de parada. Crearon un sistema donde la computadora reserva algunos "espacios" internos específicos en su memoria para contener esta información. Después de que la computadora observa las imágenes de la cámara y el mapa, llena estos espacios con la respuesta a preguntas como "¿Hay una luz roja?" y "¿A qué distancia está la línea de parada?". Una parte pequeña y separada del sistema luego verifica si las respuestas en estos espacios son correctas basándose en las reglas de tráfico conocidas. Esto obliga a la computadora a construir una representación interna clara de las reglas de tráfico, separada de simplemente adivinar la trayectoria del coche. Crucialmente, esto sucede sin que la computadora necesite hablar o escribir texto para explicar su razonamiento, manteniendo el proceso rápido y eficiente.

Cuando los investigadores probaron este enfoque combinado en un gran conjunto de grabaciones de conducción del mundo real, los resultados mostraron una mejora clara en los comportamientos críticos de seguridad. El sistema que utilizó tanto la atención extra a las maniobras raras como la verificación explícita de reglas redujo el número de veces que el coche sobrepasaba una línea de parada en un semáforo en rojo del 7.3 por ciento al 6.8 por ciento. También redujo el error en la velocidad del coche al aproximarse a una línea de parada en casi un 13 por ciento. Quizás lo más importante es que el sistema se volvió mejor al predecir la trayectoria futura del coche en general, reduciendo la distancia promedio entre donde la computadora predecía que estaría el coche y donde realmente necesitaba estar. Sin embargo, los investigadores señalaron una compensación: en su esfuerzo por ser más seguros en los semáforos en rojo, el sistema se volvió ligeramente más cauteloso, lo que provocó un pequeño aumento en el número de veces que se detenía innecesariamente en semáforos en verde. Si bien el método combinado fue mejor para gestionar esta compensación que usar cualquiera de las dos técnicas por separado, resaltó que hacer un sistema más seguro a menudo implica equilibrar diferentes tipos de errores.

El estudio demuestra que los coches autónomos pueden hacerse más fiables no solo alimentándolos con más datos, sino enseñándoles a valorar los momentos raros y peligrosos más que los comunes y seguros. Al identificar automáticamente cuándo un conductor está frenando fuerte o arrancando desde una parada, y al forzar al sistema a rastrear explícitamente las señales de tráfico, los investigadores crearon un modelo que se comporta más como un humano que entiende las reglas de la carretera. Este trabajo sugiere que el futuro de la conducción autónoma reside en refinar cómo las máquinas aprenden de los bordes de su experiencia, asegurando que los momentos que más importan sean los que mejor aprenden. El enfoque no requiere nuevos sensores ni el etiquetado manual de las reglas de tráfico, lo que lo convierte en un paso práctico hacia vehículos autónomos más seguros y robustos que puedan manejar la naturaleza impredecible de la conducción urbana.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →