← Últimos artículos
🤖 machine learning

Talk to Me, Jarvis: An Open-Source Edge-Deployable Voice Assistant Framework for Autonomous Racecars

Este artículo presenta Jarvis, un marco de trabajo de asistente de voz de código abierto y desplegable en el borde para autos de carreras autónomos que utiliza un modelo Mistral 7B ajustado localmente para lograr un reconocimiento de intención de alta precisión con baja latencia, eliminando la dependencia de la red y los retrasos de inferencia de las soluciones alojadas en línea.

Autores originales: Daniel Henel, Frederik Werner, Alexander Langmann, Johannes Betz

Publicado 2026-09-21
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Daniel Henel, Frederik Werner, Alexander Langmann, Johannes Betz

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo de alto riesgo de las carreras autónomas, donde los vehículos navegan por las pistas a velocidades increíbles sin un humano al volante, el margen de error se mide en fracciones de segundo. Estas máquinas dependen de un software complejo para percibir su entorno, planificar sus trayectorias y controlar sus movimientos, pero aún requieren que un operador humano emita comandos críticos cuando surgen situaciones inesperadas. Tradicionalmente, un ingeniero de carrera podría usar un teclado o una pantalla para decirle al coche que se detenga, acelere o regrese a los boxes. Sin embargo, apartar la vista de los datos en vivo para escribir un comando toma tiempo, y en una carrera, ese retraso puede ser la diferencia entre la victoria y la derrota. Esto crea la necesidad de un asistente de voz que permita al operador hablar de forma natural mientras mantiene sus ojos en la pista. El desafío radica en hacer que este asistente sea lo suficientemente rápido y confiable para un coche en movimiento. Si bien la inteligencia artificial moderna puede entender el habla humana, las versiones más potentes suelen vivir en servidores distantes en la nube. Enviar un comando de voz a la nube y esperar una respuesta introduce un retraso y depende de una conexión a internet estable, ambos de los cuales son inaceptables cuando un coche avanza a toda velocidad por una pista. La solución requiere un asistente que viva enteramente en el vehículo o en una computadora local cercana, capaz de escuchar, entender y actuar instantáneamente sin necesitar el mundo exterior.

Investigadores de la Universidad Técnica de Múnich han desarrollado un sistema llamado Jarvis para resolver este problema específico. Construyeron un asistente de voz diseñado para funcionar fuera de línea (offline), lo que significa que no necesita una conexión a internet para funcionar. El sistema funciona escuchando una frase de activación específica, "Hey Jarvis", y luego esperando un comando. Una vez que el operador habla, el asistente convierte el sonido en texto utilizando una herramienta de reconocimiento de voz ligera que se ejecuta localmente. Este texto se pasa luego a un modelo de inteligencia artificial especializado que actúa como un traductor, convirtiendo el lenguaje natural del operador humano en una instrucción precisa y predefinida que el coche pueda ejecutar. Por ejemplo, si un ingeniero dice, "Haz que el coche se detenga", el sistema reconoce esto como el mismo comando que "Detén el vehículo" y lo mapea a la única acción segura de detener el coche. Todo el proceso, desde escuchar la voz hasta enviar el comando digital al coche, ocurre en el hardware local, asegurando que el sistema permanera rápido e independiente de las condiciones de la red.

Para construir esto, el equipo tuvo que elegir el tipo adecuado de inteligencia artificial. Probaron muchos modelos diferentes, incluyendo algunos de los más potentes disponibles en internet, así como modelos más pequeños y ligeros que podrían ejecutarse en una computadora portátil. Descubrieron que, si bien los modelos potentes en línea eran muy buenos entendiendo el lenguaje, eran demasiado lentos para las carreras. El tiempo que tardaba un comando en viajar a la nube y volver era a menudo de varios segundos, lo cual es demasiado largo para una aplicación de tiempo crítico. En contraste, los modelos más pequeños que se ejecutan localmente eran mucho más rápidos, pero inicialmente tenían dificultades para entender los comandos específicos necesarios para las carreras. Los investigadores resolvieron esto tomando uno de estos modelos locales más pequeños y entrenándolo específicamente con un conjunto de datos de comandos de carreras. Le enseñaron al modelo a reconocer las muchas formas diferentes en que un humano podría pedirle al coche que arranque, se detenga o cambie de velocidad, asegurando que pudiera manejar la variedad del habla natural mientras permanecía increíblemente rápido.

Los resultados de su trabajo muestran que este enfoque es altamente efectivo. Después de entrenar el modelo local, el sistema logró una tasa de éxito del 97.63 por ciento en la identificación correcta del comando pretendido. Más importante aún, procesó estos comandos con un retraso promedio de solo 1.39 segundos desde el momento en que el texto estuvo listo para el análisis. Este rendimiento fue superior al de los modelos más grandes basados en la nube que probaron, los cuales eran tanto más lentos como menos precisos en este contexto específico. El sistema también incluye una verificación de seguridad donde el asistente confirma el comando con el operador antes de enviarlo al coche, asegurando que una palabra mal escuchada no conduzca a una acción no deseada. Al hacer que todo el sistema sea de código abierto, los investigadores han proporcionado un plano para que otros construyan herramientas similares para la robótica y los vehículos autónomos donde la velocidad y la confiabilidad son primordiales. El trabajo demuestra que, para tareas especializadas como controlar un coche de carreras, un cerebro local cuidadosamente ajustado puede superar a uno masivo y distante, demostrando que, a veces, la mejor inteligencia es la que se queda justo donde se necesita.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →