← Derniers articles
🤖 machine learning

Talk to Me, Jarvis: An Open-Source Edge-Deployable Voice Assistant Framework for Autonomous Racecars

Cet article présente Jarvis, un cadre d'assistant vocal open-source déployable en périphérie pour les voitures de course autonomes, qui utilise un modèle Mistral 7B affiné localement pour atteindre une reconnaissance d'intention de haute précision avec une faible latence, éliminant ainsi la dépendance au réseau et les délais d'inférence des solutions hébergées en ligne.

Auteurs originaux : Daniel Henel, Frederik Werner, Alexander Langmann, Johannes Betz

Publié 2026-09-21
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Daniel Henel, Frederik Werner, Alexander Langmann, Johannes Betz

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Dans le monde à enjeux élevés de la course automobile autonome, où les véhicules parcourent des circuits à des vitesses incroyables sans être pilotés par un humain, la marge d'erreur se mesure en fractions de seconde. Ces machines s'appuient sur des logiciels complexes pour percevoir leur environnement, planifier leurs trajectoires et contrôler leurs mouvements, mais elles nécessitent toujours l'intervention d'un opérateur humain pour émettre des commandes critiques lorsque des situations imprévues surviennent. Traditionnellement, un ingénieur de course peut utiliser un clavier ou un écran pour ordonner à la voiture de s'arrêter, d'accélérer ou de retourner aux stands. Cependant, détourner le regard des données en direct pour taper une commande prend du temps, et dans une course, ce délai peut faire la différence entre la victoire et la défaite. Cela crée un besoin pour un assistant vocal qui permette à l'opérateur de parler naturellement tout en gardant les yeux fixés sur la piste. Le défi consiste à rendre cet assistant assez rapide et fiable pour une voiture en mouvement. Bien que l'intelligence artificielle moderne puisse comprendre la parole humaine, les versions les plus puissantes résident souvent sur des serveurs distants dans le cloud. Envoyer une commande vocale vers le cloud et attendre une réponse introduit un délai et dépend d'une connexion internet stable, deux facteurs inacceptables lorsqu'une voiture fonce sur une piste. La solution nécessite un assistant qui réside entièrement dans le véhicule ou sur un ordinateur local à proximité, capable d'entendre, de comprendre et d'agir instantanément sans avoir besoin du monde extérieur.

Des chercheurs de l'Université technique de Munich ont développé un système nommé Jarvis pour résoudre ce problème spécifique. Ils ont conçu un assistant vocal destiné à fonctionner hors ligne, ce qui signifie qu'il n'a pas besoin de connexion internet pour fonctionner. Le système fonctionne en écoutant une phrase d'activation spécifique, « Hey Jarvis », puis en attendant une commande. Une fois que l'opérateur parle, l'assistant convertit le son en texte à l'aide d'un outil de reconnaissance vocale léger qui s'exécute localement. Ce texte est ensuite transmis à un modèle d'intelligence artificielle spécialisé qui agit comme un traducteur, transformant le langage naturel de l'opérateur humain en une instruction précise et prédéfinie que la voiture peut exécuter. Par exemple, si un ingénieur dit : « Amenez la voiture à l'arrêt », le système reconnaît que cette commande est identique à « Arrêtez le véhicule » et la fait correspondre à l'action unique et sûre de l'arrêt de la voiture. L'ensemble du processus, de l'audition de la voix à l'envoi de la commande numérique à la voiture, se déroule sur du matériel local, garantissant que le système reste rapide et indépendant des conditions de réseau.

Pour construire cela, l'équipe a dû choisir le bon type d'intelligence artificielle. Ils ont testé de nombreux modèles différents, y compris certains des plus puissants disponibles sur Internet, ainsi que des modèles plus petits et plus légers capables de fonctionner sur un ordinateur portable. Ils ont constaté que si les modèles en ligne puissants étaient très bons pour comprendre le langage, ils étaient trop lents pour la course. Le temps nécessaire pour qu'une commande voyage vers le cloud et revienne était souvent de plusieurs secondes, ce qui est beaucoup trop long pour une application critique. En revanche, les modèles plus petits fonctionnant localement étaient beaucoup plus rapides mais, au départ, peinaient à comprendre les commandes spécifiques nécessaires à la course. Les chercheurs ont résolu ce problème en prenant l'un de ces modèles locaux plus petits et en l'entraînant spécifiquement sur un ensemble de données de commandes de course. Ils ont appris au modèle à reconnaître les nombreuses façons dont un humain pourrait demander à la voiture de démarrer, de s'arrêter ou de changer de vitesse, garantissant qu'il puisse gérer la variété du langage naturel tout en restant incroyablement rapide.

Les résultats de leurs travaux montrent que cette approche est très efficace. Après l'entraînement du modèle local, le système a atteint un taux de réussite de 97,63 % dans l'identification correcte de la commande voulue. Plus important encore, il a traité ces commandes avec un délai moyen de seulement 1,39 seconde à partir du moment où le texte était prêt pour l'analyse. Cette performance était supérieure à celle des modèles plus larges basés sur le cloud qu'ils ont testés, qui étaient à la fois plus lents et moins précis dans ce contexte spécifique. Le système comprend également une vérification de sécurité où l'assistant confirme la commande auprès de l'opérateur avant de l'envoyer à la voiture, garantissant qu'un mot mal entendu ne mène pas à une action involontaire. En rendant l'ensemble du système open-source, les chercheurs ont fourni un modèle permettant à d'autres de construire des outils similaires pour la robotique et les véhicules autonomes où la vitesse et la fiabilité sont primordiales. Ce travail démontée que pour des tâches spécialisées comme le contrôle d'une voiture de course, un cerveau local soigneusement ajusté peut surpasser un cerveau massif et distant, prouvant que parfois, la meilleure intelligence est celle qui reste exactement là où elle est nécessaire.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →