← Nieuwste papers
🤖 machine learning

Talk to Me, Jarvis: An Open-Source Edge-Deployable Voice Assistant Framework for Autonomous Racecars

Dit artikel introduceert Jarvis, een open-source, aan de edge inzetbaar voice assistant-framework voor autonome racewagens dat gebruikmaakt van een lokaal gefinetuned Mistral 7B-model om met hoge nauwkeurigheid intentieherkenning met een lage latentie te bereiken, waardoor de netwerkafhankelijkheid en inferentievertragingen van online gehoste oplossingen worden geëlimineerd.

Oorspronkelijke auteurs: Daniel Henel, Frederik Werner, Alexander Langmann, Johannes Betz

Gepubliceerd 2026-09-21
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Daniel Henel, Frederik Werner, Alexander Langmann, Johannes Betz

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de hooggestoken wereld van autonoom racen, waar voertuigen met ongelooflijke snelheden over circuits navigeren zonder een mens achter het stuur, wordt de foutmarge gemeten in fracties van een seconde. Deze machines vertrouwen op complexe software om hun omgeving waar te nemen, hun paden te plannen en hun bewegingen te controleren, maar ze hebben nog steeds een menselijke operator nodig om kritieke commando's uit te voeren wanneer onverwachte situaties zich voordoen. Traditioneel zou een race-engineer een toetsenbord of een scherm kunnen gebruiken om de auto te vertellen te stoppen, sneller te gaan of terug te keren naar de pitstraat. Het wegkijken van live gegevens om een commando te typen kost echter tijd, en in een race kan die vertraging het verschil zijn tussen overwinning en nederlaag. Dit creëert een behoefte aan een stemassistent waarmee de operator natuurlijk kan spreken terwijl hij zijn ogen op de baan houdt. De uitdaging ligt in het maken van deze assistent snel en betrouwbaar genoeg voor een rijdende auto. Hoewel moderne kunstmatige intelligentie menselijke spraak kan begrijpen, leven de krachtigste versies vaak op verre servers in de cloud. Het versturen van een spraakcommando naar de cloud en wachten op een antwoord introduceert een vertraging en is afhankelijk van een stabiele internetverbinding, beide onacceptabel wanneer een auto met hoge snelheid over een circuit raast. De oplossing vereist een assistent die volledig op het voertuig of een nabijgelegen lokale computer leeft, in staat om direct te horen, te begrijpen en te handelen zonder de buitenwereld nodig te hebben.

Onderzoekers aan de Technische Universiteit München hebben een systeem genaamd Jarvis ontwikkeld om dit specifieke probleem op te lossen. Ze bouwden een stemassistent die ontworpen is om offline te draaien, wat betekent dat het geen internetverbinding nodig heeft om te functioneren. Het systeem werkt door te luisteren naar een specifieke triggerphrase, "Hey Jarvis," en wacht vervolgens op een commando. Zodra de operator spreekt, zet de assistent het geluid om in tekst met behulp van een lichtgewicht spraakherkenningsinstrument dat lokaal draait. Deze tekst wordt vervolgens doorgegeven aan een gespecialiseerd model voor kunstmatige intelligentie dat fungeert als een vertaler, die de natuurlijke taal van de menselijke operator omzet in een precieze, vooraf gedefinieerde instructie die de auto kan uitvoeren. Als een engineer bijvoorbeeld zegt: "Breng de auto tot stilstand," herkent het systeem dit als hetzelfde commando als "Stop het voertuig" en koppelt het dit aan de enkele, veilige actie om de auto te stoppen. Het hele proces, van het horen van de stem tot het verzenden van het digitale commando naar de auto, vindt plaats op lokale hardware, waardoor wordt gegarandeerd dat het systeem snel en onafhankelijk van netwerkcondities blijft.

Om dit te bouwen, moest het team het juiste type kunstmatige intelligentie kiezen. Ze testten veel verschillende modellen, waaronder enkele van de krachtigste die beschikbaar zijn op internet, evenals kleinere, lichtere modellen die op een laptop kunnen draaien. Ze ontdekten dat hoewel de krachtige online modellen erg goed waren in het begrijpen van taal, ze te traag waren voor racen. De tijd die het kostte voor een commando om naar de cloud te reizen en terug te komen, was vaak enkele seconden, wat veel te lang is voor een tijdkritische toepassing. In contrast hiermee waren de kleinere modellen die lokaal draaiden veel sneller, maar hadden aanvankelijk moeite met het begrijpen van de specifieke commando's die nodig zijn voor racen. De onderzoekers losten dit op door een van deze kleinere, lokale modellen te nemen en het specifiek te trainen op een dataset van racecommando's. Ze leerden het model de vele verschillende manieren te herkennen waarop een mens zou kunnen vragen om de auto te starten, te stoppen of van snelheid te veranderen, waardoor het in staat is om de variëteit van natuurlijke spraak te verwerken terwijl het ongelooflijk snel blijft.

De resultaten van hun werk laten zien dat deze aanpak zeer effectief is. Na het trainen van het lokale model behaalde het systeem een succespercentage van 97,63 procent in het correct identificeren van het beoogde commando. Nog belangrijker is dat het deze commando's verwerkte met een gemiddelde vertraging van slechts 1,39 seconden vanaf het moment dat de tekst klaar was voor analyse. Deze prestatie was superieur aan de grotere, op de cloud gebaseerde modellen die ze testten, die zowel trager als minder nauwkeurig waren in deze specifieke context. Het systeem bevat ook een veiligheidscontrole waarbij de assistent het commando bevestigt bij de operator voordat het naar de auto wordt verzonden, om er zeker van te zijn dat een verkeerd verstaan woord niet leidt tot een onbedoelde actie. Door het hele systeem open-source te maken, hebben de onderzoekers een blauwdruk geboden voor anderen om vergelijkbare tools te bouwen voor robotica en autonome voertuigen waar snelheid en betrouwbaarheid van cruciaal belang zijn. Het werk laat zien dat voor gespecialiseerde taken zoals het besturen van een raceauto, een zorgvuldig afgestemde lokale hersenkracht een enorme, verre hersenkracht kan overtreffen, wat bewijst dat soms de beste intelligentie degene is die precies daar blijft waar hij nodig is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →