← Neueste Arbeiten
🤖 machine learning

Talk to Me, Jarvis: An Open-Source Edge-Deployable Voice Assistant Framework for Autonomous Racecars

Dieses Paper stellt Jarvis vor, ein Open-Source-, am Edge einsetzbares Sprachassistenten-Framework für autonome Rennwagen, das ein lokal feinabgestimmtes Mistral 7B-Modell nutzt, um eine hochpräzise Absichtserkennung mit geringer Latenz zu erreichen und somit die Netzwerkabhängigkeit sowie die Inferenzverzögerungen von online gehosteten Lösungen zu eliminieren.

Ursprüngliche Autoren: Daniel Henel, Frederik Werner, Alexander Langmann, Johannes Betz

Veröffentlicht 2026-09-21
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Daniel Henel, Frederik Werner, Alexander Langmann, Johannes Betz

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In der hochriskanten Welt des autonomen Rennsports, in der Fahrzeuge mit unglaublichen Geschwindigkeiten ohne einen Menschen am Steuer über die Strecke navigieren, wird die Fehlermarge in Bruchteilen einer Sekunde gemessen. Diese Maschinen verlassen sich auf komplexe Software, um ihre Umgebung wahrzunehmen, ihre Pfade zu planen und ihre Bewegungen zu steuern, aber sie benötigen dennoch einen menschlichen Operator, um kritische Befehle auszuführen, wenn unerwartete Situationen auftreten. Traditionell könnte ein Renningenieur eine Tastatur oder einen Bildschirm verwenden, um dem Auto zu sagen, anzuhalten, zu beschleunigen oder in die Boxengasse zurückzukehren. Das Wegsehen von den Live-Daten, um einen Befehl einzutippen, kostet jedoch Zeit, und in einem Rennen kann diese Verzögerung der Unterschied zwischen Sieg und Niederlage sein. Dies schafft die Notwendigkeit für einen Sprachassistenten, der es dem Operator ermöglicht, natürlich zu sprechen, während er die Augen auf der Strecke behält. Die Herausforderung besteht darin, diesen Assistenten schnell und zuverlässig genug für ein fahrendes Auto zu machen. Während moderne künstliche Intelligenz die menschliche Sprache verstehen kann, leben die leistungsfähigsten Versionen oft auf fernen Servern in der Cloud. Das Senden eines Sprachbefehls in die Cloud und das Warten auf eine Antwort führt zu einer Verzögerung und hängt von einer stabilen Internetverbindung ab – beides ist inakzeptabel, wenn ein Auto mit hoher Geschwindigkeit über eine Rennstrecke rast. Die Lösung erfordert einen Assistenten, der vollständig auf dem Fahrzeug oder einem nahegelegenen lokalen Computer lebt und in der Lage ist, sofort zu hören, zu verstehen und zu handeln, ohne auf die Außenwelt angewiesen zu sein.

Forscher der Technischen Universität München haben ein System namens Jarvis entwickelt, um genau dieses Problem zu lösen. Sie bauten einen Sprachassistenten, der darauf ausgelegt ist, offline zu laufen, was bedeutet, dass er keine Internetverbindung benötigt, um zu funktionieren. Das System arbeitet, indem es auf eine spezifische Triggerphrase hört, „Hey Jarvis“, und dann auf einen Befehl wartet. Sob sobald der Operator spricht, wandelt der Assistent den Schall mithilfe eines leichtgewichtigen Spracherkennungstools, das lokal läuft, in Text um. Dieser Text wird dann an ein spezialisiertes Modell der künstlichen Intelligenz weitergeleitet, das als Übersetzer fungiert und die natürliche Sprache des menschlichen Operators in eine präzise, vordefinierte Anweisung umwandelt, die das Auto ausführen kann. Wenn ein Ingenieur beispielsweise sagt: „Bring das Auto zum Stillstand“, erkennt das System dies als denselben Befehl wie „Stoppe das Fahrzeug“ und bildet es auf die einzelne, sichere Aktion des Anhaltens ab. Der gesamte Prozess, vom Hören der Stimme bis zum Senden des digitalen Befehls an das Auto, findet auf lokaler Hardware statt, wodurch sichergestellt wird, dass das System schnell bleibt und unabhängig von Netzwerkbedingungen ist.

Um dies zu bauen, musste das Team die richtige Art von künstlicher Intelligenz auswählen. Sie testeten viele verschiedene Modelle, darunter einige der leistungsfähigsten, die im Internet verfügbar sind, sowie kleinere, leichtere Modelle, die auf einem Laptop laufen konnten. Sie fanden heraus, dass die leistungsstarken Online-Modelle zwar sehr gut darin waren, Sprache zu verstehen, aber zu langsam für den Rennsport waren. Die Zeit, die ein Befehl benötigte, um in die Cloud und zurück zu reisen, betrug oft mehrere Sekunden, was für eine zeitkritische Anwendung viel zu lang ist. Im Gegensatz dazu waren die kleineren, lokal laufenden Modelle viel schneller, hatten aber anfangs Schwierigkeiten, die spezifischen Befehle zu verstehen, die im Rennsport benötigt werden. Die Forscher lösten dies, indem sie eines dieser kleineren, lokalen Modelle nahmen und es gezielt auf einem Datensatz von Rennbefehlen trainierten. Sie brachten dem Modell bei, die vielen verschiedenen Arten zu erkennen, wie ein Mensch bitten könnte, das Auto zu starten, zu stoften oder die Geschwindigkeit zu ändern, um sicherzustellen, dass es die Vielfalt der natürlichen Sprache bewältigen kann und gleichzeitig unglaublich schnell bleibt.

Die Ergebnisse ihrer Arbeit zeigen, dass dieser Ansatz hocheffektiv ist. Nach dem Training des lokalen Modells erreichte das System eine Erfolgsquote von 97,63 Prozent bei der korrekten Identifizierung des beabsichtigten Befehls.ت Wichtiger noch: Es verarbeitete diese Befehle mit einer durchschnittlichen Verzögerung von nur 1,39 Sekunden ab dem Moment, in dem der Text für die Analyse bereit war. Diese Leistung war besser als die der größeren, cloudbasierten Modelle, die sie getestet hatten, welche sowohl langsamer als auch weniger genau in diesem spezifischen Kontext waren. Das System enthält zudem eine Sicherheitsprüfung, bei der der Assistent den Befehl beim Operator bestätigt, bevor er an das Auto gesendet wird, um sicherzustellen, dass ein falsch verstandenes Wort nicht zu einer unbeabsichtigten Aktion führt. Durch die Bereitstellung des gesamten Systems als Open-Source-Software haben die Forscher eine Blaupause für andere geschaffen, um ähnliche Werkzeuge für die Robotik und autonome Fahrzeuge zu entwickeln, bei denen Geschwindigkeit und Zuverlässigkeit von entscheidender Bedeutung sind. Die Arbeit zeigt, dass für spezialisierte Aufgaben wie die Steuerung eines Rennwagens ein sorgfältig abgestimmtes lokales Gehirn ein massives, entferntes Gehirn übertreffen kann, was beweist, dass die beste Intelligenz manchmal diejenige ist, die genau dort bleibt, wo sie benötigt wird.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →