Talk to Me, Jarvis: An Open-Source Edge-Deployable Voice Assistant Framework for Autonomous Racecars
Questo articolo presenta Jarvis, un framework di assistenza vocale open-source, distribuibile su edge, per auto da corsa autonome che utilizza un modello Mistral 7B rifinito localmente per ottenere un riconoscimento degli intenti ad alta precisione con bassa latenza, eliminando la dipendenza dalla rete e i ritardi di inferenza delle soluzioni ospitate online.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Nel mondo ad alta posta in gioco delle corse autonome, dove i veicoli percorrono i circuiti a velocità incredibili senza un essere umano al volante, il margine di errore si misura in frazioni di secondo. Queste macchine si affidano a software complessi per percepire l'ambiente circostante, pianificare i propri percorsi e controllare i movimenti, ma richiedono comunque un operatore umano per impartire comandi critici quando si presentano situazioni impreviste. Tradizionalmente, un ingegnere di gara potrebbe usare una tastiera o uno schermo per dire all'auto di fermarsi, accelerare o tornare ai box. Tuttavia, distogliere lo sguardo dai dati in tempo reale per digitare un comando richiede tempo e, in una gara, quel ritardo può essere la differenza tra la vittoria e la sconfitta. Ciò crea la necessità di un assistente vocale che permetta all'operatore di parlare naturalmente mantenendo gli occhi sulla pista. La sfida consiste nel rendere questo assistente abbastanza veloce e affidabile per un'auto in movimento. Sebbene l'intelligenza artificiale moderna sia in grado di comprendere il linguaggio umano, le versioni più potenti risiedono spesso su server distanti nel cloud. Inviare un comando vocale al cloud e attendere una risposta introduce un ritardo e dipende da una connessione internet stabile, entrambi inaccettabili quando un'auto sfreccia lungo una pista. La soluzione richiede un assistente che viva interamente sul veicolo o su un computer locale nelle vicinanze, capace di ascoltare, comprendere e agire istantaneamente senza aver bisogno del mondo esterno.
I ricercatori dell'Università Tecnica di Monaco hanno sviluppato un sistema chiamato Jarvis per risolvere questo specifico problema. Hanno costruito un assistente vocale progettato per funzionare offline, il che significa che non ha bisogno di una connessione internet per funzionare. Il sistema funziona ascoltando una frase di attivazione specifica, "Hey Jarvis", e poi attendendo un comando. Una volta che l'operatore parla, l'assistente converte il suono in testo utilizzando uno strumento di riconoscimento vocale leggero che gira localmente. Questo testo viene poi passato a un modello di intelligenza artificiale specializzato che funge da traduttore, trasformando il linguaggio naturale dell'operatore umano in un'istruzione precisa e predefinita che l'auto può eseguire. Ad esempio, se un ingegnere dice "Porta l'auto a un arresto", il sistema riconosce che questo comando è lo stesso di "Ferma il veicolo" e lo mappa nell'unica azione sicura di fermare l'auto. L'intero processo, dall'ascolto della voce all'invio del comando digitale all'auto, avviene sull'hardware locale, garantendo che il sistema rimanga veloce e indipendente dalle condizioni di rete.
Per costruire questo, il team ha dovuto scegliere il tipo giusto di intelligenza artificiale. Hanno testato molti modelli diversi, compresi alcuni dei più potenti disponibili su internet, così come modelli più piccoli e leggeri che potessero girare su un laptop. Hanno scoperto che, mentre i potenti modelli online erano molto bravi a comprendere il linguaggio, erano troppo lenti per le corse. Il tempo necessario affinché un comando viaggi verso il cloud e torni indietro era spesso di diversi secondi, il che è troppo lungo per un'applicazione critica per i tempi. Al contrario, i modelli più piccoli in esecuzione localmente erano molto più veloci ma inizialmente faticavano a comprendere i comandi specifici necessari per le corzioni. I ricercatori hanno risolto questo problema prendendo uno di questi modelli più piccoli e locali e addestrandolo specificamente su un dataset di comandi di gara. Hanno insegnato al modello a riconoscere i molti modi diversi in cui un essere umano potrebbe chiedere all'auto di partire, fermarsi o cambiare velocità, assicurando che potesse gestire la varietà del linguaggio naturale pur rimanendo incredibilmente veloce.
I risultati del loro lavoro dimostrano che questo approccio è altamente efficace. Dopo l'addestramento del modello locale, il sistema ha raggiunto un tasso di successo del 97,63 percento nell'identificare correttamente il comando previsto. Ancora più importante, ha elaborato questi comandi con un ritardo medio di soli 1,39 secondi dal momento in cui il testo era pronto per l'analisi. Questa prestazione è stata superiore ai modelli più grandi basati sul cloud che hanno testato, i quali erano sia più lenti che meno accurati in questo specifico contesto. Il sistema include anche un controllo di sicurezza in cui l'assistente conferma il comando con l'operatore prima di inviarlo all'auto, assicurando che una parola mal interpretata non porti a un'azione indesiderata. Rendendo l'intero sistema open-source, i ricercatori hanno fornito un modello per altri che vogliano costruire strumenti simili per la robotica e i veicoli autonomi dove velocità e affidabilità sono fondamentali. Il lavoro dimostra che per compiti specializzati come il controllo di un'auto da corsa, un cervello locale accuratamente calibrato può superare un cervello massiccio e distante, provando che a volte la migliore intelligenza è quella che rimane esattamente dove è necessaria.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.