Towards smart and adaptive agents for active sensing on edge devices
Questo articolo introduce un sistema agente compatto, basato sull'inferenza attiva, che consente il sensing attivo adattivo in tempo reale su dispositivi edge con risorse limitate, permettendo loro di pianificare e controllare dinamicamente i movimenti della telecamera per superare i limiti dei tradizionali approcci TinyML.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immaginate una telecamera che non si limita a registrare il mondo, ma sceglie attivamente cosa guardare, proprio come un occhio umano che scatta da un dettaglio all'altro per costruire un'immagine completa. Questo è il regno della percezione attiva (active sensing), un concetto in cui le macchine non aspettano passivamente i dati, ma muovono i propri sensori per raccogliere le informazioni più utili. Per anni, il sogno è stato quello di applicare questo tipo di comportamento intelligente e adattivo a piccoli dispositivi alimentati a batteria che si trovano proprio dove avviene l'azione, come una telecamera di sicurezza o un robot, senza dover inviare dati a un server remoto nel cloud. La sfida è stata che i potenti sistemi di intelligenza artificiale in grado di fare questo richiedono enormi quantità di potenza di calcolo e memoria, rendendoli impossibili da eseguire su questi piccoli dispositivi locali.
Un team di ricercatori ha ora costruito un sistema che colma questo divario, creando un agente intelligente capace di vedere, pianificare e muovere una telecamera in tempo reale mentre gira su un dispositivo non più grande di una piccola scheda computerizzata. Pubblicato in uno studio recente, questo lavoro dimostra che è possibile combinare due approoli diversi all'intelligenza artificiale: uno eccellente nel riconoscere oggetti nelle immagini, e un altro eccellente nel prendere decisioni in condizioni di incertezza. Il risultato è un "agente saccadico" (saccade agent), chiamato così in onore dei rapidi e scattanti movimenti oculari che gli esseri umani compiono per concentrarsi sui dettagli, capace di controllare una telecamera per seguire le persone o esplorare una stanza autonomamente. Il sistema funziona interamente sul dispositivo edge, il che significa che elabora tutto localmente, garantendo reazioni rapide e mantenendo la privacy dei dati.
I ricercatori hanno affrontato un problema specifico: i modelli di deep learning standard, che sono molto bravi a individuare cose come persone o auto in un flusso video, sono rigidi. Una volta addestrati, faticano ad adattarsi se l'ambiente cambia o se devono decidere dove guardare successivamente per trovare qualcosa di nuovo. Essi si affidano a enormi quantità di dati e potenza di calcolo per apprendere, il che è l'opposto di ciò di cui un piccolo dispositivo a bassa potenza ha bisogno. Per risolvere il problema, il team non ha cercato di rendere il modello di deep learning più grande o più intelligente. Al contrario, ha aggiunto un secondo livello di intelligenza sopra di esso, basato su un principio chiamato inferenza attiva. Questo approccio tratta l'agente come uno scienziato che aggiorna costantemente le proprie convinzioni sul mondo. Si chiede: "Cosa mi aspetto di vedere?" e "Cosa mi sorprenderebbe?". Se la telecamera non vede nulla di nuovo, l'agente decide di spostarsi in un punto diverso per imparare di più. Se vede qualcosa di interessante, come una persona, si concentra su di essa. Questo processo decisionale è incredibilmente leggero, richiede pochissima memoria, il che permette di eseguirlo insieme al software di rilevamento oggetti più pesante.
Per testare questa idea, il team ha costruito un prototipo fisico utilizzando un dispositivo NVIDIA Jetson, un computer potente progettato per compiti di intelligenza artificiale sull'edge. Hanno collegato questo dispositivo a una telecamera che può ruotare (pan) e inclinarsi (tilt), simile alle telecamere di sicurezza presenti in molti edifici. Il sistema ha ricevuto un compito semplice ma potente: osservare una scena e decidere dove puntare l'obiettivo. La prima parte del sistema, il modulo di percezione, ha utilizzato uno strumento di rilevamento oggetti molto noto chiamato YOLO per scansionare il flusso video e trovare persone o oggetti. Questo strumento è stato ottimizzato per girare velocemente sull'hardware del dispositivo. La seconda parte, il modulo di pianificazione, ha preso l'elenco delle cose viste dalla telecamera e ha utilizzato l'inferenza attiva per decidere la mossa successiva. Ha calcolato in quale direzione la telecamera dovesse girarsi per continuare a tenere d'occhio una persona o per scansionare un'area vuota per vedere se appariva qualcosa di nuovo.
I risultati hanno mostrato che questa combinazione ha funzionato molto bene entro i severi limiti dell'hardware. L'intero sistema, inclusi i software necessari per farlo girare, rientrava in un'impronta di memoria di soli 304 megabyte, una dimensione minuscola per un sistema di intelligenza artificiale. In una configurazione, la telecamera poteva elaborare il video e prendere una decisione su dove guardare successivamente 108 volte al secondo, una velocità sufficiente per sembrare istantanea a un osservatore umano. In un'altra configurazione, il sistema ha dato priorità alla velocità rispetto alla memoria, raggiungendo 45 fotogrammi di analisi video al secondo pur prendendo decisioni 250 volte al secondo. I ricercatori hanno scoperto che il tempo necessario per prendere una decisione era così breve che il sistema poteva facilmente stare al passo con il flusso video, permettendo alla telecamera di seguire fluidamente bersagli in movimento o di setacciare una stanza senza ritardi.
Ciò che rende questo traguardo significativo non è solo il fatto che la telecamera si sia mossa, ma come si sia mossa. L'agente non ha seguito un percorso pre-programmato. Al contrario, ha reagito all'ambiente in tempo reale. Se una persona entrava nell'inquadratura, la telecamera la agganciava. Se la persona si muoveva, la telecamera la seguiva. Se la persona usciva e la stanza era vuota, l'agente decideva di scansionare il resto della stanza per vedere se stava accadendo qualcos'altro. Questo comportamento imita il modo in cui gli esseri umani esplorano naturalmente l'ambiente circostante, bilanciando la necessità di concentrarsi su ciò che è importante con la necessità di rimanere consapevoli dell'intero quadro. I ricercatori hanno dimostrato questo utilizzando una telecamera montata su un piccolo robot, mostrando come il sistema potesse aiutare una macchina a esplorare un nuovo ambiente e raccogliere informazioni in modo efficiente senza intervento umano.
Lo studio ha anche testato attentamente diversi modi per eseguire il software sull'hardware per trovare il miglior equilibrio tra velocità e uso della memoria. Hanno scoperto che l'utilizzo di strumenti specifici progettati per il processore grafico del dispositivo permetteva al sistema di girare molto più velocemente rispetto all'uso di metodi standard. Tuttavia, hanno anche scoperto che per la parte decisionale del sistema, che è molto piccola, tentare di eseguirla sul potente processore grafico in realtà la rallentava, perché l'overhead di gestione del compito era superiore al beneficio del potere extra. Questo risultato evidenzia l'importanza di abbinare gli strumenti software giusti all'hardware giusto, un passaggio cruciale per rendere questi sistemi praticabili per l'uso nel mondo reale.
Questo lavoro suggerisce che il futuro dei dispositivi intelligenti non richiede necessariamente enormi supercomputer basati sul cloud. Combinando una robusta capacità di vedere con una leggera capacità di pianificare, è possibile creare agenti che siano sia intelligenti che efficienti. I ricercatori hanno dimostrato che questi sistemi possono operare indipendentemente, prendendo decisioni in frazioni di secondo per raccogliere informazioni in ambienti complessi e mutevoli. Sebbene l'attuale sistema si concentri sul controllo di una telecamera, gli stessi principi potrebbero essere applicati ad altri compiti, come aiutare un robot a navigare in una stanza affollata o un drone a cercare una persona scomparsa. Lo studio conclude che l'inferenza attiva offre una strada promettente per la creazione di macchine adattive e a basso consumo di risorse che possano gestire l'imprevedibilità del mondo reale, portando la potenza della percezione intelligente direttamente sull'edge.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.