SocioGesture: Real-Time and Adaptive Social Gesture Perception for Human-Robot Interaction
Il documento presenta SocioGesture, un sistema di percezione dei gesti sociali in tempo reale e adattivo per l'interazione uomo-robot che utilizza un modello a doppio stream leggero, addestrato con corruzione consapevole dell'occlusione, per ottenere un riconoscimento robusto e a bassa latenza su dispositivi edge pur espandendo continuamente il proprio vocabolario attraverso l'adattamento offline.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
I robot stanno imparando a muoversi nel nostro mondo, ma per interagire con noi in modo naturale, devono fare molto di più che seguire comandi vocali. Devono comprendere il linguaggio silenzioso del movimento umano: un cenno della mano per dire ciao, un palmo alzato per dire stop, o un telefono tenuto all'orecchio per segnalare "sono occupato". Questa è la sfida dell'interazione uomo-robot, un campo dedicato all'insegnamento alle macchine come leggere questi segnali sociali. La difficoltà risiede nella realtà disordinata del mondo reale. A differenza di un video guardato in un ufficio tranquillo, un robot vede le persone da angolazioni variabili, spesso con le mani nascoste dietro il corpo o perse nelle ombre. Inoltre, un robot non può permettersi di fermarsi a riflettere a lungo; se esita troppo a interpretare un gesto, l'interazione risulta interrotta e innaturale. L'obiettivo è costruire un sistema che sia abbastanza veloce da stare al passo con una conversazione, abbastanza intelligente da gestire informazioni mancanti e capace di imparare dai propri errori senza che un essere umano debba riprogramarlo ogni volta.
I ricercatori di OpenMind hanno sviluppato un nuovo sistema chiamato SocioGesture per risolvere questo problema. È uno strumento di percezione in tempo reale progettato specificamente per robot che devono riconoscere gesti sociali mentre si muovono e lavorano. Il sistema funziona osservando lo scheletro di una persona — la mappa delle sue articolazioni e ossa — piuttosto che cercare di analizzare i suoi vestiti o lo sfondo. Questo approccio è stato scelto perché uno scheletro rimane riconoscibile anche quando la luce cambia o la persona indossa abiti diversi. Tuttavia, i ricercatori sapevano che il tracciamento standard dello scheletro spesso fallisce quando una mano è occlusa o l'angolo della telecamera cambia. Per risolvere il problema, hanno costruito un modello che presta attenzione alla confidenza di ogni singola articolazione. Se la telecamera del robot non è sicura di dove si trovi una mano, il sistema annota tale incertezza invece di indovinare alla cieca. Esso combina il movimento ampio del corpo con i dettagli fini della mano, fondendoli insieme in un unico calcolo rapidissimo che gira direttamente sul computer di bordo del robot.
L'innovazione principale di SocioGesture è il modo in cui gestisce le inevitabili lacune nei dati. In molti sistemi precedenti, se un'articolazione chiave come il polso mancava, l'intero tentativo di riconoscimento falliva. Questo nuovo sistema è addestrato per aspettarsi quelle lacune. I ricercatori hanno deliberatamente "corrotto" i loro dati di addestramento nascondendo mani e braccia nelle simulazioni al computer, costringendo il modello a imparare come riconoscere un gesto anche quando parti dello scheletro sono invisibili. Questo addestramento avviene prima che il robot lasci il laboratorio, quindi il robot non ha bisogno di potenza di calcolo extra per essere robusto. Quando il robot è sul campo, prende decisioni basandosi su ciò che vede. Se è molto sicuro di un gesto, agisce immediatamente. Se è incerto, non indovina; invece, salva quel momento di interazione per una revisione successiva. Ciò crea un ciclo di sicurezza in cui il robot evita di commettere errori pericolosi, come avvicinarsi a qualcuno che sta cercando di fermarlo, pur continuando a raccogliere dati per diventare più intelligente.
Il sistema è stato testato in una varietà di ambienti interni ed esterni con persone reali. I ricercatori hanno raccolto un dataset di sette gesti sociali comuni, tra cui salutare con la mano per invitare un robot ad avvicinarsi, alzare una mano per fermarlo, o fingere di essere al telefono per segnalare l'indisponibilità. Hanno incluso anche un gesto "distrattore", come grattarsi la testa, per garantire che il robot non lo confondesse con una telefonata. Quando testato su persone che il robot non aveva mai visto prima, il sistema ha identificato correttamente i gesti in quasi tutti i casi, anche quando le mani erano parzialmente nascoste. In un test specifico in cui le mani erano completamente mascherate dai dati, l'accuratezza del sistema è passata da un scarso 31 percento a un solido 85 percento, provando che il metodo di addestramento funzionava. Il sistema è stato anche abbastanza veloce da stare al passo con una normale telecamera video, elaborando un intero fotogramma in soli 25 millisecondi su un computer montato sul robot, il che è sufficiente per sembrare istantaneo a un osservatore umano.
Forse il risultato più significativo è la capacità del sistema di apprendere dopo il dispiegamento. I ricercatori hanno impostato un processo in cui il robot segnalava i momenti in cui era incerto e inviava quei clip video a un computer più potente nel cloud. Quel computer potente etichettava il gesto e il robot utilizzava quella nuova informazione per aggiornare il proprio cervello. In un test in cui il robot è stato istruito su tre nuovi gesti — dare il pollice in su, una stretta di mano e un saluto militare — ha imparato con successo senza dimenticare i sette originali. Il sistema ha mantenuto la sua alta accuratezza sui vecchi gesti pur identificando correttamente i nuovi circa due terzi delle volte. Ciò dimostra una strada percorribile in cui i robot possono espandere il loro vocabolario di segnali sociali nel tempo, adattandosi a nuove situazioni senza dover essere spenti e riaddestrati da zero.
I ricercatori hanno inoltre testato il sistema su un robot dal vivo, un robot umanoide chiamato Unitree G1, interagendo con cinque nuove persone che non facevano parte dei dati di addestramento. In 150 prove, il robot ha riconosciuto correttamente il gesto nel 97 percento dei casi. Quando il robot decideva di agire, sceglieva il comportamento corretto — come avvicinarsi o fermarsi — il 98 percento delle volte. Le poche volte in cui non ha agito non sono state dovute a un errore, ma perché stava agendo con cautela; ha scelto di aspettare piuttosto che rischiare una mossa errata. Questo approccio conservativo è esattamente ciò che i progettisti intendevano per un robot in uno spazio pubblico. Lo studio suggerisce che combinando un modello leggero e veloce con una strategia orientata alla sicurezza e un ciclo di apprendimento offline, possiamo costruire robot che siano non solo efficienti, ma anche socialmente consapevoli e adattabili alla natura imprevedibile dell'interazione umana.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.