← Ultimi articoli
💻 computer science

ReLI: Cross-Lingual Language-to-Action Grounding for Human-Robot Interaction

ReLI è un framework cross-lingue che adatta i modelli di fondazione su larga scala per consentire agli agenti autonomi di comprendere istruzioni in linguaggio naturale, ragionare semanticamente ed eseguire compiti efficacemente in oltre 140 lingue diverse, incluse varietà a basse risorse e creoli, superando così i limiti degli esistenti sistemi limitati alle sole lingue ad alte risorse.

Autori originali: Linus Nwankwo, Bjoern Ellensohn, Ozan Özdenizci, Elmar Rueckert

Pubblicato 2026-09-09
📖 6 min di lettura🧠 Approfondimento

Autori originali: Linus Nwankwo, Bjoern Ellensohn, Ozan Özdenizci, Elmar Rueckert

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immaginate un mondo in cui un robot possa comprendere un comando impartito in qualsiasi lingua, dalle lingue più diffuse ai rari dialetti parlati da piccole comunità. Per decenni, il sogno di una collaborazione naturale tra uomo e robot è stato frenato da una semplice barriera: la lingua. Mentre i robot moderni stanno diventando sempre più capaci di vedere ciò che li circonda e di muoversi in esso, sono stati ampiamente addestrati per comprendere solo un manipolo di lingue principali, come l'inglese o il mandarino. Questa limitazione esclude miliardi di potenziali utenti che parlano altre lingue, dialetti o creoli, escludendoli di fatto dal futuro dell'automazione. Il campo dell'interazione uomo-robot si basa sulla capacità di tradurre una richiesta verbale o scritta in un'azione fisica, un processo noto come grounding (ancoraggio). Finora, questa traduzione è stata una strada a senso unico, funzionando bene solo per coloro che hanno accesso alle lingue ad alta risorsa, lasciando indietro il resto del mondo.

Un team di ricercatori ha sviluppato un nuovo sistema chiamato ReLI, progettato per abbattere queste barriere linguistiche. ReLI consente agli agenti autonomi di conversare naturalmente, ragionare sul proprio ambiente ed eseguire compiti indipendentemente dalla lingua in cui viene impartito l'istruzione. Il sistema non si affida alla traduzione del parlato dell'utente in inglese in primo luogo, né richiede che il robot venga riaddestrato per ogni nuova lingua. Invece, sfrutta la capacità intrinseca dei modelli computerizzati pre-addestrati su larga scala di comprendere il significato dietro le parole attraverso centinaia di lingue diverse simultaneamente. Combinando questi modelli linguistici con sensori visivi che permettono al robot di "vedere" oggetti e spazi, ReLI può prendere un comando come "trova la sedia rossa" pronunciato in un dialetto raro e trasformarlo in un preciso movimento fisico, il tutto senza che l'utente debba conoscere alcun codice tecnico o parlare una lingua dominante globale.

I ricercatori hanno testato questo sistema sia in ambienti simulati che in contesti reali utilizzando robot con ruote e macchine quadrupede dotate di telecamere e sensori di profondità. Hanno sfidato i robot con oltre 70.000 conversazioni multi-turno in più di 140 lingue diverse. Queste lingue sono state accuratamente selezionate per rappresentare un ampio spettro della diversità linguistica mondiale, incluse lingue ad alta risorsa con vasti dati digitali, lingue a bassa risorsa con dati limitati e lingue vulnerabili o creoli che vengono spesso ignorati dalla tecnologia. I compiti variavano da semplici comandi a passaggio singolo, come muoversi in avanti di una distanza specifica, a missioni complesse a più fasi che richiedevano al robot di navigare attraverso una stanza, identificare un oggetto basandosi su una descrizione e riferire ciò che ha trovato.

I risultati hanno mostrato che il sistema ha operato con una costanza sorprendente attraverso questo vasto panorama linguistico. In quasi tutte le lingue testate, il robot ha compreso correttamente l'intento dell'utente ed eseguito il compito con un tasso di successo superiore all'83 percento. Per molte delle lingue più comuni, il tasso di successo è salito sopra il 97 percento. Anche per le lingue più vulnerabili e meno dotate di risorse, il sistema ha mantenuto alti livelli di precisione, interpretando con successo le istruzioni e guidando il robot verso il suo obiettivo. Il tempo necessario al robot per elaborare un comando e iniziare a muoversi è rimasto stabile, con una media compresa tra 2,1 e 2,6 secondi, indipendentemente dal fatto che l'istruzione fosse data in una lingua mondiale importante o in un dialetto raro. Questa velocità e affidabilità suggeriscono che il sistema non è solo un concetto teorico, ma uno strumento pratico capace di funzionare in tempo reale.

Per garantire che la tecnologia fosse veramente inclusiva, i ricercatori hanno condotto anche uno studio con partecipanti umani che interagivano con i robot nelle loro lingue madri. Trentantaquattro valutatori, fluenti in 13 lingue diverse, hanno testato il sistema in un ambiente di laboratorio reale. Hanno riferito che le interazioni risultavano naturali e reattive, con la stragrande maggioranza che non percepiva alcuna differenza di prestazione basata sulla lingua utilizzata. Questo reperto è fondamentale, poiché indica che il sistema non favorisce una lingua rispetto a un'altra, né crea un divario nascosto in cui gli utenti di certe lingue ricevono un'esperienza peggiore. Il sistema ha gestito con successo il code-switching, ovvero quando un utente mescola parole di due lingue diverse in una singola frase, e ha gestito il ragionamento spaziale complesso, come navigare verso una posizione descritta solo dalla sua funzione, come "il posto dove si cucina il cibo".

Il cuore di questo traguardo risiede nel modo in cui il sistema collega il linguaggio all'azione. Quando un utente parla o scrive un comando, il sistema prima normalizza l'input, convertendo il parlato in testo se necessario, e poi lo passa a un grande modello linguistico che funge da cervello del robot. Questo modello interpreta l'intento del comando, scomponendolo in una sequenza di passaggi logici. Successivamente, consulta i sensori visivi del robot per identificare gli oggetti e gli spazi menzionati nel comando. Se un utente chiede al robot di andare verso una sedia specifica, il sistema utilizza la computer vision per localizzare quella sedia nella stanza, determinare la sua esatta posizione nello spazio tridimensionale e calcolare il percorso che il robot deve seguire per raggiungerla. Infine, il sistema genera un piano e, per sicurezza, spesso chiede la conferma dell'utente prima di eseguire movimenti complessi o a lunga distanza. Tutto questo processo avviene fluidamente, colmando il divario tra il pensiero umano e l'azione della macchina senza la necessità di una traduzione esplicita o di un addestramento specializzato per ogni nuova lingua.

Lo studio ha anche esplorato i limiti di questa tecnologia, rivelando che, sebbene il sistema sia robusto, non è infallibile. Le sfide più significative sono sorte quando il robot doveva identificare oggetti che apparivano molto simili tra loro o quando l'ambiente visivo era ingombrato, rendendo difficile distinguere l'oggetto bersaglio. Inoltre, i compiti che richiedevano la navigazione attraverso sequenze complesse a più fasi erano leggermente più soggetti a errori rispetto ai comandi semplici e diretti, semplicemente perché c'erano più opportunità di commettere un errore nella catena di ragionamento. Tuttavia, anche in questi scenari difficili, le prestazioni del sistema sono rimaste solide, e i ricercatori hanno osservato che gli errori erano spesso legati ai limiti fisici dei sensori del robot o alla complessità dell'ambiente piuttosto che a un fallimento nella comprensione del linguaggio.

Dimostrando che un singolo framework può gestire oltre 140 lingue con alta precisione, questo lavoro suggerisce una nuova strada per l'interazione uomo-robot. Si passa dall'idea che i robot debbano essere istruiti su una lingua specifica per essere utili, verso un modello in cui il robot si adatta alla lingua madre dell'utente. I ricercatori hanno rilasciato i loro dati e il codice al pubblico, invitando altri a costruire su questa base. L'obiettivo ultimo non è solo quello di rendere i robot capaci di parlare molte lingue, ma di creare un futuro in cui la capacità di comandare una macchina sia un diritto universale, accessibile a chiunque, ovunque, nella lingua che meglio conosce. Questo cambiamento promette di democratizzare l'accesso all'automazione, garantendo che i benefici della robotica siano condivisi da tutta l'umanità, e non solo da coloro che parlano le lingue dell'élite digitale.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →