Robostral Navigate
Robostral Navigate è un modello vision-language da 8B che raggiunge lo stato dell'arte nella navigazione monoculare attraverso diversi embodiment robotici, sfruttando una ricetta di addestramento scalabile con 2,4 milioni di traiettorie simulate, l'efficienza del prefix-caching e la predizione dei waypoint nello spazio immagine per eliminare la necessità di sensori di profondità o mappe pre-costruite.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immagina di insegnare a un robot come essere una guida turistica. Nel mondo della robotica, questo viene chiamato "navigazione incarnata" (embodied navigation): la capacità di una macchina di comprendere un comando vocale come "vai in cucina" e di camminare effettivamente fino a lì senza urtare le pareti. Per molto tempo, le migliori guide turistiche sono state come astronauti di alto livello: avevano bisogno di attrezzature costose e pesanti per svolgere il proprio lavoro. Indossavano speciali occhiali 3D (sensori di profondità), portavano con sé più telecamere come un team di sicurezza o si affidavano a mappe pre-disegnate dell'intero edificio. Sebbene questi robot fossero validi, erano anche costosi, fragili e difficili da adattare a un semplice drone per le consegne o a una piccola ruota da magazzino. La grande domanda che gli scienziati si sono posti è: possiamo costruire un robot che sia altrettanto intelligente ma che utilizzi lo strumento più semplice e comune disponibile? La risposta risiede in una singola telecamera standard — quella che si trova in quasi ogni telefono e robot oggi — e in un cervello abbastanza potente da capire il resto.
Questo articolo presenta Robostral Navigate, un nuovo tipo di cervello robotico progettato per risolvere l'enigma della navigazione utilizzando solo quella singola telecamera standard. Pensatelo come a un robot che non ha bisogno di una mappa 3D o di uno scanner laser; invece, impara a "indicare" il passo successivo di un viaggio semplicemente guardando un'immagine. I ricercatori hanno costruito un modello "visione-linguaggio" da 8 miliardi di parametri (un'IA super intelligente capace di leggere e vedere) e lo hanno istruito a navigare mostrandogli milioni di esempi in una simulazione simile a un videogioco. Invece di calcolare complessi calcoli matematici su quanti metri spostarsi, il modello si limita a indicare dove vuole andare dopo sullo schermo. Se la destinazione è nascosta dietro un angolo, passa a un piano di riserva che consiste nel muoversi in avanti di una certa quantità.
Il team ha scoperto che questo approccio semplice è incredibilmente potente. Addestrando il modello su 2,4 milioni di viaggi simulati attraverso 350.000 scene diverse, hanno creato un sistema che non è solo più economico e facile da costruire, ma anche più intelligente di molti robot dotati di sensori sofisticati. Nei test standard, Robostral Navigate ha raggiunto un tasso di successo del 77,4% nel trovare la propria strada, superando di gran lunga i migliori precedenti robot a telecamera singola e superando persino alcuni robot che utilizzavano sensori di profondità o più telecamere. Il segreto non era solo il puntare; era un nuovo trucco di addestramento che ha reso il processo di apprendimento 22 volte più veloce e una fase di apprendimento per rinforzo che ha insegnato al robot come riprendersi quando si perdeva. Il risultato è un robot che può passare da un carrello con ruote a una macchina che cammina o a un drone volante senza dover essere riistruito, dimostrando che non serve una suite di sensori da un milione di dollari per costruire un vero robot ad uso generale.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.