← Ultimi articoli
💻 computer science

AgenticNav: Zero-Shot Vision-and-Language Navigation as a Tool-Calling Harness

AgenticNav introduce un framework di navigazione visione-linguaggio leggero e zero-shot che reimmagina l'interazione tra VLM e ambiente come un'imbracatura di chiamata a strumenti (tool-calling harness), consentendo la selezione diretta delle azioni basata sui pixel, query di profondità su richiesta e recupero selettivo della memoria per raggiungere prestazioni allo stato dell'arte senza predittori di waypoint appresi.

Autori originali: Yijian Li, Changze Li, Hantian Shi, Jiaying Luo, Jiyuan Cai, Ming Yang, Tong Qin

Pubblicato 2026-07-28
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Yijian Li, Changze Li, Hantian Shi, Jiaying Luo, Jiyuan Cai, Ming Yang, Tong Qin

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di insegnare a un robot come orientarsi in una casa nuova di zecca. Gli dai un comando semplice: "Vai in cucina, gira a destra e fermati vicino al divano". Questo è il mondo della Vision-and-Language Navigation (VLN). È un ramo della robotica in cui un agente deve comprendere il linguaggio umano e gli indizi visivi per muoversi attraverso uno spazio 3D che non ha mai visto prima. Per molto tempo, i robot hanno avuto bisogno di essere addestrati su migliaia di case specifiche per imparare a muoversi, il che significava che si sarebbero persi se li avessi portati in un edificio diverso. Ma recentemente, abbiamo sviluppato i "Large Vision-Language Models" (VLM): cervelli artificiali super intelligenti che sono già in grado di comprendere immagini e parole senza dover essere riaddestrati per ogni singola attività. La grande domanda per gli scienziati è: come colleghiamo questo cervello intelligente alle gambe di un robot? Come possiamo lasciare che l'IA decida esattamente dove mettere il piede senza confondersi con la realtà disordinata e continua del mondo reale?

È qui che entra in gioco il documento AgenticNav. Gli autori sostengono che il vecchio modo di collegare l'IA ai robot fosse come dare a un conducente una mappa con solo tre strade pre-disegnate tra cui scegliere. Se la destinazione non si trovava su una di quelle tre strade, il conducente rimaneva bloccato. Il nuovo metodo, AgenticNav, cambia completamente le regole del gioco. Invece di costringere il robot a scegliere da un elenco limitato di movimenti pre-approvati, gli fornisce un set di "strumenti" che può utilizzare ogni volta che ne ha bisogno. Pensa all'IA come a un detective in un gioco di mistero. Invece di costringere il detective a scegliere tra "Vai a sinistra", "Vai a destra" o "Vai dritto", il detective può ora dire: "Ho bisogno di controllare la profondità di quel pixel specifico sulla parete", oppure "Mostrami la mappa di dove sono stato", o ancora "Voglio camminare direttamente verso quella sedia che vedo".

Il documento introduce un sistema chiamato AgenticNav, che funge da "imbracatura" o pannello di controllo per questi cervelli artificiali intelligenti. I ricercatori hanno scoperto che, fornendo all'IA tre strumenti specifici, essa può navigare in ambienti sconosciuti molto meglio di prima, anche senza alcun addestramento supplementare. Il primo strumento è l'Action Tool (Strumento di Azione). Invece di scegliere tra un piccolo elenco di punti suggeriti, l'IA può puntare direttamente a qualsiasi pixel nella visuale della telecamera e dire: "Vai lì". Il sistema esegue poi i calcoli matematici per trasformare quel pixel in un percorso di camminata sicuro. Il secondo strumento è il Depth Tool (Strumento di Profondità). A volte l'IA ha bisogno di sapere esattamente quanto è lontano qualcosa. Invece di mostrare all'IA una mappa di profondità 3D gigante e confusa, questo strumento permette all'IA di chiedere: "Quanto è lontana la parete in questo punto specifico?" e ottenere un numero preciso. Il terzo strumento è il Memory Tool (Strumento di Memoria). Mentre il robot cammina, costruisce una mappa compatta. Se il robot si confonde o ha bisogno di ricordare un cartello che ha visto in precedenza, può chiedere al sistema di "recuperare" quel momento specifico, invece di cercare di ricordare ogni singolo fotogramma dell'intero viaggio, il che sovraccaricherebbe il suo cervello.

Gli autori hanno testato questo sistema in una simulazione al computer chiamata R2R-CE (usando il simulatore Habitat) e anche su un vero robot. La validazione nel mondo reale ha coinvolto 30 episodi specifici che comprendevano scene di laboratorio, ufficio e cortile esterno, mettendo alla prova compiti come la lettura di segnali, la navigazione a lungo raggio e l'arrivo preciso al bersaglio. Hanno scoperto che, utilizzando un potente cervello artificiale (GPT-5.5), il loro nuovo metodo ha raggiunto un tasso di successo del 55% nel raggiungere l'obiettivo, il che rappresenta un salto significativo rispetto al precedente miglior metodo (SmartWay) che raggiungeva solo il 44%. In termini di efficienza (ovvero quanto bene ha bilanciato il successo con un percorso breve), sono passati dal 35,04% al 48,41%. Il documento suggerisce che il collo di bottiglia non è solo quanto sia intelligente il cervello dell'IA, ma quanto bene forniamo ad essa gli strumenti per interagire con il mondo. Lasciando che l'IA scelga i propri obiettivi e chieda informazioni specifiche, essa diventa molto più capace di navigare nel mondo reale, anche in luoghi che non ha mai visitato prima. I ricercatori hanno inoltre osservato che questo approccio funziona bene con diversi tipi di cervelli artificiali, suggerendo che questo stile di "chiamata degli strumenti" (tool-calling) è una via promettente per creare robot che possano davvero comprendere e muoversi nel nostro complesso mondo.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →