Language-Guided Semantic Navigation with Monocular SLAM and Vision-Language Models
Questo articolo presenta un framework leggero e modulare che integra la SLAM densa monoculare (MASt3R-SLAM) con modelli vision-language (Gemma 3 e Qwen2.5-VL) per abilitare una navigazione semantica open-vocabulary robusta in ambienti indoor utilizzando solo input RGB, senza richiedere sensori di profondità o il fine-tuning dei modelli.