Language-Guided Semantic Navigation with Monocular SLAM and Vision-Language Models
Dit artikel presenteert een lichtgewicht, modulair framework dat monoculaire dense SLAM (MASt3R-SLAM) integreert met vision-language modellen (Gemma 3 en Qwen2.5-VL) om robuuste, open-vocabulary semantische navigatie in binnenomgevingen mogelijk te maken met uitsluitend RGB-input, zonder de noodzaak van dieptesensoren of model-fine-tuning.