Language-Guided Semantic Navigation with Monocular SLAM and Vision-Language Models
Cet article présente un cadre léger et modulaire qui intègre le SLAM dense monoculaire (MASt3R-SLAM) à des modèles de vision-langage (Gemma 3 et Qwen2.5-VL) afin de permettre une navigation sémantique robuste et à vocabulaire ouvert dans des environnements intérieurs en utilisant uniquement une entrée RGB, sans nécessiter de capteurs de profondeur ni de réglage fin du modèle.