Language-Guided Semantic Navigation with Monocular SLAM and Vision-Language Models
Este artigo apresenta um framework leve e modular que integra o SLAM denso monocular (MASt3R-SLAM) com modelos de visão-linguagem (Gemma 3 e Qwen2.5-VL) para permitir uma navegação semântica de vocabulário aberto robusta em ambientes internos usando apenas entrada RGB, sem exigir sensores de profundidade ou ajuste fino do modelo.