Language-Guided Semantic Navigation with Monocular SLAM and Vision-Language Models
Este artículo presenta un marco ligero y modular que integra SLAM denso monocular (MASt3R-SLAM) con modelos de visión y lenguaje (Gemma 3 y Qwen2.5-VL) para permitir una navegación semántica robusta y de vocabulario abierto en entornos interiores utilizando únicamente entrada RGB, sin requerir sensores de profundidad ni el ajuste fino del modelo.