Language-Guided Semantic Navigation with Monocular SLAM and Vision-Language Models
Dieses Paper präsentiert ein leichtgewichtiges, modulares Framework, das monokulares Dense-SLAM (MASt3R-SLAM) mit Vision-Language-Modellen (Gemma 3 und Qwen2.5-VL) integriert, um eine robuste, Open-Vocabulary-semantische Navigation in Innenräumen ausschließlich mittels RGB-Input zu ermöglichen, ohne Tiefesensoren oder Modell-Feintuning zu erfordern.