Language-Guided Semantic Navigation with Monocular SLAM and Vision-Language Models
本論文は、単眼の密なSLAM(MASt3R-SLAM)を視覚言語モデル(Gemma 3およびQwen2.5-VL)と統合し、深度センサやモデルのファインチューニングを必要とせず、RGB入力のみを用いて屋内環境における堅牢なオープンボキャブラリ・セマンティックナビゲーションを可能にする、軽量でモジュール化されたフレームワークを提案する。