AnchorVLN: Geometry-Anchored Vision-Language Grounding Reasoning for Open-Vocabulary Navigation
تقدم الورقة البحثية نظام AnchorVLN، وهو نظام ملاحة بصرية-لغوية مفتوح المفردات يستفيد من خادم بروتوكول سياق النموذج (MCP) لفرض فصل صارم حيث تتولى النماذج البصرية-اللغوية التعامل مع الاستدلال الدلالي بينما تحدد الأدوات الهندسية الكميات المترية بشكل مستقل، مما يؤدي إلى تحسين دقة اتباع التعليمات ودقة تحديد مواقع الأشياء في البيئات غير المرئية بشكل كبير مقارنة بالتقدير المباشر للإحداثيات.