AnchorVLN: Geometry-Anchored Vision-Language Grounding Reasoning for Open-Vocabulary Navigation
यह शोध पत्र AnchorVLN को प्रस्तुत करता है, जो एक ओपन-वोकैबुलरी विजन-लैंग्वेज नेविगेशन सिस्टम है जो एक मॉडल कॉन्टेक्स्ट प्रोटोकॉल (MCP) सर्वर का लाभ उठाता है ताकि एक सख्त पृथक्करण लागू किया जा सके जहाँ विजन-लैंग्वेज मॉडल सिमेंटिक रीजनिंग को संभालते हैं जबकि ज्यामितीय उपकरण स्वतंत्र रूप से मेट्रिक मात्राओं को निर्धारित करते हैं, जिससे प्रत्यक्ष समन्वय अनुमान (direct coordinate estimation) की तुलना में अनदेखे वातावरणों में इंस्ट्रक्शन-फॉलोइंग सटीकता और ऑब्जेक्ट लोकलाइजेशन परिशुद्धता में महत्वपूर्ण सुधार होता है।