PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model
यह शोध पत्र PGN प्रस्तुत करता है, जो OpenPangu-7B फाउंडेशन मॉडल पर निर्मित एक ऑफलाइन विजन-लैंग्वेज नेविगेशन सिस्टम है, जो विजुअल और लैंग्वेज मोडैलिटीज को संरेखित करने और एक्सपर्ट ट्रेजेक्टरीज के अनुकूल होने के लिए दो-चरणीय प्रशिक्षण रणनीति का उपयोग करता है, जिससे Ascend 910B हार्डवेयर पर मिक्सड-प्रिसिजन कंप्यूटेशन और DeepSpeed का उपयोग करते हुए होल्ड-आउट डेटा पर 62.29% नॉर्मलाइज्ड एक्शन मैच प्राप्त किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसी दुनिया की कल्पना करें जहाँ रोबोट केवल पूर्व-निर्धारित कमांड की कठोर सूचियों का पालन नहीं करते, बल्कि वास्तव में एक मानवीय मित्र की तरह आपको समझ सकते हैं। यह "एम्बोडीड एआई" (embodied AI) का सपना है—एक मशीन को शरीर (या कैमरा और पहिए) देना और एक ऐसा मस्तिष्क देना जो कमरे को देख सके, आपकी आवाज़ सुन सके, और समझ सके कि उसे कैसे घूमना है। बड़ी चुनौती दो बहुत अलग भाषाओं को जोड़ने की है: पिक्सेल और रंगों की दृश्य दुनिया, और वाक्यों और निर्देशों की भाषाई दुनिया। इसे एक कुत्ते को कविता में लिखे गए मानचित्र का उपयोग करके घर में रास्ता खोजना सिखाने जैसा समझें। आपको "रसोई के पास से गुजरें" को भौतिक मोड़ों और कदमों की एक श्रृंखला में अनुवाद करने का एक तरीका चाहिए। यही विजन-लैंग्वेज नेविगेशन (VLN) की मूल पहेली है। यह केवल वस्तुओं को पहचानने के बारे में नहीं है; यह समय के साथ एक कमरे की कहानी को समझने, आपने कहाँ से शुरुआत की थी उसे याद रखने और एक सरल वाक्य के आधार पर यह तय करने के बारे में है कि आगे क्या करना है।
यहाँ PGN आता है, जो यूनिवर्सिटी ऑफ इलेक्ट्रॉनिक साइंस एंड टेक्नोलॉजी ऑफ चाइना के शोधकर्ताओं द्वारा बनाया गया एक नया सिस्टम है, जिसे "ओपनपांगु-7बी" (OpenPangu-7B) नामक एक शक्तिशाली "मस्तिष्क" का उपयोग करके इस पहेली को हल करने के लिए डिज़ाइन किया गया है। आप ओपनपांगु को एक सुपर-स्मार्ट, प्री-ट्रेन्ड लैंग्वेज मॉडल के रूप में देख सकते है जो पहले से ही बोलना और लिखना जानता है, लेकिन वह देखना या चलना नहीं जानता। शोधकर्ताओं का लक्ष्य इस भाषा के दिग्गज को तस्वीरें और निर्देश दिखाकर एक आभासी घर में नेविगेट करना सिखाना था। उन्होंने रोबोट को सीधे गहरे पानी में नहीं फेंका; उन्होंने एक दो-चरणीय प्रशिक्षण शिविर बनाया। पहले, उन्होंने रोबोट को "देखना" सिखाया, इसके लिए उन्होंने इसके भाषा मस्तिष्क को एक 'क्यू-फॉर्मर' (Q-Former) नामक ट्रांसलेटर मॉड्यूल का उपयोग करके एक विशेष कैमरा आँख (विज़न एनकोडर) से जोड़ा। इसने रोबोट को यह समझने में सक्षम बनाया कि फूलदान की तस्वीर "फूलदान" शब्द से संबंधित है।
एक बार जब रोबलेट छवियों और शब्दों के बीच संबंध को समझने लगा, तो दूसरा चरण शुरू हुआ: चलना सीखना। टीम ने सिस्टम को एक "विशेषज्ञ" (एक कंप्यूटर प्रोग्राम जो कभी गलती नहीं करता) द्वारा लिए गए पूर्ण नेविगेशन पथों के हजारों उदाहरण दिए। रोबोट ने कमरे के पांच हालिया स्नैपशॉट्स को देखने, निर्देश पढ़ने और फिर—महत्वपूर्ण रूप से—कार्य करने से पहले सोचने का कौशल सीखा। केवल "बाएं मुड़ें" बोलने के बजाय, मॉडल को पहले थोड़ा तर्कसंगत पाठ (reasoning text) उत्पन्न करने के लिए प्रशिक्षित किया गया था, जैसे कि कोई इंसान कहता है, "ठीक है, मैं अपनी बाईं ओर रसोई देख रहा हूँ, इसलिए मुझे बाईं ओर मुड़ना चाहिए," इससे पहले कि वह कार्य के लिए प्रतिबद्ध हो। उन्होंने इस प्रणाली का परीक्षण 500 छिपे हुए परीक्षण पथों पर किया जहाँ रोबोट को उसके द्वारा देखे गए इतिहास का सही विवरण दिया गया था, और उसे अगला कदम बताने के लिए कहा गया था। परिणाम उत्साहजनक थे: नवीनतम संस्करण (V9) में, रोबोट 62.29% बार विशेषज्ञ के कार्य से मेल खाता था और लगभग हमेशा एक गैर-रिक्त उत्तर देता था (100% समय)। हालाँकि, लेखक बहुत सावधानी से यह नोट करते हैं कि यह एक "टीचर-फोर्स्ड" (teacher-forced) परीक्षण है। यह एक छात्र द्वारा दिए जाने वाले बहुविकल्पीय प्रश्नोत्तरी जैसा है जहाँ शिक्षक हर चरण पर सही उत्तर कुंजी पकड़कर रखता है। रोबोट का वास्तव में इस बात पर परीक्षण नहीं किया गया है कि क्या वह गलती करने पर खुद को सुधार सकता है या क्या वह बिना किसी मदद के वास्तविक, अव्यवस्थित वातावरण में लक्ष्य तक सफलतापूर्वक पहुँच सकता है। हालाँकि सिस्टम यह दर्शाता है कि एक बड़े भाषा मॉडल को नेविगेशन निर्देशों को समझने और विशेषज्ञ कार्यों के साथ तालमेल बिठाने के लिए अनुकूलित किया जा सकता है, शोध पत्र यह निष्कर्ष निकालता है कि यह वास्तविक परीक्षण कि क्या यह रोबोट वास्तव में अपने दम पर घर में नेविगेट कर सकता है, अभी भी भविष्य का काम है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।