MapFormer: Self-Supervised Learning of Cognitive Maps with Input-Dependent Positional Embeddings
यह शोध पत्र MapFormer प्रस्तुत करता है, जो एक नवीन ट्रांसफार्मर-आधारित आर्किटेक्चर है जो अनसुपरवाइज्ड कॉग्निटिव मैप्स सीखने के लिए ली-एल्जेब्रा जनरेटर्स से प्राप्त इनपुट-डिपेंडेंट पोजीशनल एम्बेडिंग्स का उपयोग करता है, जिससे मौजूदा एआई मॉडलों की तुलना में विविध कॉग्निटिव कार्यों में बेहतर आउट-ऑफ-डिस्ट्रीब्यूशन जनरलाइजेशन और स्केलेबिलिटी प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक नए शहर में घूम रहे हैं। आप हर उस इमारत को याद नहीं करते जो आप देखते हैं; इसके बजाय, आप एक मानसिक मानचित्र (mental map) बनाते हैं। आप समझते हैं कि "बाएँ मुड़ना" हमेशा आपको सड़क के सापेक्ष आपकी स्थिति बदल देता है, चाहे आप पेरिस में हों या टोक्यो में। यह क्षमता कि आप कहाँ हैं (संरचना) और आप क्या देख रहे हैं (सामग्री) को अलग कर सकें, जिसे वैज्ञानिक "कॉग्निटिव मैप" (cognitive map) कहते हैं।
वर्तमान AI सिस्टम, जैसे कि बड़े भाषा मॉडल (large language models) जिनसे आप चैट कर सकते हैं, पैटर्न याद करने में अविश्वसनीय रूप से अच्छे हैं। हालाँकि, वे अक्सर "भंगुर" (brittle) होते हैं। यदि आप उनसे उस समस्या को थोड़ा अलग तरीके से हल करने के लिए कहते हैं जिस पर उन्हें प्रशिक्षित किया गया था, तो वे अक्सर विफल हो जाते हैं। वे किसी स्थिति के अंतर्निहित नियमों को समझने के बजाय सतही समानताओं के आधार पर अनुमान लगाने पर निर्भर रहते हैं।
यह शोध पत्र एक नए प्रकार के AI आर्किटेक्चर को पेश करता है जिसे MapFormers कहा जाता है। MapFormers को ऐसे सोचें जैसे कि यह AI को एक "मानसिक GPS" दे रहा है जो केवल दृश्यों को याद करने के बजाय सड़क के नियमों को सीखता है।
मुख्य विचार: "क्या" से "कहाँ" को अलग करना
लेखकों का तर्क है कि वास्तव में स्मार्ट होने के लिए, एक AI को दो चीजों को सुलझाना आवश्यक है:
- सामग्री (Content): वे विशिष्ट चीजें जो वह देखता है (जैसे, एक लाल सेब, एक नीली कार)।
- संरचना (Structure): चीजें कैसे चलती हैं या कैसे संबंधित होती हैं, इसके नियम (जैसे, "दाएँ जाना" हमेशा आपको एक कदम दाईं ओर खिसका देता है)।
मानक AI मॉडल इन दोनों को मिला देते हैं। MapFormers को इन्हें अलग रखने के लिए डिज़ाइन किया गया है। वे इसे Lie groups (चिकनी रोटेशन और मूवमेंट का वर्णन करने का एक शानदार तरीका) से जुड़े एक गणितीय तरीके का उपयोग करके करते हैं। नियमों को हार्ड-कोड करने के बजाय, AI इनपुट के आधार पर "मूवमेंट मैट्रिसेस" (movement matrices) उत्पन्न करना सीखता है।
MapFormers के दो प्रकार
शोध पत्र इस प्रणाली के दो संस्करण प्रस्तुत करता है, जिनकी तुलना लेखक मानव स्मृति के प्रकारों से करते हैं:
- MapEM (एपिसोडिक मेमोरी): यह एक डायरी की तरह है। यह "मैं कहाँ हूँ" और "मैंने क्या देखा" की एक अलग, समर्पित सूची रखता है। यह पिछले विशिष्ट घटनाओं को याद करने में बहुत अच्छा है (जैसे, पिछले मंगलवार को आपने नाश्ते में क्या खाया था), लेकिन इसे प्रोसेस करने में थोड़ा धीमा है।
- MapEM (वर्किंग मेमोरी): यह आपके मस्तिष्क के सक्रिय 'स्क्रैचपैड' की तरह है। यह "कहाँ" और "क्या" को चलते समय एक साथ मिला देता है। यह तेज़ और अधिक कुशल है, जैसा कि RoPE (एक लोकप्रिय वर्तमान AI तकनीक) के काम करने का तरीका है, लेकिन एक महत्वपूर्ण अपग्रेड के साथ: यह वास्तव में एक मानचित्र के चारों ओर गतिशील रूप से घूमना सीख सकता है।
उन्होंने कैसे सीखा (प्रशिक्षण मैदान)
इन मॉडलों को सिद्ध करने के लिए, शोधकर्ताओं ने उन्हें तीन विशिष्ट "वीडियो गेम" शैली की चुनौतियों पर परखा जहाँ नियम छिपे हुए थे:
- "शोर को अनदेखा करें" गेम: AI को वस्तुओं की एक सूची की नकल करनी थी, लेकिन बीच के खाली स्थानों को अनदेखा करना था। मानक AI खाली स्थानों से भ्रमित हो जाता है; MapFormers ने शोर को "गेट" (ब्लॉक आउट) करना और केवल कॉपी करने वाली वस्तुओं पर ध्यान केंद्रित करना सीख लिया।
- "आंखों पर पट्टी बांधकर नेविगेटर" गेम: AI को "मूव" (चलना) और "सी" (देखना) कमांड का एक क्रम दिया गया था, लेकिन उसे यह नहीं बताया गया था कि कौन सा क्या है। उसे यह समझना था कि "ऊपर" आपको ऊपर ले जाता है और "पेड़ देखें" बस आपका दृश्य अपडेट करता है। एक बार जब उसने मानचित्र सीख लिया, तो वह सटीक भविष्यवाणी कर सकता था कि यदि वह उस स्थान पर वापस लौटता है जहाँ वह पहले जा चुका था, तो उसे क्या दिखाई देगा, भले ही अनुक्रम (sequence) बहुत लंबा क्यों न हो।
- "नेस्टेड ब्रैकेट" गेम: यह गहन तर्क (जैसे,
((()))) को संभालने की क्षमता का परीक्षण करता है। मानक AI संघर्ष करता है कि कितने खुले ब्रैकेट बंद होने का इंतज़ार कर रहे हैं जब अनुक्रम लंबा हो जाता है। MapFormers ने एक ब्रैकेट खोलने को "आगे बढ़ने" के रूप में और एक ब्रैकेट बंद करने को "पीछे हटने" के रूप में माना, जिससे वे स्टैक (stack) को पूरी तरह से ट्रैक कर सके।
परिणाम: यह क्यों मायने रखता है
शोध पत्र का दावा है कि MapFormers ने लगभग पूर्ण सामान्यीकरण (near-perfect generalization) प्राप्त किया।
- "OOD" टेस्ट: AI की शब्दावली में, "आउट-ऑफ-डिस्ट्रीब्यूशन" (OOD) का अर्थ है उन परिदृश्यों पर परीक्षण करना जिन्हें मॉडल ने पहले कभी नहीं देखा है। जहाँ मानक मॉडल तब बुरी तरह विफल हो गए जब अनुक्रम लंबे हो गए या वातावरण बदल गया, वहीं MapFormers सफल रहे। उन्होंने केवल याद नहीं किया; उन्होंने समस्या की ज्यामिति (geometry) को समझा।
- वास्तविक दुनिया का परीक्षण: शोधकर्ताओं ने वास्तविक इंटरनेट टेक्स्ट (OpenWebText) के एक हिस्से पर भी इसे आज़माया। हालांकि तर्क वाले खेलों की तुलना में सुधार छोटा था, फिर भी MapFormers ने मानक मॉडलों की तुलना में थोड़ा बेहतर प्रदर्शन किया, जो यह सुझाव देता है कि ये सिद्धांत वास्तविक दुनिया के भाषा कार्यों तक भी विस्तार कर सकते हैं।
"सीक्रेट सॉस": गणित एक दिशा-सूचक के रूप में
शोध पत्र बताता है कि MapFormers एक विशिष्ट गणितीय दृष्टिकोण का उपयोग करते हैं जहाँ क्रियाओं (जैसे, "दाएं चलें") को रोटेशन (घूर्णन) के रूप में माना जाता है।
- कल्पना कीजिए कि आप एक डायल घुमा रहे हैं। यदि आप इसे 90 डिग्री घुमाते हैं, और फिर एक और 90 डिग्री, तो आप 180 पर पहुँच जाते हैं।
- MapFormers सीखते हैं कि "दाएं" एक विशिष्ट रोटेशन है और "बाएं" विपरीत रोटेशन है।
- क्योंकि वे इस गणितीय ढांचे का उपयोग करते हैं, वे एक लंबी यात्रा (path integration) के परिणाम की गणना केवल कोणों को जोड़कर कर सकते हैं, न कि प्रत्येक कदम के लिए जटिल, धीमी गणना करके। यह उन्हें समानांतर (parallel) रूप से जानकारी संसाधित करने की अनुमति देता है (बहुत तेज़), जबकि वे अनुक्रम को भी समझते हैं।
सारांश
संक्षेप में, यह शोध पत्र प्रस्तावित करता है कि AI को अधिक मजबूत और अनुकूलन योग्य बनाने के लिए, हमें इसे केवल एक विशाल पैटर्न-मैचिंग मशीन के रूप में नहीं, बल्कि एक कॉग्निटिव मैप देने के रूप में देखना चाहिए। AI को गति के नियमों को उसके द्वारा देखी जाने वाली चीजों से अलग करना सिखाकर, MapFormers उन अनदेखी स्थितियों में भी लचीलेपन के साथ नेविगेट कर सकते हैं जिनकी वर्तमान AI प्रणालियों में कमी है। वे केवल अनुमान नहीं लगाते; वे मानचित्र को समझते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।