← नवीनतम पेपर
🤖 AI

Social-JEPA: Emergent Geometric Isomorphism

यह शोध पत्र प्रदर्शित करता है कि एक ही वातावरण के भिन्न दृष्टिकोणों पर प्रेडिक्टिव लर्निंग ऑब्जेक्टिव्स के साथ प्रशिक्षित स्वतंत्र एजेंट स्वाभाविक रूप से ज्यामितीय रूप से आइसोमोर्फिक (isomorphic) लेटेंट स्पेस विकसित करते हैं, जो पैरामीटर शेयरिंग या समन्वय के बिना ज़ीरो-शॉट ज्ञान हस्तांतरण और कुशल इंटरऑपरेबिलिटी को सक्षम बनाता है।

मूल लेखक: Haoran Zhang, Youjin Wang, Yi Duan, Rong Fu, Dianyu Zhao, Sicheng Fan, Shuaishuai Cao, Wentao Guo, Xiao Zhou

प्रकाशित 2026-03-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haoran Zhang, Youjin Wang, Yi Duan, Rong Fu, Dianyu Zhao, Sicheng Fan, Shuaishuai Cao, Wentao Guo, Xiao Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: दो अजनबी, एक मानचित्र

कल्पना कीजिए कि दो खोजकर्ता, एलिस (Alice) और बॉब (Bob) को एक ही रहस्यमय द्वीप का मानचित्र बनाने के लिए भेजा गया है।

  • एलिस एक पहाड़ पर खड़ी है और नीचे की ओर देख रही है।
  • बॉब एक घने जंगल के बीच में है और ऊपर की ओर देख रहा है।

उन्हें एक-दूसरे से बात करने की अनुमति नहीं है। वे अपनी खोज के दौरान एक-दूसरे के साथ फोटो, अपने नोट्स या अपने मानचित्र साझा नहीं कर सकते। उन्हें द्वीप को पूरी तरह से अपने दम पर सीखना होगा।

आमतौर पर, आप उम्मीद करेंगे कि उनके मानचित्र पूरी तरह से अलग दिखेंगे। एलिस का मानचित्र ऊपर से देखने पर द्वीप को एक सपाट वृत्त के रूप में दिखाएगा; बॉब का मानचित्र पेड़ों की एक लंबी, संकीली पट्टी जैसा दिखेगा।

पेपर की बड़ी खोज: भले ही उन्होंने अलग-अलग प्रशिक्षण लिया हो, लेकिन जब वे समाप्त करते हैं, तो उनके आंतरिक "मानसिक मानचित्र" वास्तव में गणितीय रूप से समान होते हैं, बस एक अलग "भाषा" या समन्वय प्रणाली (coordinate system) में लिखे होते हैं।

यदि आप एलिस के मानचित्र को लें और उस पर एक सरल अनुवाद कुंजी (translation key) लागू करें (एक रैखिक गणितीय सूत्र), तो वह तुरंत बॉब के मानचित्र में बदल जाता है। उन्हें डेटा साझा करने की आवश्यकता नहीं थी; उन्हें बस द्वीप के नियमों पर सहमत होने की आवश्यकता थी।


समस्या: AI में "बेबेल का टॉवर" (Tower of Babel)

आर्टिफिशियल इंटेलिजेंस की दुनिया में, हम अक्सर अलग-अलग रोबोट या AI एजेंटों को दुनिया को समझने के लिए प्रशिक्षित करते हैं।

  • रोबोट A दुनिया को सामने वाले कैमरे के माध्यम से देखता है।
  • रोबोट B दुनिया को पीछे वाले कैमरे के माध्यम से देखता है।

यदि हम उन्हें अलग-अलग प्रशिक्षित करते हैं, तो वे अपने स्वयं के "विश्व मॉडल" (world models) बनाते हैं। आमतौर पर, यदि आप रोबोट A को कुछ सिखाने की कोशिश करते हैं जो रोबोट B जानता है, तो यह एक जर्मन शब्द सिखाने के लिए फ्रांसीसी वक्ता को कोशिश करने जैसा है बिना किसी शब्दकोश के। यह कठिन, महंगा है और इसके लिए भारी मात्रा में कच्चे डेटा को साझा करने की आवश्यकता होती है (जो धीमा है और गोपनीयता का जोखिम है)।

समाधान: सोशल-जेपा (Social-JEPA)

शोधकर्ताओं ने JEPA (Joint Embedding Predictive Architecture) नामक एक विशिष्ट प्रशिक्षण पद्धति का उपयोग किया।

AI से केवल "छवि को पुनर्गठित करने" के लिए कहने के बजाय (जैसे बिल्ली की सटीक फोटो बनाने की कोशिश करना), JEPA AI को भविष्य की भविष्यवाणी करने के लिए कहता है।

  • प्रश्न: "यदि मैं अभी एक कार को बाईं ओर जाते हुए देखता हूँ, तो अगले फ्रेम में वह कैसी दिखेगी?"
  • उत्तर: AI कार के पिक्सेल को नहीं, बल्कि कार की गति के तर्क (logic) को सीखता है।

क्योंकि भौतिकी के नियम (कारों का चलना, वस्तुओं पर प्रकाश कैसे पड़ता है) एलिस और बॉब दोनों के लिए समान हैं, इसलिए उनके मस्तिष्क (AI मॉडल) स्वाभाविक रूप से एक ही अंतर्निहित संरचना पर अभिसरित (converge) होते हैं। वे दोनों दुनिया के "सत्य" को सीखते हैं, भले ही वे इसे अलग-अलग कोणों से देखते हों।

जादू: "अनुवाद कुंजी" (The Translation Key)

यहाँ दिलचस्प हिस्सा है: प्रशिक्षण समाप्त होने के बाद, शोधकर्ताओं ने पाया कि एक सरल रैखिक मानचित्र (मान लीजिए WW) मौजूद है।

WW को एक छोटे, हल्के शब्दकोश या एडेप्टर प्लग के रूप में सोचें।

  • यह बहुत कम जगह लेता है (जैसे एक पोस्टकार्ड)।
  • इसमें द्वीप की कोई फोटो नहीं है।
  • यह बस कहता है: "जब एलिस 'X' देखती है, तो बॉब 'Y' देखता है। जब एलिस 'A' देखती है, तो बॉब 'B' देखता है।"

एक बार जब आपके पास यह छोटा सा शब्दकोश होता है, तो आप तुरंत एक रोबोट से दूसरे रोबोट तक ज्ञान का अनुवाद कर सकते हैं।

यह क्यों मायने रखता है (वास्तविक दुनिया का प्रभाव)

1. शून्य-लागत ज्ञान साझाकरण (Zero-Cost Knowledge Sharing)
कल्पना कीजिए कि आपने एक रोबोट को सामने वाले कैमरे का उपयोग करके "बाधाओं" को पहचानना सिखाया है। अब आप उसी क्षमता को पीछे वाले कैमरे वाले रोबोट को देना चाहते हैं।

  • पुराना तरीका: आपको पीछे वाले रोबोट को शुरू से फिर से प्रशिक्षित करना होगा, या उसे सभी सामने वाले कैमरों की तस्वीरें भेजनी होंगी (भारी डेटा ट्रांसफर)।
  • सोशल-जेपा तरीका: आप बस छोटी सी "अनुवाद कुंजी" (WW) भेज देते हैं। पीछे वाला रोबोट बिना कुछ नया सीखे बाधाओं को तुरंत समझ जाता है। यह किसी को नया भाषा सिखाने के बजाय एक ट्रांसलेटर ऐप देने जैसा है।

2. सुपर-फास्ट ट्रेनिंग
यदि आप एक नया छात्र रोबोट प्रशिक्षित करना चाहते हैं, तो आप एक "शिक्षक" रोबोट का उपयोग कर सकते हैं जो पहले से दुनिया को जानता है। छात्र को शून्य से शुरू करने के बजाय, वह शिक्षक के मस्तिष्क के साथ तालमेल बिठाने के लिए 'अनुवाद कुंजी' का उपयोग करता है।

  • परिणाम: छात्र 3 गुना से 4 गुना तेजी से सीखता है और 70% कम कंप्यूटिंग शक्ति का उपयोग करता है।

3. गोपनीयता और बैंडविड्थ
सेल्फ-ड्राइविंग कारों या ड्रोन की दुनिया में, आप उनके बीच टेराबाइट्स वीडियो डेटा स्ट्रीम नहीं करना चाहते। इस पद्धति के साथ, उन्हें समन्वय करने के लिए केवल एक छोटा गणितीय सूत्र साझा करने की आवश्यकता होती। यह तेज़, निजी और कुशल है।

"सीक्रेट सॉस" (The Secret Sauce)

यह काम क्यों किया?
पेपर का तर्क है कि भविष्य की भविष्यवाणी करने से AI को "शोर" (जैसे आकाश का विशिष्ट रंग या सूरज का कोण) को अनदेखा करने और दुनिया की मूल संरचना (कार का आकार, सड़क, भौतिकी) पर ध्यान केंद्रित करने के लिए मजबूर किया जाता है।

चूंकि मूल संरचना सभी के लिए समान है, इसलिए उनके आंतरिक मानचित्र स्वाभाविक रूप से एक पंक्ति में आ जाते हैं। यह अलग-अलग उपकरणों के साथ घर बनाने वाले दो लोगों जैसा है; यदि वे दोनों एक ही ब्लूप्रिंट का पालन करते हैं, तो कमरे एक ही स्थान पर होंगे, भले ही दीवारें अलग तरह से बनाई गई हों।

सारांश

सोशल-जेपा (Social-JEPA) दिखाता है कि यदि आप AI एजेंटों को स्वतंत्र रूप से भविष्य की भविष्यवाणी करने के लिए प्रशिक्षित करते हैं, तो वे स्वाभाविक रूप से संगत "मस्तिष्क" विकसित करते हैं। उन्हें एक साथ काम करने के लिए आपस में बात करने या डेटा साझा करने की आवश्यकता नहीं है। आपको बस एक छोटी, सस्ती "अनुवाद कुंजी" की आवश्यकता है ताकि वे एक-दूसरे को समझ सकें।

यह अलग-थलग पड़े AI एजेंटों की एक अराजक दुनिया को एक सहकारी समाज में बदल देता है जो तुरंत और कुशलता से ज्ञान साझा कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →