← नवीनतम पेपर
🤖 machine learning

EPM-JEPA: Operator-Side Experience Modulation in JEPA-Family World Models

यह शोध पत्र प्रदर्शित करता है कि ऑपरेटर-साइड वेट मॉड्यूलेशन (EPM-JEPA), ऑपरेंड-साइड स्टेट इंजेक्शन (EI-JEPA) की तुलना में वितरण बदलावों (distribution shifts) के अनुकूल होने में JEPA-परिवार के वर्ल्ड मॉडल्स को बेहतर बनाता है, जो यह प्रकट करता है कि प्रदर्शन की प्रक्षेपवक्र (performance trajectories) इक्विलिब्रियम कन्वर्जेंस के बजाय विशिष्ट डायनेमिकल प्रक्रियाओं द्वारा संचालित होती है और एक भौतिकी-आधारित (physics-grounded) उत्तराधिकारी के विकास को प्रेरित करती है।

मूल लेखक: Vedant Pandya

प्रकाशित 2026-06-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Vedant Pandya

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: एक रोबोट को अनुकूलन करना सिखाना

कल्पना कीजिए कि आप एक रोबोट को यह भविष्यवाणी करना सिखा रहे हैं कि एक गेंद कहाँ लुढ़केगी। आप इसे एक ऐसे कमरे में प्रशिक्षित करते हैं जहाँ फर्श सपाट है (कोई गुरुत्वाकर्षण नहीं)। फिर, आप उस रोबोट को एक नए कमरे में ले जाते हैं जहाँ फर्श झुका हुआ है (गुरुत्वाकर्षण अलग है)।

मानक AI मॉडल उन छात्रों की तरह होते हैं जो सपाट कमरे के नियमों को रट लेते हैं। जब वे झुके हुए कमरे में प्रवेश करते हैं, तो वे भ्रमित हो जाते हैं क्योंकि उनका "मस्तिष्क" (आंतरिक गणित) नई वास्तविकता के साथ मेल खाने के लिए बदला नहीं है। वे भविष्यवाणी करना जारी रखते हैं कि गेंद सीधी लुढ़केगी, भले ही वह ढलान पर लुढ़क रही हो।

यह पेपर रोबोट को तुरंत सीखने (learn on the fly) के लिए सिखाने की कोशिश करता है। यह पूछता है: हम रोबोट को उसकी हालिया गलतियों की याददाश्त कैसे दे सकते हैं ताकि वह तुरंत अपने मस्तिष्क को नए झुके हुए कमरे के अनुसार ढाल सके?

परीक्षण की गई दो विधियाँ

शोधकर्ताओं ने रोबोट को यह "याददाश्त" देने के दो अलग-अलग तरीकों की तुलना की:

  1. विधि A: "नोटबुक" दृष्टिकोण (EI-JEPA)

    • उपमा: कल्पना कीजिए कि रोबोट के पास एक नोटबुक है। जब वह कुछ नया देखता है, तो वह नोटबुक में एक नोट लिखता है। जब उसे कोई भविष्यवाणी करने की आवश्यकता होती है, तो वह नोट पढ़ता है और उस जानकारी को अपनी वर्तमान विचार प्रक्रिया में जोड़ देता है।
    • परिणाम: यह अच्छी तरह से काम नहीं किया। रोबोट अतिरिक्त नोट्स से भ्रमित हो गया। यह ऐसा था जैसे कोई आपके कान में संकेत फुसफुसा रहा हो और आप गणित की समस्या हल करने की कोशिश कर रहे हों; इसने रोबोट को धीमा और कम सटीक बना दिया।
  2. विधि B: "मस्तिष्क की रीवायरिंग" दृष्टिकोण (EPM-JEPA)

    • उपमा: केवल एक नोट पढ़ने के बजाय, रोबोट अपनी याददाश्त का उपयोग अपने मस्तिष्क के भीतर के कनेक्शनों को भौतिक रूप से बदलने के लिए करता है। यह एक संगीतकार की तरह है जो, नया संगीत सुनने पर, तुरंत अपने गिटार के तारों का तनाव (tension) बदल देता है ताकि वह नए संगीत के अनुकूल हो सके। रोबोट यह नहीं बदलता कि वह किस बारे में सोचता है, बल्कि यह बदलता है कि वह कैसे गणना करता है।
    • परिणाम: यह बेहतर काम कर गया। रोबोट ने नए झुके हुए कमरे के अनुकूल होने के लिए अपने आंतरिक "गियर्स" को समायोजित किया और बिना किसी नोटबुक वाले रोबोट की तुलना में गेंद के पथ की अधिक सटीक भविष्यवाणी की।

मुख्य खोज: एक "शून्य परिणाम" (Null Result) भी एक जीत है

शोधकर्ताओं ने शुरू करने से पहले एक सख्त शर्त रखी थी। वे देखना चाहते थे कि क्या "रीवायरिंग" विधि "नोटबुक" विधि की तुलना में काफी बेहतर है।

  • शर्त: यदि "रीवायरिंग" विधि प्रदर्शन में 5% से अधिक सुधार करती है, तो वे इसे एक बड़ी जीत मानेंगे।
  • परिणाम: "रीवायरिंग" विधि थोड़ी बेहतर थी, लेकिन अंतर केवल लगभग 4.7% था।
  • निर्णय: तकनीकी रूप से, यह एक "शून्य परिणाम" (Null Result) है (जिसका अर्थ है कि दोनों विधियाँ विजेता घोषित करने के लिए सांख्यिकीय रूप से पर्याप्त भिन्न नहीं थीं)।
  • यह क्यों मायने रखता है: लेखक कहते हैं कि यह वास्तव में एक अच्छा वैज्ञानिक परिणाम है। यह साबित करता है कि केवल याददाश्त जोड़ना ही पर्याप्त नहीं है; आप उस याददाश्त का उपयोग कैसे करते हैं, यह मायने रखता है। "रीवायरिंग" विधि ही एकमात्र ऐसी विधि थी जिसने बिना किसी याददाश्त वाले रोबोट को वास्तव में पीछे छोड़ा।

गुप्त नुस्खा: रोबोट बेहतर क्यों हुआ (और फिर खराब क्यों हुआ)

पेपर का सबसे दिलचस्प हिस्सा केवल यह नहीं है कि रोबोट बेहतर हुआ, बल्कि यह है कि वह कैसे बेहतर हुआ। शोधकर्ताओं ने पाया कि रोबोट का प्रदर्शन एक विशिष्ट, तीन-चरणीय नृत्य का पालन करता था जो एक लहर की तरह दिखता था:

  1. भरने का चरण (बफ़र साइकलिंग - Buffer Cycling): रोबोट यादें एकत्र करना शुरू करता है। जैसे-जैसे इसकी याददाश्त का "बकेट" भरता है और नई यादों के लिए जगह बनाने के लिए पुरानी यादों को बाहर निकालता है, रोबोट एक "स्वीट स्पॉट" पाता है जहाँ वह पूरी तरह से भविष्यवाणी करता है।
  2. ड्रिफ्ट चरण (EMA ड्रिफ्ट - EMA Drift): उस स्वीट स्पॉट के बाद, रोबोट का "लक्ष्य" (वह लक्ष्य जिसे वह प्राप्त करने की कोशिश कर रहा है) धीरे-धीरे दूर खिसकने लगता है। यह ऐसा है जैसे फिनिश लाइन हर सेकंड थोड़ा हिल रही हो। रोबोट पुराने लक्ष्य को पाने की कोशिश करता रहता है, इसलिए इसका प्रदर्शन फिसलने लगता है।
  3. स्थिर होने का चरण (LoRA ट्रांजिएंट - LoRA Transient): भले ही आप रोबोट को नई चीजें सीखने से रोक दें, उसके आंतरिक "गियर्स" को स्थिर होने में थोड़ा समय लगता है। प्रदर्शन में एक छोटा, अपरिहार्य उछाल आता है क्योंकि रोबोट का मस्तिष्क स्थिर होता है।

मुख्य बात: रोबोट का "सर्वश्रेष्ठ प्रदर्शन" पूर्णता की स्थायी स्थिति नहीं थी। यह याददाश्त भरने, लक्ष्य के खिसकने और आंतरिक स्थिरता के बीच के संतुलन के कारण उत्पन्न एक क्षणिक अवस्था थी।

"रस्सी पर संतुलन" (Tightrope) की समस्या

यहाँ एक पेच था। जब रोबोट अपने सर्वश्रेष्ठ प्रदर्शन कर रहा था (गेंद के पथ की सटीक भविष्यवाणी कर रहा था), तो उसकी आंतरिक "विविधता" (diversity) गिर गई।

  • उपमा: कल्पना कीजिए कि एक जैज़ बैंड है। जब वे एक आदर्श सोलो बजा रहे होते हैं, तो वे सभी एक ही सुर में बिल्कुल एक साथ बजने लगते हैं। यह उस एक गाने के लिए सुनने में बहुत अच्छा लगता है, लेकिन यह जोखिम भरा है क्योंकि वे सभी एक ही चीज़ कर रहे हैं।
  • शोधकर्ताओं ने पाया कि सर्वश्रेष्ठ भविष्यवाणी प्राप्त करने के लिए, रोबोट को थोड़ा "कठोर" (कम विविध) होना पड़ा। यदि उन्होंने इसे अधिक विविध होने के लिए मजबूर किया, तो इसकी भविष्यवाणियां खराब हो गईं। यह एक ट्रेड-ऑफ है: पूर्ण भविष्यवाणी बनाम लचीली सोच।

निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि:

  1. मस्तिष्क को बदलना (weights) केवल नोट्स जोड़ने (inputs) से बेहतर है।
  2. "परफेक्ट मोमेंट" अस्थायी है। यह याददाश्त भरने, लक्ष्य के खिसकने और आंतरिक स्थिरता के जटिल नृत्य का परिणाम है।
  3. भविवी कार्य: लेखक एक नया संस्करण (PEM-JEPA) बनाने की योजना बना रहे हैं जो "ड्रिफ्टिंग" लक्ष्य को रोकने के लिए भौतिकी के नियमों का उपयोग करेगा, जिससे रोबोट को उस "परफेक्ट मोमेंट" में लंबे समय तक रहने में मदद मिलेगी बिना फँसे या कठोर हुए।

संक्षेप में: उन्होंने एक ऐसा रोबोट बनाया जो नए गुरुत्वाकर्षण के अनुकूल होने के लिए अपने स्वयं के मस्तिष्क को रीवायर कर सकता है। यह केवल नोटबुक देने की तुलना में बेहतर काम कर गया, लेकिन "परफेक्ट प्रदर्शन" एक क्षणिक क्षण था जो एक जटिल आंतरिक नृत्य के कारण हुआ था, न कि एक स्थायी अवस्था के कारण।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →