← नवीनतम पेपर
🤖 machine learning

JEDI: Joint Embedding Diffusion World Model for Online Model-Based Reinforcement Learning

JEDI पहला ऑनलाइन एंड-टू-एंड लेटेंट डिफ्यूजन वर्ल्ड मॉडल पेश करता है जो पिक्सेल-आधारित और अलग से प्रशिक्षित लेटेंट दृष्टिकोणों दोनों की तुलना में मॉडल-आधारित सुदृढीकरण सीखने (reinforcement learning) में बेहतर दक्षता और प्रतिस्पर्धी प्रदर्शन प्राप्त करने के लिए JEPA-शैली के प्रेडिक्टिव रिप्रेजेंटेशन लर्निंग को डिफ्यूजन उद्देश्यों के साथ एकीकृत करता है।

मूल लेखक: Jing Yu Lim, Rushi Shah, Zarif Ikram, Samson Yu, Haozhe Ma, Tze-Yun Leong, Dianbo Liu

प्रकाशित 2026-05-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jing Yu Lim, Rushi Shah, Zarif Ikram, Samson Yu, Haozhe Ma, Tze-Yun Leong, Dianbo Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को वीडियो गेम खेलना सिखाने की कोशिश कर रहे हैं। इसे कुशलतापूर्वक करने के लिए, रोबोट को एक "वर्ल्ड मॉडल" (world model) की आवश्यकता होगी—गेम कैसे काम करता है इसका एक मानसिक सिमुलेशन, ताकि वह वास्तव में खेलने से पहले अपने दिमाग में अभ्यास कर सके।

लंबे समय तक, इस मानसिक सिमुलेशन को बनाने का सबसे अच्छा तरीका यह था कि रोबोट गेम की स्क्रीन को पिक्सेल-दर-पिक्सेल पुनर्निर्मित (reconstruct) करने की कोशिश करे, जैसे एक चित्रकार किसी फोटो की हुबहू नकल करने की कोशिश करता है। यह सटीक है लेकिन बहुत धीमा है और इसके लिए बहुत अधिक कंप्यूटर मेमोरी की आवश्यकता होती है (जैसे अपने बैकपैक में एक पूरी लाइब्रेरी ले जाने की कोशिश करना)।

हाल ही में, डिफ्यूजन (Diffusion) नामक एक नई तकनीक लोकप्रिय हुई। डिफ्यूजन को एक मूर्तिकार की तरह समझें जो शोर (noise) या स्टैटिक से भरी मिट्टी के एक ब्लॉक से शुरू करता है और एक स्पष्ट मूर्ति प्रकट करने के लिए धीरे-धीरे शोर को तराशता जाता है। यह जटिल दृश्यों को समझने के लिए बहुत अच्छा है, लेकिन इसे पिक्सेल-दर-पिक्सेल करना अभी भी इतना भारी है कि रोबोट इसे रियल-टाइम में नहीं चला सकता।

एक अन्य दृष्टिकोण ने गेम को एक छोटे, अमूर्त "सारांश" (latent space) में कंप्रेस करने की कोशिश की, लेकिन ये सारांश अक्सर अलग से प्रशिक्षित किए जाते थे और वे अपने आप में गेम के नियमों को अच्छी तरह से नहीं सीख पाते थे।

पेश है JEDI (Joint Embedding Diffusion)।

लेखकों ने एक नया तरीका बनाया है जो दोनों दुनियाओं के सर्वश्रेष्ठ गुणों को जोड़ता है। JEDI कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. "मानसिक स्नैपशॉट" बनाम "चित्रकारी"

  • पुराना तरीका (Pixel Diffusion): कल्पना कीजिए कि रोबोट समुद्र को समझने के लिए समुद्र तट की रेत के हर एक कण को याद रखने की कोशिश कर रहा है। यह सटीक है, लेकिन इसमें बहुत समय लगता है और इसकी पूरी दिमागी शक्ति खर्च हो जाती है।
  • JEDI का तरीका: रेत के कणों को याद रखने के बजाय, JEDI रोबोट को समुद्र के सार (लहरें, रंग, गति) का एक मानसिक स्नैपशॉट (mental snapshot) लेना सिखाता है। इसे रेत के व्यक्तिगत कणों की परवाह नहीं है। यह गेम की स्क्रीन को एक छोटे, कुशल "सारांश" में कंप्रेस कर देता है जो केवल जीतने के लिए जरूरी चीजों को पकड़ता है।

2. "अनुमान लगाने वाला खेल" प्रशिक्षण (The "Guessing Game" Training)

रोबोट इन स्नैपशॉट को कैसे सीखता है?

  • पुराना तरीका: रोबोट को अक्सर एक तस्वीर दिखाई जाती थी और उससे उसे बिल्कुल वैसे ही पुनः पेंट (re-paint) करने को कहा जाता था। यदि वह कोई विवरण चूक जाता, तो उसे दंड मिलता। यह एक छात्र की तरह है जिसे कहानी समझने के बजाय उसकी लिखावट पर ग्रेड दिया जा रहा हो।
  • JEDI का तरीका: JEDI एक भविष्यवाणी करने वाले अनुमान के खेल (predictive guessing game) का उपयोग करता है।
    1. रोबोट वर्तमान गेम स्टेट को देखता है।
    2. उससे पूछा जाता है कि अगला "मानसिक स्नैपशॉट" कैसा दिखेगा।
    3. इसे कठिन (और स्मार्ट) बनाने के लिए, कंप्यूटर वास्तविक अगले स्नैपशॉट को लेता है, उसमें कुछ "स्टैटिक शोर" (noise) जोड़ता है (जैसे धुंधला करना), और रोबोट को इसे स्पष्टता तक वापस डी-नॉइज़ (denoise) करने के लिए कहता है।
    4. महत्वपूर्ण रूप से, रोबोट यह खेलते समय सीखता है। उसे पेंट करना सिखाने के लिए किसी अलग शिक्षक की आवश्यकता नहीं है; वह भविष्य की भविष्यवाणी करने की कोशिश करके ही गेम के नियम सीख जाता है।

3. यह एक बड़ी बात क्यों है (परिणाम)

पेपर का दावा है कि JEDI तीन मुख्य कारणों से एक बड़ा अपग्रेड है:

  • यह हल्का है (Leaner): क्योंकि JEDI पूर्ण वीडियो फ्रेम के बजाय छोटे "मानसिक स्नैपशॉट" के साथ काम करता है, यह 43% कम कंप्यूटर मेमोरी का उपयोग करता है। यह किताबों से भरा भारी बैकपैक ले जाने के बजाय एक सिंगल, स्मार्ट नोटबुक ले जाने जैसा है।
  • यह तेज़ है: JEDl पिछले सर्वोत्तम पिक्सेल-आधारित तरीकों की तुलना में 3 गुना तेज़ी से सोच (सैंपल) सकता है और 2.5 गुना तेज़ी से प्रशिक्षण ले सकता है।
  • यह अलग तरह से खेलता है: यह सबसे आश्चर्यजनक हिस्सा है। पेपर में पाया गया कि JEDI केवल तेज़ ही नहीं खेलता; यह अलग तरीके से खेलता है।
    • उन गेम्स पर जो अन्य रोबोट्स के लिए पहले से ही आसान थे, JEDI अच्छा था लेकिन हमेशा सबसे बेहतर नहीं था।
    • हालांकि, सबसे कठिन, अराजक गेम्स (जैसे कई चलते हुए लक्ष्यों वाले शूटर्स) पर, JEDI चमक उठा। ऐसा लगा कि यह अराजकता को बेहतर ढंग से संभालता है क्योंकि इसका "मानसिक स्नैपशॉट" विजुअल शोर से विचलित होने के बजाय रणनीति पर ध्यान केंद्रित करता है।

निष्कर्ष (The Bottom Line)

पेपर का तर्क है कि एक महान रणनीतिकार बनने के लिए आपको एक आदर्श चित्रकार (हर पिक्सेल को पुनर्गठित करना) होने की आवश्यकता नहीं है। शोर-हटाने के खेल (डिफ्यूजन) का उपयोग करके भविष्य के "सार" की भविष्यवाणी करना सिखाकर, आप एक ऐसा सिस्टम प्राप्त करते हैं जो तेज़, चलाने में सस्ता और कठिन, अराजक स्थितियों को संभालने में आश्चर्यजनक रूप से बेहतर है।

लेखक इसे JEDI कहते हैं, और उनका दावा है कि यह पहली बार है जब इस विशिष्ट "भविष्यवाणी करने वाले अनुमान" के तरीके को बिना किसी पूर्व-प्रशिक्षित शिक्षक के, ऑनलाइन गेम खेलने के लिए "शोर-हटाने" (डिफ्यूजन) के साथ सफलतापूर्वक जोड़ा गया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →