← नवीनतम पेपर
🤖 machine learning

Scaling World-Model Reinforcement Learning Through Diffusion Policy Optimization

यह शोध पत्र मॉडल-बेस्ड डिफ्यूजन पॉलिसी ऑप्टिमाइज़ेशन (MBDPO) प्रस्तुत करता है, जो एक ऐसा ढांचा है जो संरचनात्मक मिसअलाइनमेंट को हल करने और स्केलेबल, सुसंगत सुदृढीकरण सीखने (reinforcement learning) को सक्षम करने के लिए खोजे गए प्रक्षेप पथों (trajectories) पर पॉलिसी ऑप्टिमाइज़ेशन को एक डिफ्यूजन प्रक्रिया के रूप में पुनर्गठित करके वर्ल्ड मॉडल्स के भीतर सर्च और पॉलिसी लर्निंग को एकीकृत करता है।

मूल लेखक: Xiaoyuan Cheng, Wenxuan Yuan, Zhancun Mu, Yuanzhao Zhang, Yiming Yang, Hai Wang, Zhuo Sun, Che Liu

प्रकाशित 2026-05-27
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiaoyuan Cheng, Wenxuan Yuan, Zhancun Mu, Yuanzhao Zhang, Yiming Yang, Hai Wang, Zhuo Sun, Che Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को चलना, वीडियो गेम खेलना या वस्तुओं को संभालना सिखा रहे हैं। इसे कुशलतापूर्वक करने के लिए, रोबोट को दुनिया कैसे काम करती है, इसका एक "सपना" या मानसिक सिमुलेशन (mental simulation) चाहिए। AI की दुनिया में, इसे वर्ल्ड मॉडल (World Model) कहा जाता है। यह रोबोट के दिमाग के अंदर एक सिम्युलेटर की तरह है जहाँ वह बिना असली पैर तोड़े या असली कार दुर्घटनाग्रस्त किए लाखों बार अभ्यास कर सकता है।

लंबे समय से, शोधकर्ता इन सिम्युलेटरों को बड़ा और स्मार्ट बनाने की कोशिश कर रहे हैं, इस उम्मीद में कि एक बड़ा दिमाग स्वतः ही एक बेहतर रोबोट बन जाएगा। लेकिन वे एक दीवार से टकरा गए। आपके द्वारा साझा किया गया पेपर, "Scaling World-Model Reinforcement Learning Through Diffusion Policy Optimization" (MBDPO), बताता है कि वह दीवार क्यों मौजूद थी और उन्होंने उसे कैसे तोड़ा।

यहाँ उनकी खोज की कहानी है, जिसे सरल रूप में समझाया गया है।

समस्या: "डे ड्रीमर" (Daydreamer) बनाम "ग्रेडर" (Grader)

कल्पना कीजिए कि एक छात्र शतरंज खेलना सीखने की कोशिश कर रहा है।

  1. डे ड्रीमर (खोज/The Search): यह छात्र अपने दिमाग में एक ग्रैंडमास्टर के खिलाफ खेल खेलने की कल्पना करता है। वे भविष्य को देखने के लिए अलग-अलग चालें आजमाते हैं, यह देखने के लिए कि कौन सी चाल जीत दिलाती है। वर्तमान AI तरीके इसी तरह काम करते हैं: वे भविष्य का सिमुलेशन करके सबसे अच्छी चाल की "खोज" करते हैं।
  2. ग्रेडर (वैल्यू फंक्शन/The Value Function): यह एक शिक्षक है जो पिछले पाठों के आधार पर हर चाल को एक स्कोर देता है। शिक्षक कहता है, "यह चाल अच्छी है क्योंकि यह अतीत में काम आई थी।"

गड़बड़ी (The Glitch): पिछले तरीकों में, "डे ड्रीमर" और "ग्रेडर" तालमेल में नहीं थे।

  • ग्रेडर को एक ऐसे छात्र के डेटा पर प्रशिक्षित किया गया था जिसने अभी-अभी रैंडम अनुमान लगाया था (या बहुत रूढ़िवादी तरीके से खेला था)।
  • डे ड्रीमर एक ग्रैंडमास्टर की तरह खेलने की कोशिश कर रहा था, बड़े जोखिम ले रहा था और अजीब नई चालें आजमा रहा था।

जब डे ड्रीमर ने कोई अजीब नई चाल चली, तो ग्रेडर ने उसे उच्च स्कोर दिया क्योंकि वह कागज़ पर तो अच्छी दिख रही थी, भले ही ग्रेडर ने वास्तव में उसे असल जिंदगी में काम करते हुए कभी नहीं देखा था। डे ड्रीमर अति-आत्मविश्वासी हो गया, उसने गलती की, और पूरा सिस्टम क्रैश हो गया। पेपर इसे "मिसअलाइनमेंट" (misalignment) कहता है। रोबोट एक ऐसे भविष्य का सपना देख रहा था जिसे उसका शिक्षक समझ ही नहीं पा रहा था।

समाधान: MBDPO (डिफ्यूजन फिक्स)

लेखकों, शियाओयुआन चेंग और सहयोगियों ने एक नई विधि पेश की जिसे MBDPO कहा जाता है। उन्होंने केवल सिम्युलेटर को बड़ा नहीं बनाया; उन्होंने यह बदला कि रोबोट हिलना-डुलना कैसे सीखता है।

उन्होंने डिफ्यूजन (Diffusion) की अवधारणा का उपयोग किया, जो वही गणित है जिसका उपयोग यथार्थवादी AI चित्र बनाने के लिए किया जाता है (जैसे एक धुंधले बादल को एक स्पष्ट बिल्ली में बदलना)।

उपमा: मिट्टी के ब्लॉक से एक मूर्ति बनाना
कल्पना कीजिए कि रोबोट की रणनीति एक एकल चाल नहीं, बल्कि चालों का एक पूरा क्रम (जैसे एक डांस रूटीन) है।

  • पुराना तरीका (खोज/Search): आप बोर्ड पर रैंडमली डार्ट्स फेंककर एक आदर्श डांस रूटीन का अनुमान लगाने की कोशिश करते हैं। यदि आप किसी भाग्यशाली स्थान पर हिट करते हैं, तो आप उसे रखते हैं। यदि बोर्ड थोड़ा गलत है, तो आपको एक बुरा रूटीन मिलता है।
  • MBDPO तरीका (डिफ्यूजन/Diffusion): कल्पना कीजिए कि रोबोट की शुरुआत मिट्टी के एक ब्लॉक से होती है जो केवल रैंडम शोर (noise/static) है।
    1. रोबोट के पास एक "वर्ल्ड मॉडल" (एक क्रिस्टल बॉल) है जो किसी भी डांस मूव की कल्पना करने पर उसके भविष्य को देख सकता है।
    2. रोबोट धीरे-धीरे शोर को हटाता है, स्टेप-बाय-स्टेप, मिट्टी को एक मूर्ति में तराशता है।
    3. हर स्टेप पर, वर्ल्ड मॉडल कहता है, "यदि आप अपना हाथ इस तरह हिलाते हैं, तो आपको उच्च स्कोर मिलेगा। यदि आप इसे उस तरह हिलाते हैं, तो आप गिर जाएंगे।"
    4. रोबोट इस फीडबैक का उपयोग मिट्टी को धीरे से "सर्वश्रेष्ठ" डांस रूटीन की ओर धकेलने के लिए करता है।

इस प्रक्रिया को डिफ्यूजन पॉलिसी ऑप्टिमाइज़ेशन (Diffusion Policy Optimization) कहा जाता है। अंदाज़ा लगाने और जांचने के बजाय, रोबोट अपनी रणनीति को "डी-नॉइज़" (denoise) करता है, अराजकता को एक पूर्ण, उच्च-स्कोरिंग योजना में धीरे-धीरे बदलता है।

यह एक बड़ी बात क्यों है

पेपर मुख्य रूप से तीन दावे करता है:

  1. यह "मिसअलाइनमेंट" को ठीक करता है: इस डिफ्यूजन प्रक्रिया का उपयोग करके, रोबोट की "खोज" (भविष्य की कल्पना करना) और उसकी "सीखना" (अपने दिमाग को अपडेट करना) एक ही लूप में होते हैं। रोबमा रोबोट उन चालों के बारे में अति-आत्मविश्वासी नहीं होता जिन्हें उसने वास्तव में सिम्युलेट नहीं किया है। यह ऐसा है जैसे ग्रेडर और डे ड्रीमर अब एक ही व्यक्ति हैं, जो लगातार एक-दूसरे से बात कर रहे हैं।
  2. यह स्केल करता है (Scales Up): आमतौर पर, जब आप एक AI मॉडल को बड़ा बनाते हैं (अधिक "न्यूरॉन्स" जोड़ते हैं), तो यह बेहतर होता है, लेकिन अंततः यह एक पठार (plateau) पर पहुँच जाता है या ऊपर बताए गए त्रुटियों के कारण खराब हो जाता है। MBDPO दिखाता है कि जैसे-जैसे उन्होंने मॉडल को बड़ा किया (1.7 मिलियन पैरामीटर से 340 मिलियन तक), रोबोट लगातार बेहतर होता गया। वह दीवार से नहीं टकराया; वह चढ़ता रहा।
  3. यह हर जगह काम करता है: उन्होंने इसे 121 विभिन्न कार्यों पर परखा, जिसमें रोबोटिक कुत्ते को चलना और दौड़ना सिखाने से लेकर, ब्लॉक स्टैकिंग करने वाले रोबोटिक आर्म, और जटिल वीडियो गेम खेलना शामिल है। लगभग हर मामले में, MBDPO ने पिछले सर्वश्रेष्ठ तरीकों (जैसे TD-MPC2 और DreamerV3) को पछाड़ दिया।

"सीक्रेट सॉस": द एनर्जी एंकर (The Energy Anchor)

MBDPO में एक चतुर ट्रिक है जिसे वे "इम्प्लिसिट एनर्जी फंक्शन" (Implicit Energy Function) कहते हैं।

इसे एक सुरक्षा लीश (safety leash) के रूप में सोचें।

  • रोबोट को नए, जोखिम भरे मूव्स खोजने और आज़माने की अनुमति है (खोज/search)।
  • लेकिन "एनर्जी फंक्शन" एक सुरक्षित, सिद्ध व्यवहार (व्यवहार नीति/behavior policy) से जुड़ी एक लीश की तरह काम करता है।
  • यदि रोबकर अपने ज्ञात सुरक्षित व्यवहार से बहुत दूर जाने की कोशिश करता है, तो लीश उसे वापस खींच लेती है। यह रोबोट को अपने ही सपनों में खो जाने से रोकता है और सुनिश्चित करता है कि वह वास्तविकता से जुड़ा रहे।

परिणाम

  • ऑफलाइन लर्निंग: उन्होंने रोबोट को पिछले वीडियो के विशाल डेटासेट पर प्रशिक्षित किया (जैसे हजारों घंटों के स्पोर्ट्स वीडियो देखना)। रोबोट ने पिछले किसी भी तरीके से बेहतर प्रदर्शन किया, और मॉडल जितना बड़ा हुआ, रोबोट उतना ही बेहतर खेला।
  • ऑनलाइन लर्निंग: जब रोबोट शून्य से शुरू हुआ (कोई पिछला वीडियो नहीं), तो उसने अपने प्रतिस्पर्धियों की तुलना में तेजी से और अधिक स्थिरता के साथ सीखा।
  • दृश्य प्रमाण (Visual Proof): जब शोधकर्ताओं ने रोबोट के "सपनों" (उसकी आंतरिक पथों जो उसने कल्पना की थीं) को देखा, तो उन्होंने पाया कि MBDPO के सपने सुचारू, तार्किक और भौतिक रूप से यथार्थवादी थे। पुराने तरीकों के सपने अस्त-व्यस्त और अराजक थे।

सारांश

पेपर का तर्क है कि वास्तव में स्मार्ट AI रोबोट बनाने के लिए, हमें केवल दिमाग को बड़ा नहीं करना है। हमें यह बदलना होगा कि दिमाग कैसे सोचता है। MBDPO एक डिफ्यूजन प्रोसेस (शोर से मूर्तिकला की तरह) का उपयोग करके "योजना बनाने" (planning) और "सीखने" (learning) के बीच के अंतर को ठीक करता है, जो एक वर्ल्ड मॉडल द्वारा निर्देशित होता है। यह रोबोट को जटिल कौशल पहले से कहीं अधिक तेज़ी से, सुरक्षित रूप से और अधिक प्रभावी ढंग से सीखने की अनुमति देता है, जिससे यह सिद्ध होता है कि यदि गणित सही हो, तो बड़े मॉडल वास्तव में स्मार्ट रोबोट बन सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →