Reinforcement Learning with Discrete Diffusion Policies for Combinatorial Action Spaces
यह शोध पत्र एक नवीन सुदृढीकरण लर्निंग (reinforcement learning) ढांचे को प्रस्तुत करता है जो जटिल कॉम्बिनेटोरियल एक्शन स्पेस में स्थिर, अत्याधुनिक प्रदर्शन और बेहतर सैंपल दक्षता प्राप्त करने के लिए पॉलिसी मिरर डिसेंट (policy mirror descent) के माध्यम से प्रशिक्षित डिस्क्रीट डिफ्यूजन मॉडल्स का उपयोग करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को ऐसी दुनिया में निर्णय लेना सिखाने की कोशिश कर रहे हैं जहाँ विकल्प बहुत अधिक और भारी हैं। केवल "बाएँ" या "दाएँ" के बीच चुनने के बजाय, रोबोट को 100 अलग-अलग बटनों के एक विशिष्ट संयोजन को चुनना है, या शायद 50 गानों की एक प्लेलिस्ट व्यवस्थित करनी है, या शायद एक ही समय में 11 फुटबॉल खिलाड़ियों के आंदोलनों का समन्वय करना है। शोधकर्ता इसे कॉम्बिनेटोरियल एक्शन स्पेस (combinatorial action space) कहते हैं।
स्टैंडर्ड रीइन्फोर्समेंट लर्निंग (RL) एक ऐसे छात्र की तरह है जो एक बार में एक उत्तर का अनुमान लगाकर सीखने की कोशिश करता है। अरबों संभावित संयोजनों वाली दुनिया में, यह छात्र कभी भी परीक्षण पूरा नहीं कर पाएगा। वह फंस जाएगा, भ्रमित हो जाएगा और अक्षम होगा।
यह पेपर RL-D2 (डिस्क्रीट डिफ्यूजन के साथ रीइन्फोर्समेंट लर्निंग) नामक एक नई विधि पेश करता है। इसे एक संघर्षरत छात्र के बजाय एक मास्टर शेफ (मुख्य रसोइया) के रूप में सोचें जो "डिफ्यूजन" नामक एक विशेष तकनीक का उपयोग करता है।
मुख्य विचार: "डी-ब्लरिंग" शेफ (धुंधलापन दूर करने वाला शेफ)
इस नवाचार को समझने के लिए, आइए देखें कि "डिफ्यूजन" वाला हिस्सा कैसे काम करता है।
- अव्यवस्थित रसोई (समस्या): कल्पना कीजिए कि आपके पास एक आदर्श, स्वादिष्ट भोजन (एक आदर्श निर्णय) है। अब, कल्पना कीजिए कि किसी ने उस पर मुट्ठी भर यादृच्छिक (random) सामग्रियां फेंक दी हैं, जिससे वह व्यंजन धुंधला होकर केवल शोर (noise) का एक ढेर बन गया है।
- शेफ का कौशल (डिफ्यूजन मॉडल): एक डिफ्यूजन मॉडल उस शेफ की तरह है जिसने इस प्रक्रिया को उल्टा करने का अभ्यास किया है। वे यादृच्छिक शोर के ढेर को देख सकते हैं और, चरण-दर-चरण, उस "शोर" को हटाकर नीचे छिपे आदर्श भोजन को प्रकट कर सकते हैं। वे शून्य से भोजन का अनुमान नहीं लगाते; वे अराजकता से शुरू करते हैं और उसे व्यवस्था में परिष्कृत करते हैं।
- ट्विस्ट: आमतौर पर, शेफ (AI मॉडल) एक सीधी रेखा में काम करते हैं: वे एक सामग्री चुनते हैं, फिर अगली, और फिर अगली। इसे "ऑटोरेग्रेसिव" कहा जाता है। लेकिन जटिल स्थितियों में (जैसे फुटबॉल मैच), चीजों का क्रम उतना महत्वपूर्ण नहीं होता जितना कि अंतिम संयोजन। डिफिफ़्यूजन शेफ पूरे बिखरे हुए ढेर को देख सकता है और एक सख्त "पहले यह, फिर वह" नियम का पालन किए बिना एक साथ कई चीजों को ठीक कर सकता है।
गुप्त नुस्खा: "मिरर" (दर्पण) रणनीति
इस पेपर की सबसे बड़ी सफलता केवल इस "डी-ब्लरिंग शेफ" का उपयोग करना नहीं है। यह इस बारे में है कि वे शेफ को यह कैसे सिखाते हैं कि "आदर्श भोजन" कैसा दिखना चाहिए।
आमतौर पर, जब आप एक AI को सिखाते हैं, तो आप कहते हैं, "पिछली बार जो किया था उससे बेहतर करो।" यह अक्सर AI को भ्रमित कर देता है या क्रैश कर देता है क्योंकि यह बहुत तेज़ी से बहुत अधिक बदलने की कोशिश करता है।
लेखक पॉलिसी मिरर डिसेंट (PMD) नामक एक गणितीय ट्रिक का उपयोग करते हैं।
- उपमा: कल्पना कीजिए कि आप कोहरे से ढके पहाड़ के उच्चतम बिंदु को खोजने की कोशिश कर रहे हैं। केवल ऊपर की ओर एक यादृच्छिक कदम उठाने के बजाय, आप एक जादुई दर्पण पकड़ते हैं। यह दर्पण आपको वह आदर्श रास्ता दिखाता है जिसे आपको अपने पास मौजूद मानचित्र के आधार पर लेना चाहिए।
- लक्ष्य: AI का काम पहाड़ का अनुमान लगाना नहीं है। इसका काम केवल दर्पण में दिखने वाले प्रतिबिंब की नकल करना है। यह अपने स्वयं के विकल्पों को बिल्कुल वैसा ही बनाने की कोशिश करता है जैसा कि दर्पण में दिखाए गए "आदर्श" विकल्पों में है।
"सबसे अच्छा रास्ता खोजने" (जो दर्पण करता है) को "चलना सीखने" (जो डिफ्यूजन मॉडल करता है) से अलग करके, प्रशिक्षण अविश्वसनीय रूप से स्थिर और तेज़ हो जाता है।
सीखने के दो तरीके: "एक्सप्लोरर" बनाम "परफेक्शनिस्ट"
पेपर यह परीक्षण करने के लिए दो अलग-अलग तरीकों का उपयोग करता है कि कैसे AI को "दर्पण की छवि" से मेल खाना है, और वे दो अलग-अलग व्यक्तित्व प्रकारों की तरह कार्य करते हैं:
- FKL (तेज़ एक्सप्लोरर): यह संस्करण उस छात्र की तरह है जो सब कुछ आज़माना चाहता है जो आशाजनक दिखता है। यह शुरुआत में बहुत तेज़ी से सीखता है और तब बहुत अच्छा होता है जब आपके पास बहुत अधिक समय या डेटा नहीं होता है। हालाँकि, यदि आप इसे सावधानीपूर्वक ट्यूनिंग के बिना बहुत अधिक धकेलते हैं, तो यह एक ही ढर्रे में फंस सकता है (यह "कोलैप्स" हो जाता है) और नए विचारों की खोज करना बंद कर सकता है।
- RKL (स्थिर परफेक्शनिस्ट): यह संस्करण अधिक सतर्क है। यह एकल सर्वश्रेष्ठ चाल खोजने और उस पर टिके रहने पर ध्यान केंद्रित करता है। यह शुरुआत में थोड़ा धीरे सीखता है, लेकिन यह बहुत स्थिर है और अंततः बहुत कठिन कार्यों पर प्रदर्शन के उच्च शिखर तक पहुँचता है।
उन्होंने इसका परीक्षण कहाँ किया?
शोधकर्ताओं ने केवल सिद्धांत की बात नहीं की; उन्होंने अपने तरीके को तीन बहुत अलग "क्षेत्रों" में परखा:
- DNA सीक्वेंसिंग (जीव विज्ञान प्रयोगशाला): उन्होंने DNA अनुक्रम (sequences) उत्पन्न करने का प्रयास किया जो कोशिकाओं को एक विशिष्ट प्रोटीन का अधिक उत्पादन करने के लिए प्रेरित करें। उनके तरीके ने पिछले तरीकों की तुलना में बेहतर अनुक्रम तेजी से बनाए, जो अनिवार्य रूप से बेहतर जीव विज्ञान को "डिजाइन" कर रहा था।
- वीडियो गेम (आर्केड): उन्होंने क्लासिक एटारी गेम्स (जैसे ब्रेकआउट और स्पेस इन्वेडर्स) खेले लेकिन एक ट्विस्ट के साथ: एक बटन दबाने के बजाय, AI को एक साथ 4 या 8 चालों की योजना बनानी थी। स्टैंडर्ड तरीके लंबे अनुक्रमों के मामले में विफल हो गए, लेकिन उनके "डी-ब्लरिंग शेफ" ने जटिलता को आसानी से संभाल लिया, जिससे उन्होंने शीर्ष-स्तरीय AI खिलाड़ियों को भी पछाड़ दिया।
- फुटबॉल (टीम स्पोर्ट्स): उन्होंने गूगल रिसर्च फुटबॉल का एक खेल खेला। यहाँ, AI को एक साथ 11 खिलाड़ियों को नियंत्रित करना था। "मिरर" रणनीति ने टीम को पूरी तरह से समन्वय करने में मदद की, जिससे उन्होंने अन्य शीर्ष AI टीमों की तुलना में अधिक गेम जीते, विशेष रूप से सबसे कठिन परिदृश्यों में।
निचोड़
यह पेपर एक प्रमुख समस्या का समाधान करता है: आप एक AI को जटिल, बहु-भाग वाले निर्णय लेने के लिए कैसे सिखा सकते हैं बिना उसे अभिभूत (overwhelmed) हुए?
उन्होंने इसे किया:
- एक डिफ्यूजन मॉडल (एक "डी-ब्लरिंग" शेफ) का उपयोग करके जो एक कठोर क्रम में बंधे बिना जटिल, बहु-भाग संयोजनों को संभाल सकता है।
- एक मिरर रणनीति (पॉलिसी मिरर डिसेंट) का उपयोग करके जो AI को अंधे होकर अनुमान लगाने के बजाय, कॉपी करने के लिए एक स्थिर, आदर्श लक्ष्य प्रदान करती है।
परिणामस्वरूप, एक ऐसा AI मिलता है जो तेजी से सीखता है, विकल्पों की विशाल संख्या को बेहतर ढंग से संभालता है, और जीव विज्ञान से लेकर वीडियो गेम तक सब कुछ में शीर्ष स्तर पर प्रदर्शन करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।