← नवीनतम पेपर
🤖 machine learning

Latent Spherical Flow Policy for Reinforcement Learning with Combinatorial Actions

यह शोध पत्र LSFlow को प्रस्तुत करता है, जो एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो जटिल कॉम्बिनेटोरियल स्थानों में व्यवहार्य क्रियाओं को कुशलतापूर्वक उत्पन्न करने के लिए एक स्टोकेस्टिक लेटेंट स्फेरिकल फ्लो पॉलिसी को एक कॉम्बिनेटोरियल ऑप्टिमाइज़ेशन सॉल्वर के साथ जोड़ता है, और एक स्मूथेड बेलमैन ऑपरेटर के माध्यम से विच्छिन्न वैल्यू लैंडस्केप्स पर विजय प्राप्त करता है।

मूल लेखक: Lingkai Kong, Anagha Satish, Hezi Jiang, Akseli Kangaslahti, Andrew Ma, Wenbo Chen, Mingxiao Song, Lily Xu, Milind Tambe

प्रकाशित 2026-06-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lingkai Kong, Anagha Satish, Hezi Jiang, Akseli Kangaslahti, Andrew Ma, Wenbo Chen, Mingxiao Song, Lily Xu, Milind Tambe

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही जटिल वीडियो गेम खेल रहे हैं जहाँ आपका लक्ष्य जीतने के लिए सबसे अच्छे संभव कदम उठाना है। अधिकांश खेलों में, आप कोई भी चाल चुन सकते हैं (जैसे किसी पात्र को बाएं, दाएं या कूदने के लिए चुनना)। लेकिन इस विशिष्ट प्रकार के खेल में—जिसे कॉम्बिनेटोरियल रीइन्फोर्समेंट लर्निंग (Combinatorial Reinforcement Learning) कहा जाता है—नियम अविश्वसनीय रूप से सख्त हैं।

आप कोई भी चाल नहीं चुन सकते। आपकी चाल एक आदर्श पहेली के टुकड़े की तरह होनी चाहिए जो एक विशाल, बदलते हुए जिग्सॉ पज़ल (jigsaw puzzle) में फिट बैठती हो। उदाहरण के लिए, आपको एक ऐसा डिलीवरी रूट चुनना पड़ सकता है जिसमें बिना नदी पार किए ठीक पाँच विशिष्ट घरों का दौरा किया गया हो, या बीमारी के परीक्षण के लिए लोगों के एक समूह को चुनना पड़ been सकता है जो एक-दूसरे को जानते हों। यदि आप एक भी गलत व्यक्ति चुनते हैं या एक गलत मोड़ लेते हैं, तो वह चाल अवैध (illegal) होगी, और गेम उसे अस्वीकार कर देगा।

समस्या यह है कि वैध चालों की संख्या इतनी विशाल है (जैसे समुद्र तट पर रेत के कणों की संख्या) कि एक कंप्यूटर मस्तिष्क उन सभी को खोजकर सबसे अच्छी चाल खोजने की कोशिश नहीं कर सकता।

पुराने तरीकों के साथ समस्या

पिछले प्रयासों में दो मुख्य खामियां थीं:

  1. "कठोर रोबोट" (Rigid Robot) दृष्टिकोण: उन्होंने कंप्यूटर को एक सख्त, नियत (deterministic) रोबोट सिखाने की कोशिश की। यह हर बार एक ही "सर्वश्रेष्ठ" चाल की गणना करता था। लेकिन यह बुरा है क्योंकि यह कंप्यूटर को नई, रचनात्मक रणनीतियों को खोजने से रोकता है। यह एक ही ढर्रे में फंस जाता है।
  2. "जादुई बॉक्स" (Magic Box) दृष्टिकोण: उन्होंने सीखने की प्रक्रिया के भीतर सीधे एक जटिल गणितीय सॉल्वर (solver) को शामिल करने की कोशिश की। यह काम तो करता था, लेकिन यह इतना धीमा और गणनात्मक रूप से भारी था कि कंप्यूटर सीखने के बजाय गणित करने में अधिक समय बिता देता था।

नया समाधान: LSFLOW

लेखक एक नया तरीका प्रस्तावित करते हैं जिसे LSFLOW कहा जाता है। वे एक चतुर दो-चरणीय तकनीक का उपयोग करते है जो "रचनात्मक सपनों" (creative dreaming) को "नियम-जांच" (rule-checking) से अलग करती है।

इसे एक शेफ (Chef) और एक सख्त खाद्य निरीक्षक (Food Inspector) के रूप में सोचें।

  1. शेफ (द पॉलिसी): शेफ एक रचनात्मक कलाकार है जो एक "सपनों की दुनिया" (एक निरंतर, सुचारू स्थान) में रहता है। शेफ अभी रसोई के सख्त नियमों की चिंता नहीं करता है। इसके बजाय, शेफ बस एक "स्वाद की दिशा" या एक "मूड" चुनता है। पेपर में, इसे लेटेंट स्फेरिकल फ्लो (latent spherical flow) कहा गया है।

    • उपमा: कल्पना कीजिए कि शेफ एक ग्लोब घुमा रहा है। वे किसी विशिष्ट शहर को नहीं चुनते; वे बस अपनी उंगली को एक सामान्य दिशा में रखते हैं (उत्तर, दक्षिण-पूर्व, आदि)। यह दिशा एक "लागत" (cost) या "वरीयता" (preference) का प्रतिनिधित्व करती है। क्योंकि शेफ एक ग्लोब (गोले) पर काम कर रहा है, इसलिए वे किसी भी दिशा में सुचारू रूप से और रचनात्मक रूप से इशारा कर सकते हैं।
  2. खाद्य निरीक्षक (द सॉल्वर): एक बार जब शेफ एक दिशा की ओर इशारा कर देता है, तो वे वह दिशा खाद्य निरीक्षक को सौंप देते हैं। निरीक्षक एक सख्त नियम मानने वाला व्यक्ति है जिसके पास एक विशाल नियम पुस्तिका है। निरीक्षक उस दिशा को देखता है जिसकी ओर शेफ ने इशारा किया था और कहता है, "ठीक है, उस दिशा के आधार पर, यहाँ वह एक आदर्श, कानूनी व्यंजन है जिसे आप बना सकते हैं।"

    • जादू: शेफ को कभी भी नियमों की चिंता करने की आवश्यकता नहीं होती। वे स्वतंत्र रूप से अन्वेषण करते हैं। निरीक्षक यह गारंटी देता है कि अंतिम परिणाम हमेशा वैध होता है।

यह क्यों विशेष है

  • रचनात्मकता और नियमों का मिलन: शेफ बहुत अभिव्यंजक हो सकता है और कई अलग-अलग "मूड" (stochastic policy) आजमा सकता है, जो कंप्यूटर को बेहतर ढंग से अन्वेषण करने और सीखने में मदद करता है। लेकिन क्योंकि निरीक्षक अंतिम चाल की जांच करता है, कंप्यूटर कभी भी अवैध चाल नहीं चलता है।
  • गोले की ट्रिक (The Sphere Trick): लेखकों ने महसूस किया कि शेफ के लिए, यह मायने नहीं रखता कि वे कितनी ज़ोर से इशारा करते हैं, बल्कि यह मायने रखता है कि वे किस दिशा में इशारा करते हैं। इसलिए, उन्होंने शेफ को एक गोले की सतह पर काम करने के लिए मजबूर किया। इससे उनका गणित बहुत सरल और तेज़ हो जाता है।
  • "सुचारू" सीखना (The "Smooth" Learning): एक पेच है। क्योंकि निरीक्षक बहुत सख्त है, यदि शेफ थोड़ा सा भी अलग इशारा करता है, तो निरीक्षक अचानक पूरी तरह से अलग कानूनी व्यंजन पर स्विच कर सकता है। यह सीखने की प्रक्रिया को "उछाल भरा" (jumpy) और अस्थिर बनाता है।
    • समाधान: लेखकों ने एक "स्मूथिंग फ़िल्टर" (एक सॉफ्ट-फोकस लेंस की तरह) का आविष्कार किया। एक सटीक स्थान की ओर इशारा करने के बजाय, वे एक स्थान की ओर इशारा करते हैं और फिर उसे थोड़ा धुंधला (blur) कर देते हैं, पूछते हुए, "अगर मैं इसके पास इशारा करूँ तो आप क्या करेंगे?" यह उछाल को कम करता है, जिससे सीखने की प्रक्रिया स्थिर और तेज़ हो जाती है।

परिणाम

लेखकों ने इस "शेफ और निरीक्षक" टीम का परीक्षण कई कठिन पहेलियों पर किया:

  • डायनेमिक शेड्यूलिंग (Dynamic Scheduling): कार्यों को करने का सबसे अच्छा क्रम तय करना।
  • डायनेमिक रूटिंग (Dynamic Routing): डिलीवरी रूट की योजना बनाना।
  • STI टेस्टिंग (STI Testing): एक वास्तविक दुनिया की सार्वजनिक स्वास्थ्य समस्या जहाँ कंप्यूटर को यह तय करना था कि बीमारियों (जैसे एचआईवी या सिफलिस) के लिए किन लोगों का परीक्षण किया जाए ताकि कम से कम परीक्षणों के साथ सबसे अधिक मामलों को पाया जा सके।

परिणाम:

  • बेहतर स्कोर: नए तरीके ने मौजूदा सर्वोत्तम तरीकों को औसतन 20.6% से पछाड़ दिया। इसने मौजूदा तरीकों की तुलना में बेहतर समाधान तेज़ी से खोजे।
  • तेज़ प्रशिक्षण: यह पिछले सर्वोत्तम तरीके की तुलना में प्रशिक्षित होने में लगभग 3 गुना तेज़ था क्योंकि इसे लर्निंग लूप के भीतर भारी गणित करने की आवश्यकता नहीं थी।
  • वास्तविक दुनिया की सफलता: बीमारी परीक्षण परिदृश्य में, यह संसाधनों (परीक्षणों) के सीमित होने पर भी संक्रमित लोगों को जल्दी खोजने में बहुत बेहतर था।

सारांश

संक्षेप में, LSFLOW कंप्यूटर को जटिल, नियम-बद्ध निर्णय लेने के लिए सिखाने का एक नया तरीका है। यह एक रचनात्मक एआई को एक सुचारू, गणितीय स्थान में विचार "सपनों" की तरह बुनने देता है, और फिर उन विचारों को एक सख्त नियम-जांचकर्ता को सौंप देता है ताकि उन्हें वास्तविक, कानूनी क्रियाओं में बदला जा सके। यह संयोजन एआई को रचनात्मक (नई रणनीतियों का पता लगाने के लिए) और अनुशासित (नियम कभी न तोड़ने के लिए) दोनों होने की अनुमति देता है, जिसके परिणामस्वरूप स्मार्ट और तेज़ निर्णय लेना संभव होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →