← नवीनतम पेपर
🤖 machine learning

Generalizing Beyond Suboptimality: Offline Reinforcement Learning Learns Effective Scheduling through Random Solutions

यह शोध पत्र CDQAC को प्रस्तुत करता है, जो एक ऑफलाइन सुदृढीकरण शिक्षण (reinforcement learning) एल्गोरिदम है जो स्थिर, उप-इष्टतम (suboptimal) डेटासेट से प्रभावी जॉब शॉप और फ्लेक्सिबल जॉब शॉप शेड्यूलिंग नीतियां सीखता है, और यह प्रदर्शित करता है कि उच्च प्रदर्शन और नमूना दक्षता (sample efficiency) के लिए प्रक्षेपवक्र गुणवत्ता (trajectory quality) की तुलना में व्यापक अवस्था-क्रिया कवरेज (state-action coverage) अधिक महत्वपूर्ण है।

मूल लेखक: Jesse van Remmerden, Zaharah Bukhsh, Yingqian Zhang

प्रकाशित 2026-06-11
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jesse van Remmerden, Zaharah Bukhsh, Yingqian Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ इस शोध पत्र "Generalizing Beyond Suboptimality: Offline Reinforcement Learning Learns Effective Scheduling through Random Solutions" का सरल, रोज़मर्रा की भाषा में अनुवाद दिया गया है।

मुख्य विचार: "बुरे" उदाहरणों से सीखना

कल्पना कीजिए कि आप एक जटिल पहेली सुलझाना सीखना चाहते हैं, जैसे कि एक फैक्ट्री शेड्यूल का विशाल जिग्सॉ पज़ल (Jigsaw Puzzle)। आमतौर पर, इस कौशल को सीखने के लिए, आपको एक मास्टर पज़ल-सुलझाने वाले की आवश्यकता होगी जो आपको दिखा सके कि हर टुकड़े को बिल्कुल सही तरीके से कैसे रखा जाए। आज के अधिकांश AI सिस्टम इसी तरह प्रशिक्षित होते हैं: वे "विशेषज्ञ" (expert) डेटा को देखते हैं या सिम्युलेटर में हजारों बार प्रयास करते हैं जब तक कि वे इसे सही ढंग से न कर लें। इसमें बहुत समय और बहुत अधिक कंप्यूटिंग पावर लगती है।

यह शोध पत्र एक नया AI तरीका पेश करता है जिसे CDQAC कहा जाता है। इसमें एक चौंकाने वाला मोड़ है। CDQAC को विशेषज्ञ की सलाह की आवश्यकता नहीं है। यह प्रभावी ढंग से पहेली को हल करना सीखता है, लेकिन यादृच्छिक रूप से असेंबल किए गए पज़ल्स (randomly assembled puzzles) को देखकर।

जी हाँ, आपने सही पढ़ा। AI उन शेड्यूलों को देखता है जो एक कंप्यूटर प्रोग्राम द्वारा बनाए गए हैं जिसने केवल मशीनों और कामों को रैंडम तरीके से चुना है—ऐसे शेड्यूल जो आमतौर पर बहुत खराब और अक्षम होते हैं। इस "कचरा" डेटा से, AI एक बहुत बेहतर शेड्यूल बनाना सीख जाता है, जो उन विशेषज्ञों से भी बेहतर होता है जिन्होंने मूल डेटा बनाया था।

समस्या: फैक्ट्री शेड्यूलिंग कठिन है

फैक्ट्रियों में, मैनेजरों को जॉब शॉप शेड्यूलिंग प्रॉब्लम (JSP) का सामना करना पड़ता है। कल्पना कीजिए कि आपके पास करने के लिए 10 अलग-अलग काम (jobs) हैं और 5 अलग-अलग मशीनें हैं। प्रत्येक काम के कई चरण होते हैं, और प्रत्येक चरण को एक विशिष्ट क्रम में एक विशिष्ट मशीन पर होना चाहिए। लक्ष्य सब कुछ यथाशीघ्र पूरा करना है (makespan को कम करना)।

  • पुराना तरीका: जटिल गणित या परीक्षण-और-त्रुटि (trial-and-error) सिमुलेशन का उपयोग करना। यह धीमा और महंगा है।
  • AI का तरीका: कंप्यूटर को कदम-दर-कदम निर्णय लेना सिखाना। लेकिन आमतौर पर, इसके लिए AI को सीखने के लिए सिमुलेशन को लाखों बार "खेलना" पड़ता है, जो अक्षम है।

समाधान: CDQAC (Conservative Discrete Quantile Actor-Critic)

लेखकों ने एक AI एजेंट बनाया है जिसका नाम CDQAC है। इसे एक ऐसे स्मार्ट छात्र के रूप में सोचें जो पुराने, बिखरे हुए टेस्ट पेपर्स के पुस्तकालय से पढ़ाई करता है।

  1. द एक्टर (The Actor - निर्णय लेने वाला): यह AI का वह हिस्सा है जो तय करता है कि अगले चरण में किस काम को किस मशीन पर रखना है।
  2. द क्रिटिक (The Critic - निर्णायक/जज): यह डेटासेट में मौजूद रैंडम शेड्यूलों को देखता है और यह समझने की कोशिश करता है: "अगर मैंने इस विशिष्ट कार्य के लिए इस विशिष्ट मशीन को चुना होता, तो वह कितना अच्छा या बुरा होता?"

CDQAC विशेष है क्योंकि यह एक "क्वांटाइल क्रिटिक" (Quantile Critic) का उपयोग करता है। केवल एक निर्णय के औसत स्कोर का अनुमान लगाने के बजाय, यह संभावित परिणामों की रेंज (सीमा) को देखता है। यह एक मौसम पूर्वानुमानकर्ता की तरह है जो केवल यह नहीं कहता कि "तापमान 70 डिग्री होगा," बल्कि कहता है कि "10% संभावना है कि यह 60 है, 80% संभावना है कि यह 70 है, और 10% संभावना है कि यह 80 है।" यह AI को जोखिम और अनिश्चितता को बेहतर ढंग से समझने में मदद करता है।

एक विरोधाभासी खोज: रैंडम डेटा सबसे अच्छा क्यों काम करता है?

अधिकांश AI क्षेत्रों (जैसे रोबोटिक्स या वीडियो गेम) में, रैंडम डेटा बेकार होता है। यदि कोई रोबोट रैंडम तरीके से चलता है, तो वह खाई में गिर जाता है, और AI कुछ भी नहीं सीख पाता। विशेषज्ञ कहते हैं कि आपको अच्छी गुणवत्ता वाले, विशेषज्ञ डेटा की आवश्यकता होती है।

लेकिन यह शोध पत्र फैक्ट्री शेड्यूलिंग के लिए इसके विपरीत सिद्ध करता है।

लेखकों ने पाया कि रैंडम डेटा वास्तव में सबसे अच्छा प्रशिक्षण सामग्री है। यहाँ इसका कारण दिया गया है, एक उदाहरण के माध्यम से:

"पहेली के टुकड़े" वाला उदाहरण:
कल्पना कीजिए कि एक आदर्श शेड्यूल एक पूरी तरह से बनी हुई तस्वीर है।

  • एक्सपर्ट डेटा (जेनेटिक एल्गोरिदम): ये लगभग पूरे हो चुके 100 पज़ल्स को देखने जैसा है। वे सभी बहुत समान हैं। वे आपको पहेली को कैसे पूरा करना है यह दिखाते हैं, लेकिन वे आपको बहुत सारे अलग-अलग तरीकों से शुरुआत करने या बीच के हिस्से बनाने के बारे में नहीं बताते। यदि AI केवल इन्हें देखता है, तो वह एक "लोकल ऑप्टिमम" (स्थानीय शिखर) में फंस जाता है—वह जानता है कि उस विशिष्ट प्रकार की पहेली को कैसे पूरा करना है, लेकिन वह बहुत सीमित है।
  • रैंडम डेटा: यह 1,000 ढेरों को देखने जैसा है जहाँ लोगों ने बस मुट्ठी भर टुकड़े उठाए और उन्हें आपस में मिला दिया। अधिकांश बेमतलब हैं। हालाँकि, क्योंकि ये ढेर इतने विविध हैं, इनमें टुकड़ों के हर संभव संयोजन शामिल हैं।

AI का काम "ट्रैजेक्टरी स्टिचिंग" (Trajectory Stitching - पथ जोड़ना) है। वह रैंडम ढेरों को देखता है और कहता है:

  • "इस रैंडम ढेर में, शुरुआत बहुत खराब थी, लेकिन बीच का हिस्सा ठीक था।"
  • "उस दूसरे रैंडम ढेर में, शुरुआत ठीक थी, और अंत शानदार था।"
  • "मैं ढेर A के 'ठीक शुरुआत' को ढेर B के 'शानदार अंत' के साथ जोड़कर एक बेहतरीन शेड्यूल बना सकता हूँ!"

क्योंकि रैंडम डेटा स्थितियों की सबसे विस्तृत विविधता (State-Action Coverage) प्रदान करता है, इसलिए यह AI को काम करने के लिए सबसे अधिक "पहेली के टुकड़े" देता है। AI फिर विभिन्न रैंडम शेड्यूलों के सबसे अच्छे हिस्सों को चुनकर एक नया, बेहतर शेड्यूल बना सकता है जो मूल डेटा में कभी मौजूद ही नहीं था।

AI की प्रमुख विशेषताएं

इसे सफल बनाने के लिए, CDQAC के पास दो विशेष तकनीकें हैं:

  1. डिलेड पॉलिसी अपडेट्स (Delayed Policy Updates): AI अपनी निर्णय लेने की रणनीति तुरंत नहीं बदलता है। वह तब तक इंतजार करता है जब तक कि उसका "जज" (क्रिटिक) रैंडम डेटा का सटीक मूल्यांकन करने के लिए पर्याप्त समय न ले ले। यह AI को शुरुआती शोर वाले अनुमानों के आधार पर गलत निर्णय लेने से रोकता है।

  2. ड्यूलिंग आर्किटेक्चर (Dueling Architecture): AI अपनी सोच को दो धाराओं में विभाजित करता है:

    • वैल्यू स्ट्रीम (Value Stream): वर्तमान स्थिति कुल मिलाकर कितनी अच्छी है?
    • एडवांटेज स्ट्रीम (Advantage Stream): इस विशिष्ट स्थिति में मशीन A को मशीन B के बजाय चुनना कितना बेहतर है?
      यह AI को विकल्पों के बीच के अंतर पर ध्यान केंद्रित करने में मदद करता है, जो सैकड़ों मशीनों और कामों के बीच निर्णय लेने के लिए महत्वपूर्ण है।

परिणाम

लेखकों ने CDQAC का परीक्षण इनके विरुद्ध किया:

  • ऑनलाइन RL: AI जो सिमुलेशन खेलकर सीखता है (जैसे DANIEL या L2D)।
  • ऑफलाइन RL: अन्य AI जो स्थिर डेटा से सीखते हैं।
  • ह्यूरिस्टिक्स (Heuristics): पारंपरिक नियम-आधारित तरीके।

निष्कर्ष:

  • रैंडम डेटा पर प्रशिक्षित CDQAC ने एक्सपर्ट डेटा पर प्रशिक्षित AI को पछाड़ दिया।
  • CDQAC ने अत्याधुनिक ऑनलाइन AI विधियों को भी पीछे छोड़ दिया, भले ही इसने प्रशिक्षण के दौरान सिम्युलेटर के साथ कभी संपर्क नहीं किया।
  • यह अत्यधिक सैंपल-एफिशिएंट (Sample-efficient) था। समान या बेहतर परिणाम प्राप्त करने के लिए इसे अन्य विधियों की तुलना में केवल 1% से 5% डेटा की आवश्यकता थी।
  • यह बहुत अच्छी तरह से सामान्यीकरण (Generalize) कर सका। इसने छोटे समस्याओं (10 काम, 5 मशीनें) पर सीखा और सफलतापूर्वक बड़ी, अनदेखी समस्याओं (30 या 40 काम) को हल किया।

सारांश

यह शोध पत्र शेड्यूलिंग के लिए AI को प्रशिक्षित करने के तरीके को पूरी तरह बदल देता है। हमें पूर्ण उदाहरणों या महंगे सिमुलेशन की आवश्यकता के बजाय, सस्ते, रैंडम और कम कुशल डेटा का उपयोग किया जा सकता है। एक स्मार्ट एल्गोरिदम (CDQAC) का उपयोग करके, जो कई खराब शेड्यूलों के सबसे अच्छे हिस्सों को जोड़ता है, AI जटिल फैक्ट्री समस्याओं को पहले से कहीं अधिक तेज़ी से और कुशलता से हल करना सीख सकता है। यह साबित करता है कि शेड्यूलिंग में, अनुभव की व्यापकता (Coverage), विशेषज्ञता की गहराई (Quality) से अधिक मूल्यवान है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →