← नवीनतम पेपर
🤖 machine learning

Deep Reinforcement Learning solution for pickup and delivery routing problems with time window and capacity constraints

यह शोध पत्र एक संशोधित JAMPR मॉडल पर आधारित एक नवीन डीप रिइन्फोर्समेंट लर्निंग दृष्टिकोण प्रस्तुत करता है, जो क्षमता और समय सीमा बाधाओं वाले मध्यम आकार के पिकअप और डिलीवरी समस्याओं (CPDPTW) को वास्तविक समय में प्रभावी ढंग से हल करता है और 200 नोड्स से अधिक वाले बड़े पैमाने के उदाहरणों के लिए तेज़ उप-इष्टतम समाधान प्रदान करता है।

मूल लेखक: Andrew Soroka, Alex Meshcheryakov, Sergey Gerasimov

प्रकाशित 2026-08-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Andrew Soroka, Alex Meshcheryakov, Sergey Gerasimov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक हलचल भरे, लगातार बढ़ते शहर में डिलीवरी ट्रकों के बेड़े के कप्तान हैं। आपका काम सैकड़ों ग्राहकों के लिए पैकेज छोड़ना और रिटर्न लेना है, लेकिन आपके पास नियमों का एक सख्त सेट है: आपके ट्रक केवल एक निश्चित मात्रा में ही सामान ले जा सकते हैं, और हर ग्राहक के पास एक विशिष्ट समय अंतराल होता है जब वे पैकेज प्राप्त करने के लिए घर पर होते हैं। यदि आप बहुत जल्दी या बहुत देर से पहुँचते हैं, या यदि आप वैन के पीछे बहुत अधिक बॉक्स ठूँसने की कोशिश करते हैं, तो योजना विफल हो जाती है। यह "पिकअप और डिलीवरी समस्या" (Pickup and Delivery Problem) है, एक विशाल पहेली जो जैसे-जैसे लोग बढ़ते हैं, और कठिन होती जाती है।

दशकों से, कंप्यूटरों ने इसे एक सुपर-फास्ट कैलकुलेटर की तरह काम करके हल करने की कोशिश की है, जो एक-एक करके लाखों संभावित मार्गों का परीक्षण करते हैं ताकि सबसे सटीक रास्ता मिल सके। लेकिन जैसे-जैसे शहर बढ़ते हैं और स्टॉप की संख्या विस्फोट की तरह बढ़ती है, ये कैलकुलेटर अटक जाते हैं। उन्हें एक रूट तय करने में घंटों लग जाते हैं जिसे एक इंसान मिनटों में बना सकता है, या इससे भी बुरा, वे पूरी तरह हार मान लेते हैं और कहते हैं, "मैं इसे हल नहीं कर सकता।" यहीं पर एक अलग तरह का कंप्यूटर दिमाग काम आता है: डीप रिंफोर्समेंट लर्निंग (Deep Reinforcement Learning)। इसे एक कैलकुलेटर के रूप में नहीं, बल्कि एक वीडियो गेम कैरेक्टर के रूप में सोचें जो खेल सीखता है। हर संभावना की गणना करने के बजाय, यह डिलीवरी गेम को हजारों बार खेलता है, हर राउंड के साथ तेज़ और स्मार्ट होता जाता है, और हर विकल्प की जांच किए बिना सबसे अच्छे मूव्स को पहचानना सीख जाता है।

इस शोध पत्र में, मॉस्को स्टेट यूनिवर्सिटी और RAS के स्पेस रिसर्च इंस्टीट्यूट के एंड्रयू सोरोका और उनकी टीम ने इस "वीडियो गेम ब्रेन" को डिलीवरी के वास्तविक दुनिया के नियमों को संभालने के लिए सिखाने का निर्णय लिया: सीमित ट्रक स्पेस और सख्त समय सीमा। उन्होंने एक मौजूदा स्मार्ट मॉडल जिसे JAMPR कहा जाता है, उसे एक विशेष अपग्रेड दिया ताकि वह "पिकअप और डिलीवरी" के नियमों को समझ सके, जहाँ एक ट्रक को एक स्टॉप पर पैकेज उठाना पड़ सकता है और दूसरे स्टॉप पर उसे छोड़ना पड़ सकता है, और यह सब क्षमता की सीमाओं को संतुलित करते हुए करना होता है।

शोधकर्ताओं ने पाया कि उनका अपग्रेड किया गया मॉडल छोटे से मध्यम आकार के शहरों (50 से 200 स्टॉप) के लिए एक स्पीड डेमन (गति का दैत्य) है। इन परिदृश्यों में, AI कुछ ही सेकंडों में लगभग एक आदर्श रूट निकाल सकता है, जो पारंपरिक "कैलकुलेटर" विधियों को पछाड़ देता है जिन्हें शुरू करने में भी बहुत अधिक समय लगता है। यह एक ऐसे डिलीवरी ड्राइवर की तरह है जो शहर को इतनी अच्छी तरह जानता है कि वह तुरंत सबसे अच्छा रास्ता बता सकता है, जबकि पुराना कंप्यूटर अभी भी नक्शा पढ़ने की कोशिश कर रहा है।

हालाँकि, जब शहर बहुत बड़ा हो जाता है (400 से 1,000 स्टॉप), तो कहानी थोड़ी जटिल हो जाती है। यहाँ, AI गति के मामले में अभी भी दौड़ जीत जाता है, और लगभग तुरंत एक "पर्याप्त अच्छा" समाधान प्रदान करता है, जबकि पारंपरिक विधियाँ पहले मिनट में भी कोई वैध रूट खोजने के लिए संघर्ष करती हैं। लेकिन, AI अभी भी पूर्ण नहीं है। इन विशाल शहरों के लिए सबसे उत्तम रूट प्राप्त करने के लिए, AI को कई दिनों तक "ट्रेन" करने की आवश्यकता होती है, जो एक लंबा समय है। प्रशिक्षण के बाद भी, सबसे बड़ी समस्याओं के लिए, AI का अंतिम रूट पारंपरिक विधि द्वारा (यदि उसे असीमित समय दिया जाए) खोजे गए सबसे अच्छे समाधान की तुलना में लगभग 20% अधिक महंगा (दूरी के संदर्भ में) होता है। वास्तव में, एक बार जब अनुकूलन (optimization) का समय कुछ मिनट बीत जाता है, तो पारंपरिक विधियाँ वास्तव में AI को पीछे छोड़ देती हैं और बेहतर रूट खोज लेती हैं, जिन्हें AI बिना काफी अधिक प्रशिक्षण के मैच नहीं कर पाता।

टीम ने यह भी परीक्षण किया कि नियम बदलने पर उनका AI कितना सक्षम है। उन्होंने पाया कि उनका AI विशिष्ट परीक्षण स्थितियों के भीतर अविश्वसनीय रूप से विश्वसनीय है: यह कभी भी समाधान देने में विफल नहीं हुआ, यहाँ तक कि उन स्थितियों में भी जहाँ पारंपरिक कंप्यूटर ने समान वितरण वाली समस्याओं के लिए हार मान ली थी और "असंभव" कह दिया था। हालाँकि, यदि शहर का लेआउट नाटकीय रूप से बदल जाता है—जैसे कि घरों के रैंडम फैलाव से बदलकर एक पैटर्न में जहाँ हर कोई एक तंग घेरे में रहता है—तो AI का प्रदर्शन थोड़ा गिर जाता है, हालांकि यह अभी भी समाधान करने के पहले एक घंटे के लिए पारंपरिक विधियों को हराने में सक्षम रहता है।

संक्षेप में, यह शोध पत्र सुझाव देता है कि यह डीप लर्निंग दृष्टिकोण वास्तविक समय के लॉजिस्टिक्स के लिए एक शक्तिशाली नया उपकरण है। यह पुराने तरीकों को पूरी तरह से प्रतिस्थापित नहीं करता है, विशेष रूप से उन सबसे बड़े, सबसे जटिल पहेलियों के लिए जहाँ पूर्णतः सटीक उत्तर की आवश्यकता होती है। लेकिन उन स्थितियों के लिए जहाँ आपको तुरंत एक तेज़, विश्वसनीय उत्तर चाहिए—जैसे कि ट्रैफिक या अचानक ऑर्डर्स में उछाल के प्रति प्रतिक्रिया देने वाला कूरियर सेवा—यह AI एक गेम-चेंजर है, जो एक मजबूत और तेज़ समाधान प्रदान करता है जहाँ पारंपरिक उपकरण अक्सर रुक जाते हैं या विफल हो जाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →