← नवीनतम पेपर
📊 statistics

End-to-end probabilistic hierarchical forecasting of large hierarchies via probabilistic top-down

यह शोध पत्र e2eTD को प्रस्तुत करता है, जो बड़े पदानुक्रमित (hierarchical) समय श्रृंखलाओं के सुसंगत संभाव्य पूर्वानुमान उत्पन्न करने के लिए एक तेज़ और स्केलेबल विधि है, जो सीधे समुच्चय श्रृंखलाओं (aggregate series) के एक छोटे उपसमुच्चय की भविष्यवाणी करती है और एक नवीन संभाव्य टॉप-डाउन सैंपलिंग एल्गोरिदम के माध्यम से उन्हें निचले स्तर तक प्रसारित करती है, जिससे न्यूनतम कम्प्यूटेशनल लागत के साथ प्रमुख रिटेल डेटासेट्स पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Lorenzo Zambon, Dario Azzimonti, Giorgio Corani

प्रकाशित 2026-06-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lorenzo Zambon, Dario Azzimonti, Giorgio Corani

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल ग्रोसरी स्टोर चेन के मैनेजर हैं। आपको हर एक स्टोर के लिए, हर एक दिन, दूध, ब्रेड और अनाज का कितना ऑर्डर देना है, यह जानने की जरूरत है।

यह संख्याओं का एक दुस्वप्न (nightmare) है। आपके पास सैकड़ों स्टोर्स में हजारों उत्पाद (SKUs) हैं। यदि आप हर एक स्टोर के लिए हर एक आइटम की बिक्री का अनुमान लगाने की कोशिश करते हैं, तो डेटा बहुत अव्यवस्थित हो जाता है। कुछ दिनों में एक विशिष्ट आइटम की 100 यूनिट बिकती है; अन्य दिनों में, इसकी बिक्री शून्य होती है। यह एक तूफान में पानी की हर एक बूंद के सटीक पथ को ट्रैक करने जैसा है। यह बहुत शोर भरा है, बहुत "अंतरालीय" (intermittent) है, और इसे सही करना बहुत कठिन है।

हालाँकि, यदि आप बड़े चित्र को देखते हैं—जैसे पूरे देश में कुल दूध की बिक्री—तो वह संख्या अधिक सुचारू (smooth) और भविष्यवाणी करने में आसान होती है। यह अंतरिक्ष से तूफान को देखने जैसा है; आप पैटर्न देख सकते हैं भले ही आप हर एक बूंद को ट्रैक न कर सकें।

समस्या: "विरोधाधीनों मानचित्रों" का द्वंद्व (The "Conflicting Maps" Dilemma)
रिटेलर्स आमतौर पर इसे दो तरीकों से हल करने की कोशिश करते हैं, लेकिन दोनों में खामियां हैं:

  1. "बॉटम-अप" (नीचे से ऊपर) दृष्टिकोण: पहले हर एक आइटम की भविष्यवाणी करें, फिर उन्हें जोड़ दें। यह धीमा, महंगा है, और क्योंकि व्यक्तिगत आइटम इतने अव्यवस्थित होते हैं, अंतिम कुल योग अक्सर गलत होता है।
  2. "टॉप-डाउन" (ऊपर से नीचे) दृष्टिकोण: पहले बड़ी कुल संख्या की भविष्यवाणी करें, फिर अनुमान लगाएं कि इसे कैसे विभाजित किया जाए। यह तेज़ है, लेकिन "विभाजन" अक्सर कठोर, पुराने नियमों के साथ किया जाता है जो अनिश्चितता को ध्यान में नहीं रखते हैं।

परिणामस्वरूप? आपके पास एक ऐसी योजना होती है जहाँ देश के लिए कुल संख्या "10 लाख यूनिट" कहती है, लेकिन आपके सभी स्टोर प्लान का योग "9,00,000 यूनिट" कहता है। यह एक सुसंगतता समस्या (coherence problem) है। यह एक ऐसे मानचित्र की तरह है जहाँ न्यूयॉर्क से बोस्टन की दूरी 200 मील है, लेकिन न्यूयॉर्क से फिलाडेल्फिया और फिर फिलाडेल्फिया से बोस्टन की दूरी 300 मील है। आप एक टूटे हुए मानचित्र के साथ अच्छे व्यावसायिक निर्णय नहीं ले सकते।

समाधान: e2eTD (एक "स्मार्ट मिडिल-मैन")
यह पेपर एक नई विधि पेश करता है जिसे e2eTD कहा जाता है। इसे एक स्मार्ट, संभाव्य (probabilistic) मध्यस्थ के रूप में सोचें जो बड़े और सुचारू चित्र और छोटे, अव्यवस्थित विवरणों के बीच के अंतर को पाटता है।

यह इस प्रकार काम करता है, चरण-दर-चरण:

  1. "आसान" लक्ष्यों को चुनें: अव्यवस्थित व्यक्तिगत वस्तुओं (नीचे के स्तर) की भविष्यवाणी करने के बजाय, e2eTD केवल "सुचारू" मध्य परतों के एक बहुत छोटे, प्रबंधनीय हिस्से (डेटा का लगभग 0.3%) की भविष्यवाणी करता है। यह एक मौसम विज्ञानी की तरह है जो केवल सामान्य तूफान के क्षेत्र की भविष्यवाणी करता है, न कि हर एक बूंद की।
  2. एक "ग्रुप प्लान" बनाएं: यह इन सुचारू परतों के लिए एक संभाव्य पूर्वानुमान (probabilistic forecast) बनाता है। इसका मतलब यह नहीं है कि यह सिर्फ यह कहेगा कि "हम 1,000 यूनिट बेचेंगे"; बल्कि यह कहता है कि "हमें 90% यकीन है कि हम 900 और 1,100 यूनिट के बीच बेचेंगे।"
  3. "स्मार्ट स्प्लिट" (संभाव्य टॉप-डाउन): यही इस पेपर का मुख्य आकर्षण (secret sauce) है। आमतौर पर, जब आप एक बड़ी संख्या को छोटी संख्याओं में विभाजित करते हैं, तो आप एक निश्चित अनुपात का उपयोग करते हैं (जैसे, "स्टोर A को हमेशा 10% मिलता है")। e2eTD अधिक स्मार्ट है। यह इतिहास को देखता है और कहता है, "जब कुल 1,000 था, तो स्टोर A को आमतौर पर 9% से 11% के बीच मिला, और स्टोर B को बाकी मिला, और वे एक साथ चलते हैं।"
    • यह एक गणितीय उपकरण का उपयोग करता है जिसे कूपोला (Copula) कहा जाता है (इसे एक "गोंद" के रूप में सोचें जो स्टोरों के बीच के संबंधों को जोड़े रखता है) ताकि हजारों संभावित परिदृश्यों का अनुकरण (simulate) किया जा सके।
    • यह बड़े पूर्वानुमान को छोटे टुकड़ों में बेतरतीब ढंग से विभाजित करता है, लेकिन यह स्टोरों के बीच के ऐतिहासिक "नृत्य" का सम्मान करता है। यदि स्टोर A तब उछलता है जब स्टोर B गिरता है, तो सिमुलेशन को यह पता होता है।
  4. "चेक" (पुनर्मिलन/Reconciliation): अंत में, यह छोटे टुकड़ों को वापस जोड़ता है। क्योंकि इसने एक सुसंगत बड़ी संख्या से शुरुआत की थी और सावधानीपूर्वक विभाजन किया था, छोटे टुकड़े अपने आप बड़ी संख्या के बराबर हो जाते हैं। कोई संघर्ष नहीं। कोई टूटा हुआ मानचित्र नहीं।

यह एक बड़ी बात क्यों है?

  • गति: पेपर का दावा है कि यह विधि अविश्वसनीय रूप से तेज़ है। एक मानक लैपटॉप पर, यह लगभग 20 मिनट में 3,00,000 टाइम सीरीज़ (जैसे कि फैवोरिटा डेटासेट) वाले डेटासेट को प्रोसेस कर सकता है। अन्य विधियाँ जो जटिल न्यूरल नेटवर्क के साथ ऐसा करने की कोशिश करती हैं, उन्हें सुपरकंप्यूटर या घंटों की आवश्यकता हो सकती है।
  • सटीकता: वास्तविक दुनिया के डेटा (M5 और Favorita डेटासेट) के विरुद्ध परीक्षण करने पर, e2eTD ने लगभग हर अन्य विधि को पछाड़ दिया। यदि इस विधि को प्रसिद्ध M5 फोरकास्टिंग प्रतियोगिता में शामिल किया गया होता, तो यह 892 टीमों में से 11वें स्थान पर आती।
  • जोखिम प्रबंधन: क्योंकि यह "संभाव्य" पूर्वानुमान (संभावनाओं की सीमाएं) उत्पन्न करता है, रिटेलर्स अधिक सुरक्षित निर्णय ले सकते हैं। वे कह सकते हैं, "हमें 95% सबसे खराब स्थिति को कवर करने के लिए पर्याप्त स्टॉक की आवश्यकता है," बजाय इसके कि वे केवल औसत का अनुमान लगाएं।

संक्षेप में
e2eTD बड़े रिटेल चेन के लिए मांग की भविष्यवाणी करने का एक तेज़ और कुशल तरीका है। यह हर एक वस्तु की भविष्यवाणी करने की अव्यवस्था से बचता है और पहले सुचारू, अनुमानित कुल योगों पर ध्यान केंद्रित करता है। फिर, यह एक चतुर, इतिहास-आधारित "विभाजन" एल्गोरिदम का उपयोग करके उन कुल योगों को व्यक्तिगत वस्तुओं तक वितरित करता है, जिससे यह सुनिश्चित होता है कि छोटे नंबर हमेशा बड़ी संख्या के साथ पूरी तरह मेल खाते हैं। यह पहले एक आदर्श नींव बिछाने और फिर सावधानी से ईंटें रखने जैसा है, बजाय इसके कि आप यह अनुमान लगाने की कोशिश करें कि हर एक ईंट कहाँ जाएगी और फिर उम्मीद करें कि छत फिट बैठेगी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →