← नवीनतम पेपर
🤖 machine learning

From Raw Data to Reliable Predictions: The Significance of Data Processing in COVID-19 Modelling

यह अध्ययन प्रदर्शित करता है कि दैनिक डेटा रूपांतरण, स्थानीयकृत आउटलियर डिटेक्शन, निरंतरता जांच और पुनरावृत्ति विशेषता चयन (इटरेटिव फीचर सिलेक्शन) वाली एक कस्टम डेटा प्रीप्रोसेसिंग पाइपलाइन, मानक विधियों की तुलना में कोविड-19 मृत्यु दर के लिए मशीन लर्निंग मॉडल की भविष्य कहनेवाला सटीकता को महत्वपूर्ण रूप से बढ़ाती है।

मूल लेखक: Sangita Das, Subhrajyoti Maji

प्रकाशित 2026-02-27✓ Author reviewed
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sangita Das, Subhrajyoti Maji

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप यह भविष्यवाणी करने की कोशिश कर रहे हैं कि महामारी के दौरान कितने लोग बीमार होंगे या उनकी मृत्यु होगी। इसके लिए, आप गणित और कंप्यूटर (मशीन लर्निंग) का उपयोग करके एक "क्रिस्टल बॉल" (भविष्य देखने वाला गोला) बनाते हैं। लेकिन इसमें एक पेंच है: क्रिस्टल बॉल उतनी ही अच्छी होती है जितना कि वह कांच जिससे वह बनी है। यदि कांच गंदा, टूटा हुआ या विकृत है, तो आपकी भविष्यवाणी गलत होगी, चाहे आपका गणित कितना भी स्मार्ट क्यों न हो।

यह शोध पत्र उस कांच को साफ करने के बारे में है। लेखक, संगीता दास और शुभ्राज्योति माजी, तर्क देते हैं कि अधिकांश वैज्ञानिक बहुत अधिक समय शानदार क्रिस्टल बॉल (जटिल मॉडल) बनाने में बिताते हैं और कांच को साफ करने (डेटा तैयार करने) में पर्याप्त समय नहीं देते हैं।

यहाँ वह कहानी है कि कैसे उन्होंने भविष्य की एक स्पष्ट तस्वीर पाने के लिए डेटा को ठीक किया।

1. समस्या: "साप्ताहिक रिपोर्ट" की गड़बड़ी

कल्पना कीजिए कि आप एक धावक की गति को ट्रैक कर रहे हैं। लेकिन हर सेकंड उनकी गति रिकॉर्ड करने के बजाय, आप केवल सप्ताह में एक बार, रविवार को उनकी कुल दूरी लिखते हैं। फिर, आप सोमवार, मंगलवार और बुधवार के लिए उनकी गति का अनुमान लगाने की कोशिश करते हैं।

  • गलती: आप मान सकते हैं कि उन्होंने सोमवार से शनिवार तक शून्य मील दौड़ लगाई और सारा दौड़ना रविवार को किया। यह स्पष्ट रूप से गलत है!
  • वास्तविकता: कोविड-19 डेटा के साथ ठीक यही समस्या थी। अस्पताल अक्सर सप्ताह में केवल एक बार नई मौतों की रिपोर्ट करते थे। डेटा छह दिनों तक "0 मौतें" दिखाता था और सातवें दिन एक बड़ा उछाल आता था।
  • समाधान: लेखकों ने एक "डेली डिस्ट्रीब्यूटर" (दैनिक वितरक) बनाया। डेटा को छह दिनों तक शून्य पर छोड़ने के बजाय, उन्होंने साप्ताहिक कुल संख्या को लिया और उसे सातों दिनों में समान रूप से फैला दिया। इसने नकली उछालों को सुधारा और कंप्यूटर को हर एक दिन में वास्तव में क्या हो रहा था, इसका एक वास्तविक दृश्य दिया।

2. समस्या: "ग्लोबल" बनाम "लोकल" आउटलियर (असामान्य मान)

कल्पना कीजिए कि आप लोगों की भीड़ को देख रहे हैं।

  • मानक दृष्टिकोण (ग्लोबल): आप एक नियम निर्धारित करते हैं: "कोई भी व्यक्ति जो 7 फीट से लंबा है वह एक त्रुटि है।" यदि आप एक 7-फुट-2-इंच का बास्केटबॉल खिलाड़ी देखते हैं, तो आप उसे हटा सकते हैं क्योंकि वह औसत ऊंचाई में फिट नहीं बैठता। लेकिन महामारी में, मामलों में अचानक आया उछाल औसत की तुलना में एक "विशालकाय" जैसा दिख सकता है, लेकिन वह वास्तव में वास्तविक है!
  • अनुकूल दृष्टिकोण (लोकल): लेखकों ने एक "रोलिंग विंडो" (एक आवर्धक लेंस की तरह जो आपके साथ चलता है) का उपयोग किया। उन्होंने केवल उन लोगों को देखा जो तुरंत उनके बगल में थे। यदि कोई अचानक उछाल आया, तो उन्होंने जांचा कि क्या यह पूरे वर्ष की तुलना में अजीब था या पिछले कुछ दिनों के तुरंत बाद के आंकड़ों के मुकाबले अजीब था। इसने उन्हें वास्तविक, महत्वपूर्ण उछालों को बनाए रखने और केवल वास्तविक त्रुटियों को हटाने की अनुमति दी।

3. समस्या: "टूटा हुआ कैलकुलेटर"

कभी-कभी डेटा कॉलम एक-दूसरे का विरोध करते हैं।

  • परिदृश्य: कल्पना कीजिए कि एक कॉलम कहता है कि "कुल टीकाकरण" 100 है, लेकिन "नए टीकाकरण" वाला कॉलम कहता है कि 50 है। यदि आप उन्हें जोड़ते हैं, तो गणित काम नहीं करता।
  • समाधान: लेखकों ने एक "लॉजिक इंजन" बनाया। केवल गायब नंबरों का अनुमान लगाने के बजाय, उन्होंने कॉलमों के बीच के संबंधों का उपयोग किया। यदि वे "कुल" जानते थे, तो उन्होंने कल के कुल में से घटाकर "नए" की गणना की। यदि वे "नए" को जानते थे, तो उन्होंने उसे जोड़कर "कुल" की गणना की। इसने सुनिश्चित किया कि डेटा गणितीय रूप से सटीक और सुसंगत हो, एक सुव्यवस्थित मशीन की तरह।

4. समस्या: बहुत अधिक सामग्रियां

कल्पना कीजिए कि आप एक केक बना रहे हैं। आपके पास 60 सामग्रियां हैं: मैदा, चीनी, अंडे, लेकिन साथ में "जुराबें", "टूथपिक" और "पुराने समाचार पत्र" भी हैं।

  • गलती: सब कुछ कटोरे में डाल देने से बेकर (कंप्यूटर) भ्रमित हो जाता है। इससे समय बर्बाद होता है और केक का स्वाद खराब हो जाता है।
  • समाधान: लेखकों ने एक "स्मार्ट फिल्टर" का उपयोग किया। उन्होंने हर सामग्री का परीक्षण किया कि क्या वह वास्तव में केक को फुलाने में मदद करती है। उन्होंने केवल उन्हीं शीर्ष 5 सामग्रियों को रखा जो सबसे महत्वपूर्ण थीं (जैसे "नए मामले" और "स्ट्रिंगेंसी इंडेक्स") और बाकी को हटा दिया। इसने उनके मॉडल को तेज़ और अधिक सटीक बनाया।

परिणाम: एक शानदार सुधार

यह देखने के लिए कि उनका "क्लीनिंग क्रू" (सफाई दल) काम कर रहा है या नहीं, उन्होंने 10 अलग-अलग कंप्यूटर मॉडल का परीक्षण किया।

  • मानक तरीका (गंदा कांच): सबसे अच्छा मॉडल जो वे प्राप्त कर सके वह एक धुंधली फोटो की तरह था। इसका स्कोर (R²) 0.817 था। यह ठीक था, लेकिन यह बहुत सी बारीकियों को छोड़ देता था।
  • अनुकूल तरीका (साफ कांच): उनके विशेष सफाई चरणों के साथ, उसी प्रकार का मॉडल एक हाई-डेफिनिशन 4K फोटो बन गया। इसने 0.991 का स्कोर प्राप्त किया।

इसका क्या मतलब है?
मानक मॉडल लगभग 20% त्रुटि के साथ अनुमान लगा रहा था। कस्टम मॉडल 1% से भी कम त्रुटि के साथ अनुमान लगा रहा था। यह लगभग पूर्ण था।

मुख्य निष्कर्ष

इस शोध पत्र का मुख्य सबक केवल कोविड-19 के बारे में नहीं है। यह उन सभी के लिए एक सबक है जो भविष्य की भविष्यवाणी करने की कोशिश कर रहे हैं, चाहे वह शेयर बाजार हो, मौसम हो, या खेल के स्कोर।

आपके पास दुनिया का सबसे महंगा, शक्तिशाली कंप्यूटर हो सकता है, लेकिन यदि आप इसे अव्यवस्थित, पक्षपाती या असंगत डेटा खिलाते हैं, तो यह आपको कचरा उत्तर देगा।

समय लेकर:

  1. डेटा को फैलाना (साप्ताहिक रिपोर्टिंग पूर्वाग्रह को ठीक करना),
  2. स्थानीय स्तर पर देखना (वास्तविक उछाल ढूंढना, न कि केवल वैश्विक त्रुटियां),
  3. गणित की जांच करना (सुनिश्चित करना कि कॉलम आपस में सहमत हों), और
  4. सर्वश्रेष्ठ सामग्रियां चुनना (सही फीचर्स का चयन करना),

...आप एक औसत दर्जे के पूर्वानुमान को एक अत्यधिक सटीक पूर्वानुमान में बदल सकते हैं। लेखकों ने सिद्ध किया कि आप डेटा को कैसे तैयार करते हैं, यह उतना ही महत्वपूर्ण है जितना कि वह मॉडल जिसे आप बनाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →