← नवीनतम पेपर
⚛️ high-energy experiments

A simple tool for weighted averaging of inconsistent data sets

यह शोध पत्र विसंगत डेटा सेटों के औसत निकालने के लिए एक सुदृढ़, सर्व-उद्देश्यीय बेयसियन पद्धति का प्रस्ताव और सत्यापन करता है, जो आउटलेर्स (outliers) को बेहतर ढंग से संभालने के लिए इनपुट अनिश्चितताओं को निचली सीमा (lower bounds) के रूप में मानता है, विभिन्न वैज्ञानिक क्षेत्रों में इसकी प्रभावशीलता को प्रदर्शित करता है और एक निःशुल्क उपलब्ध पायथन कार्यान्वयन प्रदान करता है।

मूल लेखक: Martino Trassinelli, Marleen Maxton

प्रकाशित 2026-02-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Martino Trassinelli, Marleen Maxton

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रहस्यमय वस्तु के सटीक वजन का अनुमान लगाने की कोशिश कर रहे हैं। आप अपने दस अलग-अलग दोस्तों से इसका वजन पूछते हैं।

  • दोस्त A एक हाई-टेक डिजिटल स्केल का उपयोग करता है और कहता है: "यह 10.0 किलो है, 0.1 किलो ऊपर या नीचे।"
  • दोस्त B एक बाथरूम स्केल का उपयोग करता है और कहता है: "यह 10.2 किलो है, 0.5 किलो ऊपर या नीचे।"
  • दोस्त C एक बहुत ही सटीक स्केल का उपयोग करता है लेकिन गलती से उससे टकरा जाता है, इसलिए वह कहता है: "यह 15.0 किलो है, 0.1 किलो ऊपर या नीचे।"

समस्या:
यदि आप केवल "मानक" गणित दृष्टिकोण (जो अधिकांश बुनियादी विज्ञान कक्षाओं में सिखाया जाता है) अपनाते हैं, तो आप सटीक स्केल (A और C) पर सबसे अधिक भरोसा करेंगे क्योंकि वे बहुत आश्वस्त होने का दावा करते हैं। आप उनके नंबरों का औसत निकालेंगे। लेकिन क्योंकि दोस्त C का स्केल टकरा गया था (एक आउटलायर/असंगत मान), आपका अंतिम उत्तर पूरी तरह से गलत दिशा में चला जाएगा, भले ही आपने सोचा था कि आप बहुत सटीक हो रहे हैं।

मानक गणित यह मानता है कि यदि कोई दोस्त कहता है कि "मैं पक्का हूँ," तो वे सच बोल रहे हैं। लेकिन वास्तविक दुनिया में, कभी-कभी लोग (या मशीनें) अति-आत्मविश्वासी होते हैं, या उनमें कुछ छिपी हुई त्रुटियां होती हैं जिन्हें उन्होंने ध्यान में नहीं रखा होता है।

इस शोध पत्र में समाधान:
लेखक, एम. ट्रासिनली और एम. मैक्सन, इन नंबरों का औसत निकालने का एक नया, स्मार्ट तरीका प्रस्तावित करते हैं। वे इसे "कंजर्वेटिव" (रूढ़िवादी) या "जेफ्रीज़ वेटेड एवरेज" कहते हैं।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करके यहाँ दिया गया है:

1. "निराशावादी का सुरक्षा जाल" (The Pessimist's Safety Net)

मानक विधि यह मानती है कि अनिश्चितता जो एक दोस्त देता है (जैसे, "±0.1 किलो") वह सटीक सत्य है।
नई विधि कहती है: "मान लेते हैं कि वह संख्या केवल एक न्यूनतम सुरक्षा जाल है।"

यह रिपोर्ट की गई अनिश्चितता को एक निचली सीमा (lower bound) के रूप में मानती है। यह मानती है कि वास्तविक अनिश्चितता इससे कहीं अधिक हो सकती है। यह ऐसा है जैसे कहना, "आप दावा करते हैं कि आपका स्केल 0.1 किलो तक सटीक है, लेकिन मैं शर्त लगाता हूँ कि यदि आपसे टकरा गया या फर्श असमान था, तो वास्तविक त्रुटि 0.5 किलो या यहाँ तक कि 1.0 किलो भी हो सकती है।"

2. "फैट टेल्स" (Fat Tails) (छाते की उपमा)

मानक गणित में, "बेल कर्व" (संभावना का आकार) बहुत पतला होता है। यदि कोई डेटा पॉइंट औसत से बहुत दूर है, तो गणित चिल्ला उठता है, "यह असंभव है! इसे बाहर निकालो!"

नई विधि "फैट टेल्स" (चौड़े पूंछ वाले वितरण) का उपयोग करती है।

  • कल्पना कीजिए कि एक मानक बेल कर्व एक तंग छाता है। यदि बारिश की एक बूंद किनारे से बाहर गिरती है, तो वह कवर नहीं होती।
  • नई विधि एक विशाल, ढीला बीच अंब्रेला (beach umbrella) है। यह बहुत बड़े क्षेत्र को कवर करता है। यदि कोई डेटा पॉइंट दूर है (एक आउटलायर), तो छाता उसे कवर तो करता है, लेकिन घबराता नहीं है। यह कहता है, "ठीक है, यह एक अजीब बूंद है, लेकिन यह संभव है। मैं इसे अपने पूरे औसत को एक तरफ खींचने नहीं दूँगा।"

यह अंतिम औसत को रोबस्ट (मजबूत) बनाता है। यह "अजीब" नंबरों को बस इतना नज़रअंदाज़ करता है कि वे परिणाम को खराब न करें, लेकिन यह उन्हें पूरी तरह से अनदेखा भी नहीं करता।

3. "विशेषज्ञों के समूह" का परीक्षण

लेखकों ने इस नई विधि का परीक्षण तीन वास्तविक दुनिया के परिदृश्यों पर किया:

  • सिमुलेशन (Simulation): उन्होंने "टकराए हुए स्केल" (एक आउटलायर) के साथ नकली डेटा बनाया। पुरानी विधि भ्रमित हो गई और गलत उत्तर दिया। नई विधि ने उस अजीब नंबर को देखा, उसे अनसुना किया और सही उत्तर दिया।
  • गुरुत्वाकर्षण (न्यूटन स्थिरांक): वैज्ञानिक दशकों से गुरुत्वाकर्षण बल को मापने की कोशिश कर रहे हैं, लेकिन अलग-अलग प्रयोगशालाओं के परिणाम अलग-अलग होते हैं। "आधिकारिक" औसत को अक्सर विशेषज्ञों द्वारा मैन्युअल रूप से समायोजित करना पड़ता है ताकि वह समझ में आ सके। नई विधि ने अव्यवस्थित डेटा को स्वचालित रूप से संभाला और एक ऐसा परिणाम दिया जो सबसे विश्वसनीय आधुनिक मूल्यों से मेल खाता है, बिना किसी मानवीय हस्तक्षेप के।
  • पार्टिकल फिजिक्स (प्रोटॉन त्रिज्या): यह भौतिकी का एक प्रसिद्ध रहस्य है। कुछ प्रयोग कहते हैं कि प्रोटॉन छोटा है; अन्य कहते हैं कि यह बड़ा है। डेटा दो अलग-अलग समूहों (बाइमोडल) में विभाजित है।
    • पुरानी विधि इन दो समूहों को एक एकल औसत संख्या में जबरदस्ती मिलाने की कोशिश करती है, जो भ्रामक है।
    • नई विधि ईमानदार है। यह आपको दो उभारों (humps) वाला एक ग्राफ दिखाती है। यह कहती है, "हम आपको केवल एक नंबर नहीं दे सकते। डेटा विभाजित है। यहाँ दो संभावनाएं हैं।" यह सत्य प्रस्तुत करने का बहुत अधिक ईमानदार तरीका है।

4. टूल (उपकरण)

लेखकों ने केवल एक सिद्धांत नहीं लिखा; उन्होंने एक मुफ्त पायथन टूल (एक कंप्यूटर प्रोग्राम) भी बनाया जिसे कोई भी उपयोग कर सकता है। यह कठिन गणित (जिसे हाथ से करना बहुत जटिल है) को स्वचालित रूप से करता है।

निष्कर्ष (The Bottom Line)

डेटा का औसत निकालने का मानक तरीका एक ऐसी कार चलाने जैसा है जिसका स्टीयरिंग व्हील बहुत संवेदनशील है: सड़क का एक छोटा सा झटका भी आपको लेन से बाहर भेज सकता है।

इस शोध पत्र में दी गई विधि एक टैंक चलाने जैसी है। यह थोड़ा भारी है और गणना करने में थोड़ा धीमा है, लेकिन यह बिना रास्ता भटके पत्थरों (आउटलायर्स) और ऊबड़-खाबड़ जमीन (असंगत डेटा) के ऊपर से चल सकता है। यह स्वीकार करता है, "मुझे सब कुछ नहीं पता, इसलिए मैं थोड़ा अधिक सतर्क रहूँगा," और ऐसा करके, यह अक्सर उस "परफेक्ट" गणित की तुलना में अधिक विश्वसनीय उत्तर देता है जिसे हम आमतौर पर उपयोग करते हैं।

संक्षेप में: जब डेटा अस्त-व्यस्त हो और वैज्ञानिक असहमत हों, तो केवल नंबरों का औसत न निकालें। इस "निराशावादी" दृष्टिकोण का उपयोग करें जो यह मानता है कि हर कोई अपनी सोच से थोड़ा अधिक गलत हो सकता है, और इससे आपको एक ऐसा परिणाम मिलेगा जिसे धोखा देना बहुत कठिन होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →