← नवीनतम पेपर
📊 statistics

Severity estimation in dependent collective risk models

यह शोध पत्र प्रदर्शित करता है कि आश्रित सामूहिक जोखिम परिवेशों (dependent collective risk settings) में एकत्रित दावों (pooled claims) पर सीधे गंभीरता मॉडल (severity models) को फिट करने से आकार-पूर्वाग्रह (size-bias) के कारण असंगत अनुमान प्राप्त होते हैं, और एक सही प्रेक्षित-दावा वितरण (observed-claim distribution) पर आधारित एक सुसंगत संयुक्त संभावना अनुमान प्रक्रिया (composite likelihood estimation procedure) प्रस्तावित करता है, जिसके असमकालिक गुणों (asymptotic properties) को स्थापित करता है और सिमुलेशन के माध्यम से इसके प्रदर्शन को मान्य करता है।

मूल लेखक: Christopher Blier-Wong

प्रकाशित 2026-07-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Christopher Blier-Wong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत बड़ा नींबू पानी का स्टाल चला रहे हैं। हर दिन, आप दो चीजों को ट्रैक करते हैं: आपने कितने कप बेचे (संख्या/count) और प्रत्येक कप में कितनी चीनी है (तीव्रता/severity)। पुराने, सरल तरीके से सोचने में, आप मानते हैं कि ये दोनों चीजें पूरी तरह से असंबंधित हैं। आप सोचते हैं, "ठीक है, आज मैंने 5 कप बेचे, और कल मैंने 100 कप बेचे; उन कपों में चीनी का मिश्रण वही रैंडम मिश्रण है जो मैंने कभी इस्तेमाल किया था।"

लेकिन क्या होगा अगर वे रैंडम नहीं हैं? क्या होगा अगर, जिन दिनों आप बहुत अधिक नींबू पानी बेचते हैं, तो आप गलती से कपों को अतिरिक्त मीठा बना देते हैं? या शायद धीमे दिनों में, आप केवल छोटे, हल्के कप बनाते हैं? यह वास्तविक दुनिया की वह उलझन है जिसे यह पेपर संबोधित करता है: आवृत्ति (frequency) और तीव्रता (severity) अक्सर आपस में जुड़े होते हैं।

महान सैंपलिंग गड़बड़ी (The Great Sampling Mix-Up)

यहाँ वह बड़ी समस्या है जो लेखकों ने पाई: जब आप यह पता लगाने के लिए कि आपका "औसत चीनी स्तर" क्या है, एक साल के दौरान बेचे गए सभी नींबू पानी के कपों को देखते हैं, तो आप वास्तव में एक पक्षपाती नमूना (biased sample) देख रहे होते हैं।

इसे इस तरह सोचें:

  • ग्राहक A 1 कप खरीदता है।
  • ग्राहक B 100 कप खरीदता है।
  • ग्राहक C 0 कप खरीदता है (उसने बस मेनू देखा और चला गया)।

यदि आप औसत चीनी स्तर का पता लगाने के लिए हर ग्राहक के हर एक कप को एक विशाल बाल्टी में डाल देते हैं, तो ग्राहक B उस बाल्टी पर हावी हो जाता है। उन्होंने ग्राहक A की तुलना में 100 गुना अधिक डेटा दिया है। यदि ग्राहक B ने बहुत मीठे कप खरीदे थे, तो आपकी विशाल बाल्टी बहुत अधिक मीठी लगेगी, भले ही वह औसत कप जो आप बेच सकते थे, बहुत कम मीठा रहा हो।

यह पेपर गणितीय रूप से सिद्ध करता है कि यदि आप बस बाल्टी से सभी कप निकालते हैं और अनुमान लगाने की कोशिश करते हैं कि "असली" चीनी का नुस्खा क्या है, तो आप गलत होंगे। आप साइज-बायस्ड (size-biased) मिश्रण को माप रहे हैं (बाल्टी का स्वाद), न कि मार्जिनल (marginal) नुस्खे को (एक यादृच्छिक कप का असली चीनी स्तर)।

क्या पेपर कहता है कि आपको नहीं करना चाहिए

लेखक स्पष्ट रूप से "नाइव" (naive) दृष्टिकोण के प्रति चेतावनी देते हैं। यह तब होता है जब कोई बीमा कंपनी (या नींबू पानी का स्टाल) कहती है, "आइए हम प्राप्त किए गए सभी दावों (claims) को ले लें, इस बात को अनदेखा करें कि उन्हें किसने खरीदा था, और उन पर एक कर्व फिट करें।"

वे दिखाते हैं कि यह तरीका असंगत (inconsistent) है। चाहे आपके पास दस लाख ग्राहक हों या अरबों, यदि आप इस बात को अनदेखा करते हैं कि किसी व्यक्ति के पास कितने दावे हैं और उनके दावे कितने बड़े हैं, तो आपका "असली" तीव्रता का अनुमान हमेशा गलत रहेगा। यह एक शहर के सभी लोगों की औसत ऊंचाई का अनुमान लगाने की कोशिश करने जैसा है, लेकिन केवल उन लोगों को मापकर जो सबसे ऊंची इमारत की ऑब्जर्वेशन डेक पर खड़े हैं। आप एक संख्या प्राप्त करेंगे, लेकिन वह सच नहीं होगा।

नया, स्मार्ट तरीका: कंपोजिट लाइकलीहुड (The Composite Likelihood)

तो, हम बाल्टी को कैसे ठीक करें? लेखकों ने एक नया टूल बनाया जिसे कंपोजिट लाइकलीहुड (Composite Likelihood) कहा जाता है।

पक्षपात को अनदेखा करने के बजाय, वे इसे अपनाते हैं। उन्होंने महसूस किया कि बाल्टी में एक विशिष्ट, अनुमानित पैटर्न है: यह एक "साइज-बायस्ड मिक्सचर" है। यह रैंडम शोर नहीं है; यह एक विशिष्ट गणितीय विरूपण (distortion) है।

उनका नया तरीका दो चतुर चरणों में काम करता है:

  1. ग्राहकों को गिनें: पहले, वे देखते हैं कि कितने लोगों ने नींबू पानी खरीदा (आवृत्ति/frequency)।
  2. बाल्टी का सही ढंग से स्वाद लें: फिर, वे विशाल बाल्टी को देखते हैं, लेकिन वे एक विशेष फॉर्मूले का उपयोग करते हैं जो कहता है, "ठीक है, हम जानते हैं कि ग्राहक B का प्रतिनिधित्व अधिक है। आइए उस पक्षपात को गणितीय रूप से समायोजित करने के लिए इसका उपयोग करें ताकि यह पता चल सके कि असली चीनी का नुस्खा क्या रहा होगा।"

वे इसे "कंपोजिट" विधि कहते हैं क्योंकि यह पूरे असंभव पहेली को एक साथ हल करने के बजाय पहेली के दो अलग-अलग हिस्सों (गिनती और समायोजित बाल्टी का स्वाद) को आपस में जोड़ती है।

वे कितने आश्वस्त हैं?

लेखकों ने केवल यह अनुमान नहीं लगाया कि यह काम करेगा; उन्होंने इसे साबित करने के लिए सिमुलेशन (simulations) चलाए।

  • उन्होंने एक नकली नींबू पानी की दुनिया बनाई जिसमें 1,000,000 ग्राहक थे।
  • उन्होंने "नाइव" तरीके को चीनी के स्तर का अनुमान लगाने के लिए कहा। यह लगभग 25% से भी अधिक गलत था (एक बड़ी त्रुटि!)।
  • फिर उन्होंने अपने नए "कंपोजिट" तरीके का उपयोग किया। इसने असली चीनी के स्तर को लगभग शून्य पूर्वाग्रह (zero bias) के साथ सटीक रूप से पकड़ लिया।

उन्होंने यह भी परीक्षण किया कि उन्हें अपने नंबरों पर कितना विश्वास होना चाहिए। सांख्यिकी (statistics) में, जब आपके पास डेटा के समूह होते हैं (जैसे एक ग्राहक से 100 कप), तो आप हर कप को पूरी तरह से स्वतंत्र तथ्य के रूप में नहीं मान सकते। लेखकों ने दिखाया कि यदि आप उन्हें स्वतंत्र मानते हैं, तो आपको झूठी आत्मविश्वासी (false confidence) मिलती है (आपके एरर बार बहुत छोटे दिखते हैं)। उनकी नई विधि "गोडैम्बे इंफॉर्मेशन" (गणित का एक फैंसी सैंडविच) का उपयोग करती है ताकि यह सुनिश्चित हो सके कि एरर बार पर्याप्त रूप से विस्तृत और ईमानदार हों।

"सरमानोव" सीक्रेट सॉस (The "Sarmanov" Secret Sauce)

इस गणित को वास्तविक दुनिया में काम करने के लिए, उन्होंने सरमानोव कोप्युला (Sarmanov copula) नामक एक विशिष्ट प्रकार के गणितीय मॉडल का उपयोग किया। इसे एक विशेष प्रकार के गोंद के रूप में सोचें जो उन्हें "कपों की संख्या" और "चीनी के स्तर" को एक साथ जोड़ने की अनुमति देता है, जो लचीला है लेकिन फिर भी गणितीय रूप से हल करने योग्य है।

क्योंकि इस गोंद की एक विशेष संरचना है, वे "पक्षपाती बाल्टी" के स्वाद के लिए सटीक फॉर्मूला लिख सके। इसने उन्हें बिना ब्रह्मांड के हर एक सूक्ष्म विवरण को जाने, अपना सुधार उपकरण बनाने की अनुमति दी।

मुख्य निष्कर्ष (The Bottom Line)

यदि आप एक बीमा कंपनी या जोखिम प्रबंधक हैं:

  • सिर्फ अपने सभी दावों को एक साथ न मिलाएं और एक कर्व फिट न करें। आप गलत होंगे।
  • यह समझें कि कई दावों वाले ग्राहक आपके डेटा को प्रभावित कर रहे हैं।
  • इस नए तरीके का उपयोग करें जो इस झुकाव (skew) को ठीक करता है।

यह पेपर दिखाता है कि डेटा कैसे एकत्र किया जाता है (साइज-बायस) इसे समझकर, हम रेसिपी को ठीक कर सकते हैं। यह जादू नहीं है; यह केवल यह समझना है कि बाल्टी का स्वाद रेसिपी जैसा नहीं है, और यह जानना है कि बाल्टी के स्वाद को वापस सच्चाई में कैसे अनुवादित किया जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →