← नवीनतम पेपर
📊 statistics

Discovery and inference beyond linearity for epidemiological data by integrating Bayesian regression, tree ensembles and Shapley values

यह शोध पत्र RuleSHAP प्रस्तुत करता है, जो एक नवीन ढांचा है जो महामारी विज्ञान संबंधी डेटा में गैररेखीय और अंतःक्रिया प्रभावों के लिए सांख्यिकीय रूप से वैध अनुमान और अनिश्चितता परिमाणीकरण सक्षम करने हेतु बेयसियन स्पार्स रिग्रेशन, ट्री-आधारित नियम निर्माण और शापली मानों को एकीकृत करता है।

मूल लेखक: Giorgio Spadaccini, Marjolein Fokkema, Mark A. van de Wiel

प्रकाशित 2026-06-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Giorgio Spadaccini, Marjolein Fokkema, Mark A. van de Wiel

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो इस रहस्य को सुलझाने की कोशिश कर रहे हैं कि क्या चीज़ लोगों के दिल को स्वस्थ या अस्वस्थ बनाती है। आपके पास सुरागों (डेटा) का एक बहुत बड़ा ढेर है, जैसे कि लोगों की उम्र, वजन, आहार और पृष्ठभूमि।

लंबे समय तक, जासूसों ने एक बहुत ही सरल उपकरण का उपयोग किया: एक सीधी पटरी (straight ruler)। यह उपकरण यह मानता है कि यदि आप थोड़ा और सुराग जोड़ते हैं (जैसे कि थोड़ा और उम्र बढ़ना), तो परिणाम एक निश्चित, अनुमानित मात्रा में बदल जाता है। इसका उपयोग करना आसान है, लेकिन वास्तविक जीवन शायद ही कभी एक सीधी रेखा होता है। कभी-कभी, उम्र बढ़ना तभी मायने रखता है जब आप एक निश्चित वजन के भी हों। कभी-कभी, एक सुराग का प्रभाव पूरी तरह से इस पर निर्भर करता है कि आप कौन हैं।

यहीं पर मशीन लर्निंग (ML) आती है। यह एक सुपर-स्मार्ट, आकार बदलने वाले जासूस की तरह है जो उन अजीब, घुमावदार और जटिल पैटर्न को खोज सकता है जिन्हें सीधी पटरी मिस कर देती है। लेकिन समस्या यह है: हालांकि यह सुपर-स्मार्ट जासूस पैटर्न खोजने में बहुत अच्छा है, लेकिन यह बताने में बहुत खराब है कि वह अपने बारे में कितना आश्वस्त है। यह आपको एक उत्तर तो देता है, लेकिन यह नहीं बताता कि वह उत्तर एक ठोस तथ्य है या केवल एक तुक्का। विज्ञान में, "कितना आश्वस्त" वाला हिस्सा (अनिश्चितता) जानना उतना ही महत्वपूर्ण है जितना कि स्वयं उत्तर जानना।

समस्या: "ब्लैक बॉक्स" बनाम "पटरी"

यह शोध पत्र तर्क देता है कि हम दो बुरे विकल्पों के बीच फंसे हुए हैं:

  1. पटरी (लीनियर रिग्रेशन): यह आपको एक स्पष्ट "कॉन्फिडेंस स्कोर" (अनुमान) देता है, लेकिन यह डेटा के जटिल, घुमावदार संबंधों को मिस कर देता है।
  2. आकार बदलने वाला (मशीन लर्निंग): यह जटिल संबंधों को खोज लेता है, लेकिन यह एक "ब्लैक बॉक्स" की तरह काम करता है। आप आसानी से इससे नहीं पूछ सकते, "तुम इस विशिष्ट नियम के बारे में कितने आश्वस्त हो?" या "क्या यह पैटर्न वास्तविक है या केवल शोर (noise) है?"

मौजूदा तरीके इसे ठीक करने की कोशिश करते हैं—एक ब्लैक बॉक्स पर टॉर्च चमकाकर (जिन्हें शापली वैल्यूज़ कहा जाता है)—लेकिन वह टॉर्च डगमगाती रहती है। यह अक्सर जासूस को वास्तव में जितना आश्वस्त होना चाहिए, उससे अधिक आश्वस्त दिखाती है, जिससे गलत अलार्म बज जाते हैं।

समाधान: RuleSHAP

लेखकों ने RuleSHAP नामक एक नया टूल बनाया है। इसे एक ऐसा जासूसी दल मानिए जो दोनों दुनियाओं के सर्वश्रेष्ठ गुणों को जोड़ता है।

1. "स्मूथिंग" जासूस (रूल जनरेशन)
आमतौर पर, जब ये आकार बदलने वाले जासूस नियमों की तलाश करते हैं, तो वे बहुत उत्साहित हो जाते हैं और उन विशिष्ट सुरागों को रट लेते हैं जिन्हें वे देख रहे होते हैं, बजाय इसके कि वे सामान्य पैटर्न को सीखें। यह एक छात्र द्वारा विषय सीखने के बजाय अभ्यास परीक्षा के उत्तर रटने जैसा है।
RuleSHAP "स्मूथिंग" नामक एक ट्रिक का उपयोग करता है। यह कल्पना करता है कि हर बार जब वह डेटा को देखता है, तो डेटा थोड़ा अलग होता है (थोड़ा सा "शोर" जोड़ना)। यह जासूस को उन वास्तविक अंतर्निहित पैटर्न को खोजने के लिए मजबूर करता है जो तब भी टिके रहते हैं जब डेटा डगमगाता है, न कि विशिष्ट विवरणों को रटने के लिए। यह उन्हें झूठे दावे करने से रोकता है।

2. "दोहरी व्यक्तित्व" वाली गणित (बेयसियन रिग्रेशन)
एक बार नियम मिल जाने के बाद, टीम को उन्हें तौलने की आवश्यकता होती है। लेखकों ने गौर किया कि पिछले उपकरणों ने "सीधी रेखाओं" (सरल नियमों) और "जटिल नियमों" (घुमावदार इंटरैक्शन) के साथ बिल्कुल एक जैसा व्यवहार किया। इस कारण से उनकी गणित ने अनजाने में सरल, सीधी रेखा वाले तथ्यों को अनदेखा कर दिया क्योंकि वह जटिल चीज़ों को खोजने में बहुत व्यस्त थी।
RuleSHAP अपना दिमाग दो हिस्सों में बांटता है। यह अपने दिमाग के एक हिस्से का उपयोग सरल, सीधी रेखा वाले तथ्यों को संभालने के लिए और दूसरे हिस्से का जटिल नियमों के लिए करता है। यह सुनिश्चित करता है कि यदि कोई संबंध वास्तव में एक सीधी रेखा है, तो टूल उसे पहचान लेगा और उसे उचित कॉन्फिडेंस स्कोर देगा।

3. "लोकल रिपोर्ट कार्ड" (शापली वैल्यूज़)
अंत में, टूल "शापली वैल्यूज़" की गणना करता है। कल्पना करें कि एक ग्रुप प्रोजेक्ट है जहाँ हर कोई योगदान देता है। शापली वैल्यूज़ आपको ठीक-ठीक बताती हैं कि प्रत्येक व्यक्ति ने अंतिम ग्रेड में कितना योगदान दिया।
RuleSHAP केवल एक वैश्विक ग्रेड नहीं देता; यह प्रत्येक व्यक्ति के लिए एक लोकल रिपोर्ट कार्ड देता है। यह कहता है, "इस विशिष्ट 50 वर्षीय महिला के लिए, उम्र एक बड़ा जोखिम कारक है। लेकिन उस 20 वर्षीय पुरुष के लिए, उम्र ज्यादा मायने नहीं रखती।" महत्वपूर्ण रूप से, यह प्रत्येक एक के इन स्थानीय रिपोर्टों के साथ एक "कॉन्फिडेंस इंटरवल" भी जोड़ता है, जो बताता है कि क्या वह विशिष्ट योगदान सांख्यिकीय रूप से महत्वपूर्ण है या केवल रैंडम शोर है।

उन्होंने क्या पाया

टीम ने इस नए टूल का परीक्षण दो चीजों पर किया:

  1. नकली डेटा (Fake Data): उन्होंने ज्ञात उत्तरों वाला एक पहेली बनाया। RuleSHAP सही उत्तर खोजने में सक्षम था और अधिक महत्वपूर्ण बात यह है कि इसने सही ढंग से पहचाना कि कौन से सुराग महत्वपूर्ण नहीं थे (शोर), बिना किसी गलत अलार्म के। अन्य उपकरण अक्सर भ्रमित हो जाते थे और शोर को महत्वपूर्ण समझ लेते थे।
  2. वास्तविक स्वास्थ्य डेटा: उन्होंने नीदरलैंड के 21,000 से अधिक लोगों के एक विशाल अध्ययन पर कोलेस्ट्रॉल और रक्तचाप (blood pressure) को देखने के लिए इसे लागू किया।
    • उन्होंने ज्ञात तथ्यों की पुष्टि की: बढ़ती उम्र और उच्च BMI आमतौर पर उच्च रक्तचाप का संकेत देते हैं।
    • उन्होंने जटिल इंटरैक्शन पाए: कोलेस्ट्रॉल पर उम्र का प्रभाव हर किसी के लिए एक जैसा नहीं है। उदाहरण के लिए, पुरुषों और महिलाओं के बीच कोलेस्ट्रॉल के स्तर का अंतर 52 वर्ष की आयु के बाद बहुत बढ़ जाता है (मेनोपॉज के साथ मेल खाता है)।
    • उन्होंने एक "विरोधाभास" (paradox) पाया: डेटा में धूम्रपान रक्तचाप को कम करने से जुड़ा हुआ दिखाई दिया। लेखक नोट करते हैं कि यह एक ज्ञात सांख्यिकीय विचित्रता है (संभवतः इसलिए क्योंकि धूम्रपान करने वालों में अन्य स्वास्थ्य समस्याएं हो सकती हैं जो उनके वजन को कम करती हैं या माप में त्रुटियां होती हैं), और उनके टूल ने इसे एक विशिष्ट, गैर-कारण जुड़ाव के रूप में सही ढंग से फ्लैग किया, न कि एक जादुई इलाज के रूप में।

निष्कर्ष (The Bottom Line)

RuleSHAP एक नया फ्रेमवर्क है जो वैज्ञानिकों को जटिल स्वास्थ्य पैटर्न खोजने के लिए शक्तिशाली, लचीली मशीन लर्निंग का उपयोग करने देता है, लेकिन विश्वसनीय सांख्यिकी के सुरक्षा जाल के साथ। यह आपको न केवल यह बताता है कि पैटर्न क्या है, बल्कि यह भी बताता है कि आप विशिष्ट व्यक्तियों के लिए इसके बारे में कितने आश्वस्त हो सकते हैं, बिना रैंडम शोर से ठगे गए।

सीमाएं: पेपर नोट करता है कि यह टूल वर्तमान में गणनात्मक रूप से भारी (computationally heavy) है (इसे बहुत बड़े डेटासेट पर चलाने में काफी समय लगता है) और सभी अवलोकन संबंधी अध्ययनों (observational studies) की तरह, यह कारण और प्रभाव (cause and effect) को सिद्ध नहीं कर सकता—यह केवल मजबूत जुड़ाव (associations) दिखा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →