← नवीनतम पेपर
📊 statistics

Valid inference for regression with best subset selection

यह शोधपत्र बेस्ट सबसेट सिलेक्शन (best subset selection) के लिए गणनात्मक रूप से कुशल, परिमित-नमूना वैध (finite-sample valid) अनुमान प्रक्रियाओं का प्रस्ताव करता है, जो AIC चयन घटना की ज्यामिति को अंतरालों के एक संघ (union of intervals) के रूप में अभिलक्षित करता है, जिससे सटीक कंडीशनिंग (exact conditioning) संभव हो पाती है ताकि विश्वसनीय p-मान और विश्वास अंतराल प्राप्त किए जा सकें जो पारंपरिक पोस्ट-सिलेक्शन विधियों की फ्रीक्वेंटिस्ट विफलताओं को सुधारते हैं।

मूल लेखक: Huiming Lin, Xin Tan, Meng Li

प्रकाशित 2026-09-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Huiming Lin, Xin Tan, Meng Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

डेटा साइंस की दुनिया में, शोधकर्ता अक्सर एक ऐसी पहेली का सामना करते हैं जिसमें बहुत सारे टुकड़े होते हैं। उनके पास तथ्यों का एक संग्रह होता—आय, तापमान या टेस्ट स्कोर को मापने वाले अंक—और वे उन तथ्यों के विशिष्ट संयोजन को खोजना चाहते हैं जो किसी विशेष परिणाम की सबसे अच्छी व्याख्या करता है, जैसे कि कोई व्यक्ति कितना खर्च करता है या एक पौधा कितनी तेजी से बढ़ता है। इसे हल करने के लिए, वे 'वेरिएबल सिलेक्शन' (चर चयन) नामक एक विधि का उपयोग करते हैं, जो अनिवार्य रूप से डेटा को छानने की एक प्रक्रिया है ताकि केवल सबसे उपयोगी सुरागों को रखा जा सके और बाकी को हटा दिया जाए। इस काम के लिए सबसे लोकप्रिय उपकरणों में से एक 'अकाइके इंफॉर्मेशन क्राइटेरियम' (AIC) के रूप में जानी जाने वाली एक नियम है। इसे एक सख्त न्यायाधीश के रूप में समझें जो इस बात को तौलता है कि एक मॉडल डेटा के साथ कितनी अच्छी तरह फिट बैठता है बनाम वह कितना जटिल है, और उस संस्करण को चुनता है जो सबसे अच्छा संतुलन प्रदान करता है। वैज्ञानिक इस न्यायाधीश पर भरोसा करते हैं कि कौन से चर महत्वपूर्ण हैं, और फिर वे यह घोषित करने के लिए मानक सांख्यिकीय उपकरणों का उपयोग करते हैं कि क्या वे चर वास्तव में महत्वपूर्ण हैं या केवल भाग्यशाली संयोग हैं।

हालाँकि, इस सामान्य कार्यप्रवाह में एक छिपा हुआ जाल है। महत्व को मापने के लिए उपयोग किए जाने वाले मानक उपकरण एक ऐसी दुनिया के लिए डिज़ाइन किए गए थे जहाँ मॉडल को डेटा देखे जाने से पहले ही चुन लिया गया था। जब एक शोधकर्ता मॉडल चुनने के लिए डेटा का ही उपयोग करता है, और फिर उस परिणाम पर उन मानक उपकरणों को लागू करता है, तो गणित विफल हो जाता है। मानक उपकरण यह मान लेते हैं कि मॉडल को पहले से तय किया गया था, लेकिन क्योंकि मॉडल को वास्तव में डेटा के आधार पर चुना गया था, इसलिए मानक उपकरण अत्यधिक आशावादी हो जाते हैं। वे चीजों को महत्वपूर्ण घोषित करने लगते हैं जब वे वास्तव में नहीं होती हैं, जिससे गलत खोजें होती हैं और विश्वास अंतराल (कॉन्फिडेंस इंटरवल) भरोसे के लिए बहुत संकीर्ण हो जाते हैं। यह एक ऐसी समस्या है जो चिकित्सा अनुसंधान से लेकर आर्थिक पूर्वानुमान तक सब कुछ प्रभावित करती है, क्योंकि यह वैज्ञानिकों को अस्थिर आधार से ठोस निष्कर्ष निकालने की ओर ले जा सकती है।

राइस यूनिवर्सिटी के सांख्यिकीविदों की एक टीम ने इस टूटे हुए गणित को ठीक करने का एक नया तरीका विकसित किया है। उन्होंने विशेष रूप से उस परिदृश्य पर ध्यान केंद्रित किया जहाँ चरों की एक बड़ी सूची में से सर्वश्रेष्ठ उपसमुच्चय (सबसेट) चुनने के लिए अकाइके इंफॉर्मेशन क्राइटेरियम का उपयोग किया जाता है। यह अनदेखा करने के बजाय कि मॉडल को डेटा से चुना गया था, उनका नया तरीका सीधे गणना में अनिश्चितता को शामिल करता है। उन्होंने पाया कि मॉडल चुनने की क्रिया डेटा के व्यवहार में एक विशिष्ट, मापने योग्य आकार बनाती है। परिणाम के संभावित मूल्यों को एक लंबी रेखा के रूप में कल्पना करें; चयन प्रक्रिया प्रभावी रूप से उस रेखा के कुछ हिस्सों को काट देती है, जिससे केवल वे विशिष्ट खंड बचते हैं जहाँ परिणाम लैंड कर सकता था। यह समझकर कि कौन से खंड काटे गए थे, शोधकर्ता परिणाम के लिए सही संभाव्यता वितरण (प्रोबेबिलिटी डिस्ट्रीब्यूशन) को पुनर्गठित कर सकते हैं। यह उन्हें वैध p-वैल्यू और विश्वास अंतराल की गणना करने की अनुमति देता है, भले ही मॉडल का चयन पहले ही किया जा चुका हो।

शोधकर्ताओं ने हजारों कंप्यूटर सिमुलेशन चलाकर यह सिद्ध किया कि यह नया दृष्टिकोण काम करता है। इन परीक्षणों में, उन्होंने ऐसा डेटा तैयार किया जहाँ वे सत्य को पहले से जानते थे। जब उन्होंने पुराने, मानक तरीकों का उपयोग किया, तो विश्वास अंतराल वास्तविक उत्तर को निर्धारित संख्या से कहीं अधिक बार पकड़ने में विफल रहे, और परीक्षणों ने पांच प्रतिशत के बजाय लगभग चालीस प्रतिशत की दर से गलत संकेतों को वास्तविक खोज घोषित कर दिया। इसके विपरीत, उनके नए सुधारात्मक तरीके ने त्रुटि दरों को सही स्तरों पर वापस ला दिया। उनके द्वारा उत्पादित विश्वास अंतराल व्यापक और ईमानदार थे, जो चयन प्रक्रिया द्वारा उत्पन्न अनिश्चितता को सटीक रूप से दर्शाते थे। यह सुधार विशेष रूप से महत्वपूर्ण है जब चयनित मॉडल चरों का पूरा सेट बन जाता है, एक ऐसी स्थिति जहाँ पुराने तरीके आश्चर्यजनक रूप से त्रुटि के प्रति संवेदनशील होते हैं।

यह दिखाने के लिए कि यह वास्तविक दुनिया में कैसे काम करता है, टीम ने संयुक्त राज्य अमेरिका में व्यक्तिगत उपभोग के बारे में एक क्लासिक डेटासेट पर अपनी विधि लागू की, जो 1970 से 2016 तक फैला हुआ है। इस डेटा में चार संभावित भविष्यवक्ता (प्रेडिक्टर्स) शामिल थे: व्यक्तिगत डिस्पोजेबल आय, औद्योगिक उत्पादन, बचत और बेरोजगारी दर। जब मानक सॉफ़वेयर ने विश्लेषण चलाया, तो उसने सभी चार चरों वाले पूर्ण मॉडल को चुना। पारंपरिक सांख्यिकीय परीक्षण ने घोषणा की कि औद्योगिक उत्पादन खर्च का एक महत्वपूर्ण भविष्यवक्ता है, जिसका विश्वास अंतराल शून्य को शामिल नहीं करता था। हालाँकि, जब शोधकर्ताओं ने अपने नए सुधार को लागू किया, तो तस्वीर बदल गई। सुधारात्मक विश्लेषण ने दिखाया कि औद्योगिक उत्पादन के लिए साक्ष्य इतने मजबूत नहीं थे कि संयोग को खारिज किया जा सके; इसका विश्वास अंतराल अब शून्य को शामिल करता था, जिसका अर्थ था कि यह अब सांख्यिकीय रूप से महत्वपूर्ण नहीं था। उनके सुधारात्मक परिणाम मूल चयन स्कोर के साथ पूरी तरह मेल खाते थे, जिन्होंने पहले ही संकेत दिया था कि आय और बचत प्रमुख कारक थे जबकि उत्पादन कम महत्वपूर्ण था।

टीम ने एक दूसरी, अधिक कठिन चुनौती को भी संबोधित किया: क्या होता है जब डेटा में शोर (नॉइज़) या त्रुटि की मात्रा अज्ञात होती है, जो वास्तविक जीवन में लगभग हमेशा होता है। मानक अभ्यास शोर के स्तर का अनुमान लगाना और उस अनुमान को सूत्र में डालना है, लेकिन शोधकर्ताओं ने पाया कि यह शॉर्टकट छोटे डेटासेट में अभी भी त्रुटि दरों को बढ़ा सकता है। इसे हल करने के लिए, उन्होंने एक कंप्यूटर-गहन तकनीक विकसित की जो संभावनाओं का एक कस्टम मानचित्र बनाने के लिए हजारों बार चयन प्रक्रिया का अनुकरण करती है। हालांकि इसमें अधिक कंप्यूटिंग शक्ति लगती है, यह सुनिश्चित करता है कि निष्कर्ष वैध बने रहें, भले ही शोर का स्तर अज्ञात हो। उनका कार्य यह प्रदर्शित करता है कि यह स्वीकार करके कि मॉडल कैसे चुने जाते हैं, वैज्ञानिक झूठे आत्मविश्वास के जाल से बच सकते हैं और ऐसे निष्कर्षों तक पहुँच सकते हैं जो सांख्यिकीय रूप से सुदृढ़ और साक्ष्य के अनुरूप हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →