← नवीनतम पेपर
📊 statistics

Interpretable Network-assisted Random Forest+

यह शोध पत्र एक व्याख्यात्मक नेटवर्क-असिस्टेड मॉडल्स के परिवार को प्रस्तुत करता है जो एक सामान्यीकृत रैंडम फॉरेस्ट फ्रेमवर्क पर निर्मित है, जो नेटवर्क निर्भरताओं का लाभ उठाकर उच्च भविष्यवाणी सटीकता और मॉडल पारदर्शिता के बीच के अंतर को पाटता है और साथ ही फीचर और नेटवर्क योगदान को मापने के लिए व्यापक उपकरण प्रदान करता है।

मूल लेखक: Tiffany M. Tang, Elizaveta Levina, Ji Zhu

प्रकाशित 2026-09-09
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tiffany M. Tang, Elizaveta Levina, Ji Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आधुनिक डेटा विज्ञान की दुनिया में, कंप्यूटर को अक्सर उदाहरणों से सीखना सिखाया जाता है, ठीक वैसे ही जैसे एक छात्र परीक्षा के लिए अध्ययन करता है। दशकों से, मानक धारणा यह रही है कि प्रत्येक उदाहरण स्वतंत्र है, एक अकेला तथ्य जो अपने आप में खड़ा है। लेकिन वास्तविक दुनिया में, चीजें शायद ही कभी अलग-थलग होती हैं। लोग दोस्ती से जुड़े होते हैं, शहर सड़कों से जुड़े होते हैं, और जीन जैविक मार्गों (biological pathways) से जुड़े होते हैं। ये संबंध प्रभाव का एक ऐसा जाल बनाते हैं जहाँ एक व्यक्ति का व्यवहार या एक शहर की स्थिति उनके पड़ोसियों को प्रभावित करने के लिए लहरों की तरह फैल सकती है। जब डेटा बिंदु इस तरह से आपस में जुड़े होते हैं, तो उन्हें स्वतंत्र मानना एक ऐसी दृष्टिहीनता पैदा करता है, जो उन सूक्ष्म लेकिन शक्तिशाली बलों को अनदेखा कर देती है जो परिणामों को आकार देते हैं। वैज्ञानिकों के लिए चुनौती यह है कि वे ऐसे मॉडल बना सकें जो बेहतर भविष्यवाणियां करने के लिए इन कनेक्शनों का उपयोग कर सकें, बिना मॉडल को एक ऐसे 'ब्लैक बॉक्स' में बदले जिसे कोई समझ न सके। यदि कोई मॉडल किसी छात्र के भविष्य या किसी शहर की अपराध दर की भविष्यवाणी उनके सामाजिक दायरे के आधार पर करता है, तो हमें यह जानने की आवश्यकता है कि उनके व्यक्तिगत इतिहास की तुलना में वह सामाजिक दायरा कितना महत्वपूर्ण है।

यह समस्या NeRF+ नामक एक नई पद्धति द्वारा हल की गई है, जिसे नोट्रे डेम विश्वविद्यालय और मिशिगन विश्वविद्यालय के शोधकर्ताओं द्वारा विकसित किया गया है। उन्होंने एक ऐसा उपकरण बनाने का प्रयास किया जो भविष्यवाणियों को बेहतर बनाने के लिए नेटवर्क कनेक्शनों की शक्ति का लाभ उठा सके और साथ ही इतनी पारदर्शी रहे कि मनुष्य उस पर भरोसा कर सकें। पारंपरिक दृष्टिकोण अक्सर एक विकल्प चुनने के लिए मजबूर करते हैं: या तो अत्यधिक सटीक लेकिन जटिल प्रणालियों का उपयोग करें जिन्हें समझना असंभव है, या सरल, समझने योग्य प्रणालियों का उपयोग करें जो जुड़े हुए डेटा की बारीकियों को पकड़ने में विफल रहती हैं। शोधकर्ताओं ने एक लचीला मॉडल बनाकर इस अंतर को पाटा जो निर्णय वृक्षों (decision trees) की भविष्य कहने वाली शक्ति को रैखिक समीकरणों (linear equations) की स्पष्टता के साथ जोड़ता है। उनका दृष्टिकोण कंप्यूटर को डेटा की संरचना से सीखने की अनुमति देता है, जिससे न केवल यह पहचान होता है कि कौन से व्यक्तिगत लक्षण महत्वपूर्ण हैं, बल्कि यह भी कि आसपास का नेटवर्क परिणाम को कितना प्रभावित करता है।

उनके कार्य का मुख्य हिस्सा कंप्यूटर को यह पहचानने के लिए प्रशिक्षित करना है कि एक नेटवर्क वास्तविकता को दो अलग-अलग तरीकों से कैसे आकार दे सकता है। कभी-कभी, नेटवर्क में करीबी लोग इसलिए समान होते हैं क्योंकि वे एक छिपे हुए, अंतर्निहित गुण को साझा करते हैं, जैसे कि एक ही सामाजिक समूह से होना। अन्य समय में, वे केवल इसलिए समान होते हैं क्योंकि वे सीधे तौर पर जुड़े हुए हैं और एक-दूसरे को प्रभावित करते हैं, जैसे पड़ोसी जो समान आदतों को अपनाते हैं। यह नई पद्धति इन दोनों पैटर्न को पहचान सकती है। यह दो तरह से डेटा को देखकर ऐसा करती है। पहले, यह छिपे हुए समूहों को खोजने के लिए नेटवर्क का मानचित्रण करती है, ठीक वैसे ही जैसे लोगों को उनके परिचितों के आधार पर समूहों में छाँटना। दूसरा, यह एक 'स्मूथिंग नियम' (smoothing rule) लागू करती है जो मॉडल को जुड़े हुए पड़ोसियों को समान मानने के लिए प्रोत्साहित करती है, जिससे उनके बीच प्रभाव के प्रत्यक्ष प्रवाह को पकड़ा जा सके। इन दोनों को प्रत्येक व्यक्ति या स्थान के व्यक्तिगत विवरणों के साथ जोड़कर, मॉडल एक ऐसी भविष्यवाणी बनाता है जो सटीक और अनुकूलनीय दोनों होती है।

यह सुनिश्चित करने के लिए कि यह उपकरण वास्तविक दुनिया के निर्णय लेने के लिए उपयोगी हो, शोधकर्ताओं ने इसे काम करने के तरीके को देखने के लिए अंतर्निहित लेंसों से लैस किया है। अन्य उन्नत प्रणालियों के विपरीत जिन्हें अपने निर्णयों को समझाने के लिए अलग, अक्सर अविश्वसनीय उपकरणों की आवश्यकता होती है, यह मॉडल स्वयं की व्याख्या करता है। यह एक शोधकर्ता को ठीक से बता सकता है कि किसी विशिष्ट विशेषता, जैसे कि छात्र के ग्रेड या शहर के तापमान ने, भविष्यवाणी में कितना योगदान दिया। इससे भी महत्वपूर्ण बात यह है कि यह नेटवर्क के प्रभाव को व्यक्तिगत लक्षणों के प्रभाव से अलग कर सकता है। यह मात्रा निर्धारित कर सकता है कि भविष्यवाणी का कितना हिस्सा इस तथ्य से आया कि एक व्यक्ति दूसरों से जुड़ा हुआ है, और कितना हिस्सा उसके अपने अद्वितीय गुणों से आया है। जटिल प्रणालियों में परिणामों के वास्तविक चालकों को समझने के लिए जाल (web) को व्यक्तिगत पहचान से अलग करने की यह क्षमता अत्यंत महत्वपूर्ण है।

शोधकर्ताओं ने अपने तरीके का परीक्षण सिम्युलेटेड डेटा (simulated data) का उपयोग करके किया जहाँ वे खेल के सटीक नियमों को जानते थे। उन्होंने ऐसे परिदृश्य बनाए जहाँ नेटवर्क की भूमिका छोटी थी, बड़ी थी, या बिल्कुल नहीं थी, और जहाँ चरों (variables) के बीच के संबंध सरल या बेहद जटिल थे। हर मामले में, नई पद्धति मौजूदा तकनीकों के बराबर या उनसे बेहतर प्रदर्शन करती है। जब नेटवर्क एक मजबूत कारक था, तो पद्धति ने सटीकता बढ़ाने के लिए इसका उपयोग किया। जब नेटवर्क अप्रासंगिक था, तो इसने अपनी भविष्यवाणी करने की क्षमता खोए बिना इसे अनदेखा कर दिया। महत्वपूर्ण रूप से, इसने उच्च प्रदर्शन बनाए रखा, यहाँ तक कि जब डेटा के संबंध टेढ़े-मेढ़े और अप्रत्याशित थे, जहाँ सरल मॉडल अक्सर विफल हो जाते हैं। सिमुलेशन ने यह भी दिखाया कि पद्धति सही ढंग से पहचान सकती थी कि नेटवर्क के कौन से हिस्से परिणामों को संचालित कर रहे थे, जिससे छिपे हुए समूहों और प्रत्यक्ष कनेक्शनों के बीच अंतर स्पष्ट हुआ।

यह सिद्ध करने के लिए कि यह पद्धति वास्तविक दुनिया की जटिल वास्तविकता में काम करती है, टीम ने इसे दो अलग-अलग केस स्टडीज पर लागू किया। पहला मामला स्कूल के संघर्षों पर एक बड़े प्रयोग से संबंधित था, जहाँ शोधकर्ताओं ने यह अनुमान लगाने की कोशिश की कि एक छात्र वर्ष के अंत तक अपने स्कूल को कितना मिलनसार महसूस करेगा। डेटा में छात्रों की पृष्ठभूमि और उनकी मित्रता का एक मानचित्र शामिल था। नए मॉडल ने इन धारणाओं की सफलतापूर्वक भविष्यवाणी की, और इसके आंतरिक विश्लेषण ने कुछ चौंकाने वाला खुलासा किया: कुछ स्कूलों के लिए, समग्र सामाजिक संरचना मुख्य चालक थी, जबकि अन्य के लिए, दोस्तों के घनिष्ठ समूह सबसे अधिक मायने रखते थे। एक विशिष्ट स्कूल में, मॉडल ने आठवीं कक्षा के छात्रों के एक छोटे, अलग-थलग समूह की पहचान की जिनकी मित्रता स्कूल के प्रति नकारात्मक दृष्टिकोण से मजबूती से जुड़ी हुई थी। मॉडल की व्यक्तिगत कनेक्शनों पर ज़ूम करने की क्षमता के बिना, यह विशिष्ट समूह डेटा के औसत शोर में खो सकता था।

दूसरी केस स्टडी ने पंद्रह वर्षों में फिलाडेल्फिया में अपराध दर को देखा। यहाँ, डेटा सैकड़ों मोहल्लों के मासिक अपराध आंकड़ों का था, जो उनकी भौतिक निकटता से जुड़े हुए थे। लक्ष्य मौसम के डेटा और समय का उपयोग करके अपराध दर की भविष्यवाणी करना था। परिणाम स्पष्ट थे: पड़ोसी मोहल्लों का नेटवर्क सबसे महत्वपूर्ण कारक था, जो मौसम या वर्ष के समय से कहीं अधिक प्रभावी था। मॉडल के आंतरिक उपकरणों ने दिखाया कि प्रभाव लगभग पूरी तरह से पड़ोसियों के बीच के प्रत्यक्ष संबंध से आया, जिससे पुष्टि हुई कि अपराध दरें सीमाओं के पार सुचारू रूप से (smooth out) चलती हैं। मॉडल यह भी बता सका कि कौन से विशिष्ट मोहल्ले इन पैटर्न को संचालित कर रहे थे, जिससे प्रभाव का एक स्पष्ट और सुचारू ढाल (gradient) दिखाई दिया जो देखे गए अपराध मानचित्रों से मेल खाता था। स्कूलों और शहरों दोनों में, पद्धति ने यह साबित किया कि वह कनेक्शनों से सीख सकती है बिना उनसे भ्रमित हुए।

शोधकर्ता इस बात पर जोर देते हैं कि यह उपकरण उन स्थितियों के लिए डिज़ाइन किया गया है जहाँ भविष्यवाणी से अधिक "क्यों" को समझना महत्वपूर्ण है। चाहे वह डॉक्टर हो जो निदान को समझने की कोशिश कर रहा हो, कोई नीति निर्माता हो जो किसी हस्तक्षेप का मूल्यांकन कर रहा हो, या कोई वैज्ञानिक हो जो सामाजिक गतिशीलता का अध्ययन कर रहा हो, नेटवर्क के योगदान को देखने की क्षमता महत्वपूर्ण है। यह पद्धति मानव व्यवहार के रहस्य को सुलझाने या यह सिद्ध करने का दावा नहीं करती है कि एक चीज़ दूसरी चीज़ का कारण बनती है, बल्कि यह एक स्पष्ट, ईमानदार मानचित्र प्रदान करती है कि डेटा का उपयोग कैसे किया जा रहा है। यह जुड़े हुए डेटा की जटिलता को आत्मविश्वास के साथ नेविगेट करने का एक तरीका प्रदान करती है, यह सुनिश्चित करती है कि प्राप्त अंतर्दृष्टि न केवल सटीक है, बल्कि पारदर्शी और विश्वसनीय भी है। प्रभाव के अदृश्य जाल को दृश्यमान बनाकर, यह कार्य एक ऐसी दुनिया में अधिक सूचित निर्णय लेने के द्वार खोलता है जहाँ सब कुछ एक-दूसरे से जुड़ा हुआ है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →