← नवीनतम पेपर
🤖 machine learning

path_boost: A Python Package for Interpretable Graph-Level Prediction using Path-Based Gradient Boosting

यह शोध पत्र **path_boost** को प्रस्तुत करता है, जो एक ओपन-सोर्स पायथन पैकेज है जो प्रेडिक्टिव लेबल वाले पथों (predictive labeled paths) की खोज और संयोजन को स्वचालित रूप से करने के लिए **PathBoost** एल्गोरिदम को लागू करता है, ताकि रिग्रेशन और क्लासिफिकेशन कार्यों के लिए व्याख्या योग्य ग्राफ-स्तरीय भविष्यवाणियां प्रदान की जा सकें, जो ब्लैक-बॉक्स ग्राफ न्यूरल नेटवर्क के एक पारदर्शी विकल्प के रूप में कार्य करता है।

मूल लेखक: Claudio Meggio, Johan Pensar, Riccardo De Bin

प्रकाशित 2026-07-10
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Claudio Meggio, Johan Pensar, Riccardo De Bin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास लेगो ब्रिक्स (Lego bricks) का एक विशाल डिब्बा है, लेकिन आप केवल एक टावर बनाने के बजाय, केवल यह देखकर अनुमान लगाने की कोशिश कर रहे हैं कि एक रहस्यमय जीव कैसा दिखता है। डेटा साइंस की दुनिया में, ये जीव "ग्राफ" (graphs) हैं—बिंदुओं (nodes) का एक नेटवर्क जो रेखाओं (edges) से जुड़े होते हैं। लंबे समय तक, इस जीव के रहस्यों का अनुमान लगाने का सबसे अच्छा तरीका एक "ग्राफ न्यूरल नेटवर्क" (GNN) का उपयोग करना था। एक GNN को एक सुपर-स्मार्ट, सुपर-कॉम्प्लेक्स जादूगर के रूप में सोचें जो पूरी संरचना को देख सकता है और एक बेहतरीन उत्तर दे सकता है। लेकिन इसमें एक पेंच है: जादूगर एक "ब्लैक बॉक्स" है। आप पूछते हैं, "यह जीव नीला क्यों है?" और जादूगर बस कंधे उचका देता है। यह बताना असंभव है कि किन विशिष्ट लेगो कनेक्शनों ने इसे नीला बनाया।

यहाँ path boost आता है, जो ओस्लो विश्वविद्यालय के क्लॉडियो मेगियो, जोहान पेनसार और रिकार्डो डी बिन द्वारा बनाया गया एक नया पायथन पैकेज है। वे केवल एक जादूगर नहीं चाहते थे; वे एक जासूस चाहते थे जो सबूतों का एक कागजी रास्ता (paper trail) छोड़ सके।

जासूस का तरीका: सुरागों का पीछा करना

पूरे ग्राफ को एक साथ निगलने के बजाय, path boost PathBoost नामक एक विधि का उपयोग करता है। कल्पना कीजिए कि आप कदमों के विशिष्ट निशानों को देखकर एक रहस्य को सुलझाने की कोशिश कर रहे हैं।

  1. एंकर (The Anchor): आप अपनी खोज शुरू करने के लिए एक विशिष्ट प्रकार का पैर चुनते हैं (जैसे कि एक अणु में "धातु" का पैर)। इसे "एंकर नोड" कहा जाता है।
  2. पथ (The Path): आप निशान देखते हैं: "धातु का पैर -> कार्बन का पैर -> नाइट्रोजन का पैर।" यह एक "लेबल किया गया पथ" (labeled path) है।
  3. बूस्टिंग (The Boosting): जासूस एक बार में पूरा उत्तर नहीं बताता। इसके बजाय, वे छोटे कदम उठाते हैं। वे सभी संभावित निशानों को देखते हैं, उस निशान को चुनते हैं जो सबसे अधिक संदिग्ध (भवितात्मक) लगता है, और पूछते हैं, "क्या यह निशान हमें उत्तर का बेहतर अनुमान लगाने में मदद करता है?" यदि हाँ, तो वे इसे अपने सुरागों की सूची में जोड़ देते हैं। फिर वे सूची में जोड़ने के लिए अगले सबसे अच्छे निशान की तलाश करते हैं।

इस प्रक्रिया को ग्रेडिएंट बूस्टिंग (gradient boosting) कहा जाता है। यह कमजोर जासूसों की एक मजबूत टीम बनाने जैसा है। एक जासूस शायद केवल "धातु-कार्बन" वाले निशानों को पहचानने में अच्छा हो, दूसरा "धातु-सिलिकॉन" वाले निशानों में। जब आप उन सभी को मिलाते हैं, तो आपको एक सुपर-जासूस मिलता है जो सटीक है और सबसे महत्वपूर्ण बात यह है कि व्याख्या योग्य (interpretable) है। आप अंतिम सूची को देख सकते हैं और कह सकते हैं, "आह! भविष्यवाणी मुख्य रूप से प्लैटिनम से शुरू होने वाले और ऑक्सीजन तक जाने वाले निशानों द्वारा संचालित थी।"

उन्होंने क्या खारिज किया (The "No" List)

लेखक बहुत स्पष्ट हैं कि वे क्या नहीं कर रहे हैं।

  • कोई ब्लैक बॉक्स नहीं: वे स्पष्ट रूप से उन कार्यों के लिए केवल ग्राफ न्यूरल नेटवर्क पर निर्भर रहने के विरुद्ध तर्क देते हैं जहाँ आपको यह जानने की आवश्यकता होती है कि भविष्यवाणी क्यों की गई। जबकि GNN कच्चे सटीकता (raw accuracy) के मामले में शानदार हैं, पेपर सुझाव देता है कि वे वैज्ञानिक खोज के लिए आम तौरता से बहुत कठिन व्याख्या योग्य हैं।
  • कोई व्यापक खोज नहीं (No Exhaustive Search): वे शुरू करने से पहले ग्राफ में प्रत्येक संभावित पथ की जाँच करने के विचार को खारिज करते हैं। इसमें बहुत समय लगेगा ("combinatorial explosion")। इसके बजाय, path boost केवल उन्हीं पथों की खोज करता है जो वास्तव में उपयोगी साबित होते हैं, जिससे बहुत समय बचता है।
  • कोई जादुई डेटा नहीं: वे यह दावा नहीं करते कि यह हर चीज़ पर GNN से बेहतर काम करता है। वास्तव में, उनके अपने परीक्षणों से पता चलता है कि बड़े, सरल डेटासेट (जैसे 134,000 कार्बनिक अणुओं वाला QM9 डेटासेट) पर, GNN (जिसे GINE कहा जाता है) अभी भी जीतता है। path boost तब चैंपियन है जब आपके पास छोटे डेटासेट हों या आपको "क्यों" को समझने की आवश्यकता हो।

प्रमाण: वे कितने आश्वस्त हैं?

लेखकों ने केवल अनुमान नहीं लगाया; उन्होंने नंबरों का परीक्षण किया। उन्होंने अपने पैकेज का परीक्षण दो स्थापित तरीकों के विरुद्ध किया: GINE (एक प्रकार का GNN) और "WL + SVR" (एक ग्राफ कर्नेल जो सपोर्ट वेक्टर मशीन के साथ जुड़ा है)। उन्होंने इन परीक्षणों को छह अलग-अलग आणविक डेटासेट पर चलाया, जिसमें ESOL, FreeSolv, QM9 और tmQMg डेटासेट के तीन अलग-अलग लक्ष्य शामिल थे।

यहाँ डेटा क्या सुझाव देता है:

  • छोटे डेटासेट: ESOL (1,128 अणु) और FreeSolv (643 अणु) जैसे छोटे डेटासेट पर, path boost ने सभी मेट्रिक्स में GNN और कर्नेल विधि दोनों को पछाड़ दिया। उदाहरण के लिए, ESOL पर, path boost ने 0.8759 ± 0.0121 का R² स्कोर प्राप्त किया, जो GINE के 0.7941 ± 0.0328 से बेहतर था।
  • संक्रमण धातु (Transition Metals): tmQMg डेटासेट (संक्रमण धातु यौगिकों) पर, तीन में से दो लक्ष्यों के लिए path boost स्पष्ट विजेता था। इसने 0 से 0.9284 ± 0.0153 के R² के साथ ध्रुवणता (polarizability) की भविष्यवाणी की और 0.5841 ± 0.0650 के साथ HOMO ऊर्जा की भविष्यवाणी की, जबकि अन्य तरीके संघर्ष कर रहे थे।
  • अपवाद: विशाल QM9 डेटासेट (10,000 नमूना अणु) पर, GNN (GINE) सबसे अच्छा था, जिसका R² 0.8494 ± 0.0208 था, जबकि path boost का स्कोर 0.6429 ± 0.0480 था। यह सुझाव देता है कि विशाल, सजातीय डेटासेट के लिए, "ब्लैक बॉक्स" GNN अभी भी राजा हो सकता है।
  • गति: path boost अधिकांश कार्यों पर GINE की तुलना में तेज़ भी है। tmQMg कार्यों पर, GINE को प्रति फोल्ड 1036.3 सेकंड तक समय लगा, जबकि path boost ने 456.7 सेकंड लिया।

टूलकिट

यह पैकेज उन डेटा वैज्ञानिकों के लिए अनुकूल बनाया गया है जो पहले से ही scikit-learn (एक लोकप्रिय पायथन लाइब्रेरी) का उपयोग करते हैं। यह उनके मौजूदा वर्कफ़्लो में फिट बैठता है, जिसका अर्थ है कि आप इसे ट्यून करने के लिए मानक उपकरणों जैसे GridSearchCV का उपयोग कर सकते हैं। यह रिग्रेशन (regression) (एक संख्या का अनुमान लगाना, जैसे रासायनिक गुण) और बाइनरी क्लासिफिकेशन (binary classification) (हाँ/ना का अनुमान लगाना) दोनों का समर्थन करता है।

इसकी सबसे शानदार विशेषताओं में से एक वेरिएबल इम्पोर्टेंस (Variable Importance) टूल है। मॉडल द्वारा भविष्यवाणी करने के बाद, यह आपको ठीक से बता सकता है कि कौन से "पथ" सबसे अधिक महत्वपूर्ण थे।

  • निरपेक्ष महत्व (Absolute Importance): बताता है कि एक विशिष्ट मार्ग ने त्रुटि को कितना कम किया।
  • सापेक्ष महत्व (Relative Importance): बताता है कि क्या वह मार्ग एकमात्र था जो समस्या को हल कर सकता था, या क्या वहां अन्य समान मार्ग थे जो वही काम कर सकते थे।
  • सहसंबंध समायोजन (Correlation Adjustment): चूंकि लंबे मार्ग छोटे मार्गों के विस्तार होते हैं, इसलिए यह टूल इस बात के लिए समायोजन कर सकता है ताकि आप इस बारे में भ्रमित न हों कि मार्ग का कौन सा हिस्सा वास्तव में नायक है।

निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि path boost उन वैज्ञानिकों के लिए एक शक्तिशाली, ओपन-सोर्स टूल है जिन्हें यह समझने की आवश्यकता है कि एक मॉडल भविष्यवाणी क्यों कर रहा है, विशेष रूप से कम्प्यूटेशनल केमिस्ट्री जैसे क्षेत्रों में। यह सुझाव देता है कि जबकि GNN शक्तिशाली हैं, वे एकमात्र तरीका नहीं हैं। विशिष्ट, व्याख्या योग्य पथों पर ध्यान केंद्रित करके, path boost एक "मध्य मार्ग" प्रदान करता है: यह भारी GNN की तुलना में तेज़ है और आपको उन सुरागों का एक स्पष्ट नक्शा देता है जो उत्तर तक ले गए।

कोड मुफ्त है और GitHub और PyPI पर उपलब्ध है, इसलिए कोई भी इसे आज़मा सकता है। जैसा कि लेखकों ने कहा, विज्ञान में, यह समझना कि कोई भविष्यवाणी क्यों की गई, अक्सर केवल भविष्यवाणी करने जितना ही महत्वपूर्ण होता है। path boost आपको वह समझ देता है, एक समय में एक पथ।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →