← नवीनतम पेपर
🤖 machine learning

Quadrature-TreeSHAP: Depth-Independent TreeSHAP and Shapley Interactions

यह शोधपत्र Quadrature-TreeSHAP प्रस्तुत करता है, जो एक संख्यात्मक रूप से स्थिर, गहराई-स्वतंत्र विधि है जो कुशलतापूर्वक शापली मानों (Shapley values) और उच्च-क्रम की अंतःक्रियाओं (high-order interactions) की गणना करने के लिए पाथ-डिपेंडेंट ट्री-शापली (Path-Dependent TreeSHAP) को गॉस-लेजेंड्रे क्वाड्रैचर (Gauss-Legendre quadrature) का उपयोग करके पुनर्गठित करता है, जिससे CPU और GPU दोनों पर महत्वपूर्ण गति वृद्धि प्राप्त होती है।

मूल लेखक: Ron Wettenstein, Rory Mitchell, Peng Yu

प्रकाशित 2026-05-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ron Wettenstein, Rory Mitchell, Peng Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट, लेकिन जटिल निर्णय लेने वाली मशीन है (जैसे कि एक पेड़ जिसकी हजारों शाखाएं विकसित हुई हैं)। आप जानना चाहते हैं कि इसने एक विशिष्ट भविष्यवाणी क्यों की। क्या इसने फीचर A के कारण "हाँ" का निर्णय लिया? या क्या यह फीचर B और फीचर C के बीच एक टीम वर्क था?

इस उत्तर तक पहुँचने के लिए, डेटा वैज्ञानिक SHAP नामक एक गणितीय उपकरण का उपयोग करते हैं। SHAP को इस तरह समझें कि यह सभी फीचर्स के बीच "क्रेडिट" (श्रेय) को निष्पक्ष रूप से विभाजित करने का एक तरीका है, जैसे कि इस आधार पर पिज्जा बांटना कि किसने कितनी सामग्री लाई है।

लंबे समय तक, करने का मानक तरीका (जिसे TreeSHAP कहा जाता था) में तीन मुख्य समस्याएं थीं:

  1. यह धीमा था: पेड़ जितना गहरा होता जाता था, क्रेडिट की गणना करने में उतना ही अधिक समय लगता था। यह एक विशाल ओक के पेड़ के हर एक पत्ते को एक-एक करके गिनने की कोशिश करने जैसा था।
  2. यह अस्थिर था: जैसे-जैसे पेड़ गहरे होते गए, गणित उथल-पुथल भरा और गलत होता गया, जैसे जेन्गा (Jenga) के ब्लॉक्स का एक टॉवर संतुलित करने की कोशिश करना जो लगातार डगमगा रहा हो।
  3. यह बड़ी तस्वीर को मिस कर देता था: यह एकल फीचर्स को समझाने में बहुत अच्छा था, लेकिन यह समझाने में बहुत धीमा और बोझिल था कि फीचर्स एक साथ मिलकर (इंटरेक्शन) कैसे काम करते हैं।

लेखकों ने Quadrature-TreeSHAP नामक एक नई विधि पेश की है। यह कैसे काम करती है, इसके सरल उदाहरण यहाँ दिए गए हैं:

1. "स्नैपशॉट" बनाम "मूवी"

पुराने तरीके पेड़ के हर एक पथ (path) पर कदम-दर-कदम चलकर क्रेडिट की गणना करने की कोशिश करते थे। यदि पेड़ गहरा था, तो इसमें बहुत समय लगता था।

Quadrature-TreeSHAP खेल बदल देता है। पूरे पेड़ के हर रास्ते पर चलने के बजाय, यह गणना को एक मूवी की तरह मानता है। यह महसूस करता है कि पेड़ के पीछे का गणित वास्तव में एक सुचारू, अनुमानित वक्र (पॉलीनोमियल) है।

पूरी मूवी को फ्रेम-दर-फ्रेम देखने के बजाय, यह नया तरीका वक्र के 8 विशिष्ट "स्नैपशॉट" (गणितीय रूप से क्वाड्रचर पॉइंट्स कहलाते हैं) लेता है।

  • जादू: लेखकों ने सिद्ध किया कि इन ट्री मॉडल्स के लिए, पूरी मूवी को सटीक रूप से फिर से बनाने के लिए केवल 8 स्नैपशॉट लेना पर्याप्त है।
  • परिणाम: इससे कोई फर्क नहीं पड़ता कि पेड़ 10 स्तर गहरा है या 100 स्तर गहरा। इस विधि को अभी भी केवल उन्हीं 8 स्नैपशॉट की आवश्यकता होती है। यह गहराई को पूरी तरह से अनदेखा कर देता है, जिससे यह अविश्वसनीय रूप से तेज़ और सुसंगत हो जाता है।

2. "स्थिर पुल" (Stable Bridge)

पुराना तरीका ऐसा था जैसे अस्थिर और असमान तख्तों से बना एक पुल। जैसे-जैसे पुल लंबा होता गया (गहरे पेड़), तख्ते खिसकने लगे और गणित ढह गया (संख्यात्मक अस्थिरता)।

नया तरीका पुल को चिकने, ठोस कंक्रीट से बनाता है। उन 8 निश्चित बिंदुओं पर उत्तर की गणना करके, यह "डगमगाते तख्तों" से पूरी तरह बच जाता है। परिणाम एक ऐसी गणना है जो सबसे गहरे, सबसे जटिल पेड़ों पर भी पूरी तरह स्थिर रहती है।

3. "टीमवर्क" की सुपरपावर

पुराना तरीका यह समझाने में संघर्ष करता था कि फीचर्स एक साथ मिलकर कैसे काम करते हैं (जैसे, "फीचर A और फीचर B ने मिलकर परिणाम दिया")। यह कमरे में कितने लोग हैं, यह गिनने के लिए लोगों को पहले जोड़ों में, फिर तीन के समूहों में, फिर चार के समूहों में लाइन में खड़ा करने जैसा था—यह तेजी से जटिल होता गया।

Quadrature-TreeSHAP इसे सहजता से संभालता है। क्योंकि यह किसी भी आकार के समूहों के लिए उसी "8 स्नैपशॉट" वाले ट्रिक का उपयोग करता है, यह जटिल टीमवर्क इंटरेक्शन (3-वे, 4-वे या यहाँ तक कि 6-वे) को लगभग तुरंत कैलकुलेट कर सकता है।

  • गति: अपने परीक्षणों में, यह जटिल इंटरेक्शन की गणना करने में पिछले सबसे अच्छे तरीके की तुलना में 1,200 गुना तेज़ था।

4. "असेंबली लाइन" (Hardware Efficiency)

अंत में, लेखकों ने इस विधि को आधुनिक कंप्यूटर चिप्स (CPUs और GPUs) के अनुकूल बनाया।

  • उदाहरण: एक फैक्ट्री असेंबली लाइन की कल्पना करें। पुराना तरीका एक ऐसे कर्मचारी की तरह था जिसे हर आइटम के बारे में अलग से सोचने के लिए रुकना पड़ता था। नया तरीका एक ऐसी मशीन की तरह है जो 8 वस्तुओं को एक ही समय में एक सटीक लय में प्रोसेस करती है।
  • परिणाम: क्योंकि गणित इतना नियमित है, यह मानक कंप्यूटरों और शक्तिशाली ग्राफिक्स कार्ड (GPUs) दोनों पर बहुत कुशलता से चलता है, जिससे मानक कंप्यूटरों पर 10 गुना और ग्राफिक्स कार्ड पर 7 गुना तक की गति मिलती है।

परिणामों का सारांश

लेखकों ने इसका परीक्षण 12 अलग-अलग वास्तविक दुनिया के डेटासेट्स (जैसे हाउसिंग प्राइस की भविष्यवाणी करना या फोटो में वस्तुओं की पहचान करना) पर किया।

  • गति: यह पुराने तरीकों की तुलना में लगातार तेज़ है, कभी-कभी 10 के कारक से भी अधिक।
  • स्थिरता: यह टूटता या गलत नहीं होता है, यहाँ तक कि बहुत गहरे पेड़ों पर भी जहाँ पुराने तरीके विफल हो गए थे।
  • अपनाने की दर: उन्होंने इसे पहले से ही XGBoost में शामिल कर लिया है, जो दुनिया के सबसे लोकप्रिय मशीन लर्निंग टूल्स में से एक है। यदि आप भविष्य में XGBoost का उपयोग करते हैं, तो आपके मॉडल को समझाने का यह नया, तेज़ और अधिक स्थिर तरीका पहले से ही इसमें मौजूद होगा।

संक्षेप में: Quadrature-TreeSHAP एक धीमी, अस्थिर, मैनुअल कैलकुलेटर से एक हाई-स्पीड, सुपर-स्टेबल डिजिटल कंप्यूटर में अपग्रेड करने जैसा है जो पलक झपकते ही जटिल टीमवर्क पहेलियों को हल कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →