← नवीनतम पेपर
🤖 machine learning

Extending Explainable Ensemble Trees (E2Tree) to regression contexts

यह शोध पत्र 'एक्सप्लेनेबल एनसेंबल ट्रीज़' (E2Tree) पद्धति को, जिसे मूल रूप से वर्गीकरण (classification) के लिए डिज़ाइन किया गया था, असमानता मापों (dissimilarity measures) का लाभ उठाकर रिग्रेशन संदर्भों तक विस्तारित करता है ताकि प्रेडिक्टर-रिस्पॉन्स संबंधों और प्रेडिक्टर जुड़ावों दोनों को ग्राफिक रूप से प्रदर्शित किया जा सके, जिससे रैंडम फॉरेस्ट मॉडलों की पारदर्शिता बढ़ाई जा सके।

मूल लेखक: Massimo Aria, Agostino Gnasso, Carmela Iorio, Marjolein Fokkema

प्रकाशित 2026-05-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Massimo Aria, Agostino Gnasso, Carmela Iorio, Marjolein Fokkema

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक रहस्य सुलझाने के लिए जासूसों की एक सुपर-स्मार्ट टीम (Random Forest) है जो मिलकर काम कर रही है। प्रत्येक जासूस सबूत के एक छोटे से हिस्से को देखता है और एक अनुमान लगाता है। जब वे सभी वोट करते हैं, तो उनका संयुक्त अनुमान अविश्वसनीय रूप से सटीक होता है। हालाँकि, क्योंकि वहाँ बहुत सारे जासूस हैं और वे सब एक-दूसरे के ऊपर बोल रहे हैं, यह बताना असंभव है कि उन्होंने अपने अंतिम निष्कर्ष तक बिल्कुल कैसे पहुँचा। यह टीम एक "ब्लैक बॉक्स" (black box) है—आपको उत्तर तो मिलता है, लेकिन आप उनके तर्क को नहीं देख पाते।

यह शोध पत्र एक नए टूल का परिचय देता है जिसे E2Tree (Explainable Ensemble Trees) कहा जाता है, जो एक अनुवादक (translator) के रूप में कार्य करता है। यह जासूसों की टीम के अराजक और जटिल निर्णयों को लेता है और उन्हें एक एकल, स्पष्ट, आसानी से पढ़े जाने वाले फ्लोचार्ट में व्यवस्थित करता है।

यहाँ इस शोध पत्र का विवरण सरल उपमाओं (analogies) का उपयोग करके दिया गया है:

1. समस्या: "ब्लैक बॉक्स" (The Black Box)

मशीन लर्निंग की दुनिया में, Random Forest जैसे उपकरण चीजों की भविष्यवाणी करने (जैसे कि एक कार की कीमत कितनी होगी या एक पौधे के बढ़ने की गति कितनी होगी) में बहुत अच्छे हैं। लेकिन वे ऊन के एक विशाल, उलझे हुए गोले की तरह हैं। आप सिरे को खींच सकते हैं और परिणाम प्राप्त कर सकते हैं, लेकिन आप उसके अंदर के पैटर्न को नहीं देख सकते।

  • लक्ष्य: लेखक उस ऊन को बिना उसकी मजबूती खोए सुलझाना चाहते हैं। वे Random Forest की उच्च सटीकता को बनाए रखना चाहते हैं, लेकिन उसे एक सरल निर्णय वृक्ष (decision tree) जैसा बनाना चाहते हैं जिसे एक इंसान समझ सके।

2. समाधान: E2Tree

लेखकों ने पहले वर्गीकरण (classification) कार्यों (चीजों को श्रेणियों में छाँटना, जैसे "बिल्ली" बनाम "कुत्ता") के लिए E2Tree बनाया था। इस शोध पत्र में, उन्होंने E2Tree को रिग्रेशन (regression) कार्यों को संभालने के लिए सिखाया है।

  • रिग्रेशन की उपमा: चीजों को बक्सों में छाँटने के बजाय, रिग्रेशन एक विशिष्ट संख्या की भविष्यवाणी करने जैसा है, जैसे कि एक कार की सटीक गति या घर की कीमत।
  • जादुई ट्रिक: E2Tree केवल एक समय में एक वेरिएबल को नहीं देखता है। यह देखता है कि वेरिएबल्स आपस में कैसे "नृत्य" करते हैं। यह एक विशेष गणितीय ट्रिक का उपयोग करता है जिसे डिसिमिलैरिटी मैट्रिक्स (dissimilarity matrix) कहा जाता है।
    • इसे एक बैठने के चार्ट की तरह समझें: कल्पना कीजिए कि आपके पास लोगों से भरा एक कमरा है। Random Forest ने पहले ही समान लोगों को विभिन्न समूहों में अलग-अलग मेजों पर समूहबद्ध कर दिया है। E2Tree यह देखता है कि दो विशिष्ट लोग उन अलग-अलग समूहों में कितनी बार एक ही मेज पर बैठे। यदि वे अक्सर एक साथ बैठे, तो वे "समान" हैं। यदि वे शायद ही कभी एक साथ बैठे, तो वे "अलग" हैं।

3. यह कैसे काम करता है (नुस्खा/Recipe)

शोध पत्र इस नए, स्पष्ट पेड़ (tree) को बनाने के लिए चरण-दर-चरण प्रक्रिया का वर्णन करता है:

  1. समानता मापना (Measure Similarity): यह गणना करता है कि डेटा बिंदुओं के जोड़े (जैसे दो विशिष्ट कारें या दो विशिष्ट फूल) कितनी बार Random Forest के भीतर एक ही "समूह" में आते हैं।
  2. "फिट" की जाँच करना (Check the "Fit"): यह जाँचता है कि क्या समूह समझ में आने वाले हैं। संख्याओं की भविष्यवाणी करने की दुनिया (रिग्रेशन) में, यह पूछता है: "क्या इस समूह के नंबर एक-दूसरे के करीब हैं?" यदि नंबर इधर-उधर बिखरे हुए हैं, तो वह समूह बहुत उपयोगी नहीं है।
  3. पेड़ बनाना (Build the Tree): यह डेटा को विभाजित करना शुरू करता है, ठीक वैसे ही जैसे एक सामान्य पेड़ करता है, लेकिन यह विभाजित करने के लिए उन समानता स्कोर का उपयोग करता है।
  4. रोकने के नियम (Stop Rules): इसे पता है कि कब विभाजन रोकना है। यह तब रुक जाता है जब समूह पहले से ही बहुत समान होते हैं या यदि उन्हें और अधिक विभाजित करने से परिणाम में कोई बदलाव नहीं आता (जैसे कि दो समूहों के लोगों की औसत ऊंचाई की तुलना करना, इससे पहले कि उन्हें और अधिक अलग करने का प्रयास किया जाए)।

4. प्रमाण: दो उदाहरण

लेखकों ने अपने नए "अनुवादक" का परीक्षण करने के लिए दो वास्तविक दुनिया के डेटासेट पर परीक्षण किया:

  • फूल का परीक्षण (Iris Dataset):

    • उन्होंने अन्य मापों के आधार पर फूल की पंखुड़ी की लंबाई की भविष्यवाणी करने की कोशिश की।
    • परिणाम: E2Tree ने जटिल तर्क को सफलतापूर्वक फिर से बनाया। इसने एक स्पष्ट मार्ग दिखाया: "यदि पंखुड़ी की चौड़ाई छोटी है AND प्रजाति X है, तो पंखुड़ी की लंबाई Y है।"
    • सत्यापन: उन्होंने Random Forest द्वारा बनाए गए "मानचित्र" की तुलना E2Tree द्वारा बनाए गए "मानचित्र" से की। वे 90% समान थे, जिससे सिद्ध हुआ कि अनुवादक ने मूल अर्थ को नहीं खोया।
  • कार का परीक्षण (Auto MPG Dataset):

    • उन्होंने वजन, इंजन के आकार और वर्ष के आधार पर एक कार कितने माइलेज (MPG) देती है, इसकी भविष्यवाणी करने की कोशिश की।
    • परिणाम: E2Tree ने एक दृश्य मानचित्र (visual map) बनाया जो दिखाता है कि कैसे "भारी वजन" या "बड़ा इंजन" ईंधन दक्षता को कम करता है। इसने "If-Then" नियमों को स्पष्ट रूप से दिखाया (जैसे, "यदि कार भारी है AND पुरानी है, तो इसे कम MPG मिलता है")।
    • सत्यापन: यहाँ तक कि अधिक जटिल डेटा (अधिक कार फीचर्स) के साथ भी, E2Tree का मानचित्र लगभग 75% बार Random Forest के तर्क से मेल खाता था।

5. यह क्यों महत्वपूर्ण है

शोध पत्र का दावा है कि E2Tree एक शक्तिशाली उपकरण है क्योंकि:

  • यह पारदर्शी है: यह एक भ्रमित करने वाले "ब्लैक बॉक्स" को एक स्पष्ट फ्लोचार्ट में बदल देता है।
  • यह सटीक है: यह मूल Random Forest की उच्च भविष्यवाणी शक्ति को बनाए रखता है।
  • यह संबंधों को दर्शाता है: यह केवल यह नहीं कहता कि "वजन महत्वपूर्ण है।" यह दिखाता है कि वजन अन्य कारकों (जैसे इंजन का आकार) के साथ कैसे परस्पर क्रिया करता है ताकि अंतिम परिणाम बन सके।

संक्षेप में: लेखकों ने एक पुल बनाया है जो सुपर-स्मार्ट लेकिन भ्रमित करने वाले "Random Forest" और स्पष्ट, तार्किक स्पष्टीकरण की मानवीय आवश्यकता के बीच स्थित है। उन्होंने साबित किया है कि यह पुल न केवल चीजों को श्रेणियों में छाँटने के लिए, बल्कि विशिष्ट संख्याओं की भविष्यवाणी करने के लिए भी काम करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →