← नवीनतम पेपर
🤖 machine learning

Relevance-Aware Rule: Structural Deletion of Irrelevant Conditions in Decision Trees

यह शोधपत्र निर्णय वृक्षों (डिसीजन ट्रीज़) के लिए एक सैद्धांतिक रूप से आधारित ढांचा प्रस्तावित करता है जो बाइनरी स्प्लिट्स की संरचनात्मक प्रणाली—विशेष रूप से सहोदर शाखाओं (सिबलिंग ब्रांचेस) के बीच वर्ग अनुपातों के विपरीत बदलावों—का लाभ उठाकर अप्रासंगिक स्थितियों की पहचान करता है और उन्हें चुनिंदा रूप से हटा देता है ताकि भविष्यवाणी की विश्वसनीयता को कठोरता से बनाए रखते हुए नियमों को सरल बनाया जा सके।

मूल लेखक: Jung-Sik Hong, Jeongeon Lee, Min Kyu Sim, Sangheum Hwang

प्रकाशित 2026-07-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jung-Sik Hong, Jeongeon Lee, Min Kyu Sim, Sangheum Hwang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को निर्णय लेना सिखाने की कोशिश कर रहे हैं, जैसे कि एक डॉक्टर मरीज का निदान करता है या एक बैंक ऋण को मंजूरी देता है। आप रोबोट को एक "डिसीजन ट्री" (Decision Tree) देते हैं, जो मूल रूप से एक विशाल फ्लोचार्ट की तरह है। "क्या मरीज 50 वर्ष से अधिक आयु का है? हाँ। क्या उसे बुखार है? हाँ। क्या उसने तीखा खाना खाया था? नहीं।" यदि रोबोट ऊपर (रूट/जड़) से नीचे (लीफ/पत्ती) तक के पथ का अनुसरण करता है, तो वह एक अंतिम उत्तर पर पहुँच जाता है। यह बहुत अच्छा है क्योंकि नियम स्पष्ट हैं: आप उन प्रश्नों को पढ़ सकते हैं और समझ सकते हैं कि रोब सहित ने वह विकल्प क्यों चुना।

हालाँकि, इसमें एक पेंच है। क्योंकि रोबोट को उत्तर तक पहुँचने के लिए हर प्रश्न का उत्तर देना पड़ता है, इसलिए उस विशिष्ट स्थिति के लिए उनमें से कुछ प्रश्न पूरी तरह से बेकार हो सकते हैं। यह एक ऐसे जासूस की तरह है जो हत्या की गुत्थी सुलझाते हुए लिखता है, "संदिग्ध ने जूते पहने थे, उसकी दो आँखें थीं, और वह सांस ले रहा था," इससे पहले कि वह निष्कर्ष निकाले, "इसलिए यह बटलर (बड़ा नौकर) था।" जूतों और सांस लेने के तथ्य सत्य हैं, लेकिन वे यह साबित करने में मदद नहीं करते कि वह बटलर ही था; वे बस कहानी में अवांछित शोर पैदा करते हैं। कंप्यूटर विज्ञान की दुनिया में, इन बेकार तथ्यों को "इरेलेवेंट कंडीशंस" (Irrelevant Conditions - IRCs) कहा जाता है। ये नियमों को लंबा, भ्रमित करने वाला और पढ़ने में कठिन बना देते हैं, भले ही रोबोट सही उत्तर दे रहा हो। बड़ा सवाल वैज्ञानिकों के लिए यह रहा है: हम इस फालतू सामग्री को कैसे निकाल दें बिना गलती से रोबोट का मन बदले या उसे कम विश्वसनीय बनाए?

यह शोध पत्र, जिसका शीर्षक "Relevance-Aware Rule: Structural Deletion of Irrelevant Conditions in Decision Trees" है, ठीक इसी समस्या पर काम करता है। लेखक, जो सियोल नेशनल यूनिवर्सिटी ऑफ साइंस एंड टेक्नोलॉजी के एक दल हैं, तर्क देते हैं कि इन पेड़ों को साफ करने के पिछले तरीके या तो बहुत ढीले (फालतू सामग्री छोड़ देने वाले) थे या बहुत सख्त (गलती से महत्वपूर्ण चीजों को काट देने वाले)। वे इन बेकार प्रश्नों को पहचानने और उन्हें हटाने के लिए पेड़ की अपनी संरचना के आधार पर एक नया, चतुर तरीका प्रस्तावित करते हैं।

उनके इस मुख्य खोज को एक सरल उपमा के माध्यम से समझाया गया है: कल्पना कीजिए कि डिसीजन ट्री एक नदी है जो दो धाराओं में विभाजित होती है। जब नदी विभाजित होती है, तो एक तरफ का पानी "गंदा" (एक प्रकार के कण अधिक) हो सकता है, जिसका अर्थ है कि दूसरी ओर का पानी अनिवार्य रूप से "साफ" (उस कण का कम होना) होगा। लेखकों ने महसूस किया कि जब भी पेड़ विभाजित होता है, तो वह एक आदर्श संतुलन बनाता है: यदि एक शाखा "क्लास A" की संभावना को ऊपर धकेलती है, तो दूसरी शाखा को "क्लास B" की संभावना को ऊपर धकेलना ही होगा। वे इन्हें "C1-लिंक्स" और "C0-लिंक्स" कहते हैं।

इस संरचनात्मक तथ्य का उपयोग करते हुए, लेखकों ने "संदिग्ध" प्रश्नों को पहचानने के लिए एक प्रणाली विकसित की। यदि "क्लास A" के उत्तर की ओर जाने वाले पथ पर कोई प्रश्न वास्तव में "क्लास B" की ओर संभावना को धकेलता है (एक बेमेल स्थिति), तो वह संदिग्ध दिखता है। लेकिन यहाँ प्रतिभा का हिस्सा है: सिर्फ इसलिए कि एक प्रश्न संदिग्ध है, इसका मतलब यह नहीं है कि वह बेकार है। कभी-कभी, एक बेमेल प्रश्न वास्तव में उत्तर को सूक्ष्मता से सुधारने (fine-tune) के लिए वहां होता है, जिससे वह एक विशिष्ट उपसमूह के लिए अधिक विश्वसनीय बन जाता है। लेखकों की विधि इन संदिग्ध प्रश्नों को केवल अंधाधुंध डिलीट नहीं करती है। इसके बजाय, यह एक सावधानीपूर्वक संपादक की तरह कार्य करती है। यह जाँचती है: "यदि हम इस प्रश्न को हटा दें, तो क्या नियम अभी भी कायम रहेगा? क्या यह अभी भी उसी आत्मविश्वास के साथ सही उत्तर की भविष्यवाणी करेगा?"

उन्होंने दो मुख्य दृष्टिकोणों का परीक्षण किया। पहला, "मेथड 1" (Method 1), एक व्यापक दृष्टिकोण है जो इन बेमेल स्थितियों को खोजता है और उन्हें तभी हटाता है जब एक सख्त विश्वसनीयता परीक्षण यह सुरक्षित बताता है। दूसरा, "मेथड 2" (Method 2), एक अत्यंत रूढ़िवादी (conservative) दृष्टिकोण है जो केवल उन प्रश्नों को हटाता है यदि पेड़ की संरचना यह गारंटी देती है कि डेटा के बावजूद उत्तर में कोई बदलाव नहीं होगा।

परिणाम प्रभावशाली हैं। अपने प्रयोगों में, उनकी नई विधि ने बेकार की गई शर्तों का एक बड़ा हिस्सा निकालने में सफलता प्राप्त की—उन्होंने परीक्षण किए गए नियमों में लगभग 35% प्रश्नों को हटा दिया—बिना रोबोट की सटीकता को प्रभावित किए। वास्तव में, रूढ़िवादी पद्धति के लिए, रोबोट की भविष्यवाणियाँ मूल, अव्यवस्थित पेड़ के बिल्कुल समान रहीं। उन्होंने यह भी पाया कि उनकी विधि अविश्वसनीय रूप से तेज़ है, जो समान कार्य करने वाले अन्य लोकप्रिय तरीकों की तुलना में सैकड़ों गुना तेज़ चलती है।

यह शोध पत्र स्पष्ट रूप से इस विचार को खारिज करता है कि आप केवल एक साधारण सांख्यिकीय परीक्षण के आधार पर किसी भी प्रश्न को हटा सकते हैं जो "गलत" दिखता है। वे दिखाते हैं कि ऐसा करने से अक्सर नियम की विश्वसनीयता टूट जाती है या ऐसे संघर्ष पैदा होते हैं जहाँ अलग-अलग नियम एक ही स्थिति के लिए अलग-अलग उत्तर देते हैं। वे इस विचार के विरुद्ध भी तर्क देते हैं कि नियम को छोटा बनाना हमेशा बेहतर होता है; एक छोटा नियम जो गलत उत्तर देता है या महत्वपूर्ण विवरणों को छोड़ देता है, वह थोड़े लंबे लेकिन सटीक नियम से बदतर है।

संक्षेप में, यह शोध पत्र डिसीजन ट्री को सरल बनाने के लिए एक गणितीय "सुरक्षा जाल" प्रदान करता है। यह सिद्ध करता है कि आप इन AI नियमों को बहुत छोटा और मनुष्यों के लिए पढ़ने में आसान बना सकते हैं, लेकिन आपको ऐसा करने के लिए पेड़ की आंतरिक संरचना को समझने और शेष नियमों की विश्वसनीयता की जांच करने की आवश्यकता है। यह केवल काटने के बारे में नहीं है; यह समझदारी से काटने के बारे में है। लेखक दिखाते हैं कि पेड़ के प्राकृतिक संतुलन का सम्मान करके, हम शोर को हटाकर स्पष्ट, भरोसेमंद और संक्षिप्त निर्देश पीछे छोड़ सकते हैं, जो हमारे डिजिटल निर्णय लेने वालों के लिए उपयोगी हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →