← नवीनतम पेपर
🤖 machine learning

Mitigating The Effect of Class Imbalance in Data with Hierarchical and Dependable Structure

यह शोध पत्र एक Hierarchy-Aware RoBERTa फ्रेमवर्क प्रस्तावित करता है जो CWE भेद्यता वर्गीकरण (vulnerability classification) में क्लास इम्बैलेंस को प्रभावी ढंग से कम करने के लिए लर्नबल पैरेंट-क्लास एम्बेडिंग्स का लाभ उठाता है, यह प्रदर्शित करते हुए कि पदानुक्रमित संरचना (hierarchical structure) को शामिल करना पारंपरिक ओवरसैंपलिंग तकनीकों से बेहतर प्रदर्शन करता है जो अक्सर मॉडल के प्रदर्शन को खराब कर देती हैं।

मूल लेखक: Bipin Chhetri, Deepika Giri, Avishek Kadel, Rabin Kumar Karki, Akbar Siami Namin

प्रकाशित 2026-07-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bipin Chhetri, Deepika Giri, Avishek Kadel, Rabin Kumar Karki, Akbar Siami Namin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो कंप्यूटर सुरक्षा खामियों के सुरागों के विशाल ढेर को सुलझाने की कोशिश कर रहे हैं। ये खामियां एक विशाल पारिवारिक वृक्ष (family tree) के रूप में व्यवस्थित हैं जिसे कॉमन वीकनेस एन्यूमरेशन (CWE) कहा जाता है। इस पेड़ के शीर्ष पर "बेस" (Base) जैसी व्यापक श्रेणियां हैं (जो बड़ी तस्वीर दिखाती हैं), और जैसे-जैसे आप नीचे जाते हैं, शाखाएं अधिक विशिष्ट होती जाती हैं, जो "कंपाउंड" (Compound) या "पिलर" (Pillar) जैसे बहुत छोटे और दुर्लभ पत्तों पर समाप्त होती हैं।

समस्या क्या है? जासूस का सबूत बैग पूरी तरह से असंतुलित है। बड़ी, आम श्रेणियों के लिए सैकड़ों सुराग हैं, लेकिन दुर्लभ, विशिष्ट श्रेणियों के लिए केवल कुछ ही सुराग हैं। यह एक ऐसी लाइब्रेरी की तरह है जिसमें "फ्रूट" (फल) के बारे में 500 किताबें हैं लेकिन "ड्रैगनफ्रूट" के बारे में केवल 5 किताबें। यदि आप किसी कंप्यूटर को इन्हें छांटना सिखाने की कोशिश करते हैं, तो वह आलसी हो जाएगा और बार-बार "फ्रूट" का ही अनुमान लगाएगा, क्योंकि वह उसे सबसे अधिक बार देखता है।

द "फेक क्ल्यू" एक्सपेरिमेंट (जो काम नहीं आया)

इसे ठीक करने के लिए, कई विशेषज्ञों ने ओवरसैंपलिंग (oversampling) नामक एक चाल आजमाई। उन्होंने कुछ दुर्लभ सुरागों को लिया और उन्हें समान संख्या दिखाने के लिए नए, नकली सुराग बनाने की कोशिश की। उन्होंने दो लोकप्रिय तरीकों का उपयोग किया: SMOTE और ADASYN

इसे एक शेफ की तरह समझें जो सूप को ऐसा स्वाद देने की कोशिश कर रहा है जैसे उसमें दुर्लभ मसाले हों। असली मसालों को खोजने के बजाय, वे दो मौजूदा मसालों के दानों को लेते हैं, उन्हें आपस में मिलाते हैं, और उम्मीद करते हैं कि नया मिश्रण असली स्वाद देगा।

इस पेपर ने अलग-अलग प्रकार के "डिटेक्टिव्स" (कंप्यूटर मॉडल) पर इसका परीक्षण किया:

  • पुराने जमाने के डिटेक्टिव्स (रैंडम फॉरेस्ट और SVM): ये मॉडल उन जासूसों की तरह हैं जो तथ्यों की सरल सूचियों को देखते हैं। जब उन्हें नकली मिश्रित मसालों के साथ खिलाया गया, तो उन्हें एक मामूली बढ़त मिली। रैंडम फॉरेस्ट के लिए उनकी सटीकता 0.65 से बढ़कर 0.69 हो गई, और सपोर्ट वेक्टर मशीन (SVM) 0.71–0.72 के आसपास स्थिर रही। इसने थोड़ी मदद की, लेकिन बहुत ज्यादा नहीं।
  • हाई-टेक डिटेक्टिव्स (CNN और BiGRU): ये स्मार्ट, डीप-लर्निंग मॉडल हैं जो समझते हैं कि शब्द एक साथ कैसे बहते हैं। जब शोधकर्ताओं ने उन्हें नकली मिश्रित मसाले खिलाए, तो परिणाम विनाशकारी रहे। SMOTE के साथ CNN की सटीकता 0.71 से गिरकर 0.55 और ADASYN के साथ 0.51 हो गई। BiGRU 0.70 से गिरकर 0.53 और 0.44 पर आ गया।

क्यों? पेपर का तर्क है कि ये हाई-टेक मॉडल उन शेफ की तरह हैं जो असली मसाले और नकली मिश्रण के बीच अंतर पहचान सकते हैं। जब आप एक नकली एक को बनाने के लिए दो अलग-अलग कंप्यूटर "शब्दों" को मिलाते हैं, तो आप पारिवारिक वृक्ष के नियमों को तोड़ देते हैं। आप एक ऐसा "वेरिएंट" बना सकते हैं जो दावा करता है कि वह एक "बेस" का बच्चा है, लेकिन वह नकली मिश्रण वास्तव में उस पैरेंट-चाइल्ड संबंध का सम्मान नहीं करता है। यह "एप्पल" और "बनाना" को मिलाकर "ड्रैगनफ्रूट" बनाने की कोशिश करने जैसा है। परिणाम ड्रैगनफ्रूट नहीं होगा; यह एक भ्रमित करने वाला ढेर होगा जो डिटेक्टिव को उलझा देता है।

द "फैमिली ट्री" सॉल्यूशन (जो वास्तव में काम आया)

नकली सुराग बनाने के बजाय, लेखकों ने एक नया डिटेक्टिव बनाया जिसे हायरार्की-अवेयर रोबर्टा (Hierarchy-Aware RoBERTa) कहा गया।

कल्पना कीजिए कि इस डिटेक्टिव की जेब में पारिवारिक वृक्ष का एक विशेष मानचित्र (map) है। वे केवल सुराग को पढ़ते नहीं हैं; वे यह भी देखते हैं कि "रुको, यदि यह सुराग एक 'बेस' कमजोरी के बारे में है, तो उत्तर निश्चित रूप से उस पैरेंट से संबंधित होना चाहिए।"

यह मॉडल इस प्रकार काम करता है:

  1. यह खामत के टेक्स्ट विवरण को पढ़ता है (एक शक्तिशाली टूल जिसका नाम सिक्योरबर्ट (SecureBERT) है, उसका उपयोग करके)।
  2. यह पारिवारिक वृक्ष से एक "पैरेंट आईडी" (Parent ID) लेता है (जैसे यह जानना कि यह सुराग "बेस" शाखा से संबंधित है)।
  3. यह अंतिम अनुमान लगाने के लिए टेक्स्ट रीडिंग को मैप लोकेशन के साथ जोड़ देता है।

परिणाम:
इस नए डिटेक्टिव को किसी भी नकली सुराग की आवश्यकता नहीं पड़ी। इसने बिना किसी डेटा ऑग्मेंटेशन के 0.76 का वेटेड F1-स्कोर प्राप्त किया।

  • इसकी तुलना मानक BERT मॉडल से करें, जिसने 0.74 स्कोर किया।
  • सबसे महत्वपूर्ण बात, दुर्लभ "क्लास" (Class) श्रेणी को देखें। मानक BERT मॉडल ने इस दुर्लभ समूह के लिए केवल 0.49 का F1-स्कोर प्राप्त किया। नए हायरार्की-अवेयर मॉडल ने इसे बढ़ाकर 0.60 कर दिया।

निचोड़ (The Bottom Line)

पेपर सुझाव देता है कि जब आपके पास डेटा का एक संरचित पारिवारिक वृक्ष होता है, तो मौजूदा टुकड़ों को मिलाकर "नकली" अधिक डेटा बनाने की कोशिश करना (ओवरसैंपलिंग) एक बुरा विचार है। यह सरल मॉडलों के लिए ठीक काम करता है लेकिन उन्नत मॉडलों को तोड़ देता है।

इसके बजाय, सबसे अच्छा दृष्टिकोण यह है कि मॉडल को शुरुआत से ही पारिवारिक वृक्ष की संरचना का सम्मान करना सिखाया जाए। उन्हें पैरेंट-चाइल्ड संबंधों का "मानचित्र" देकर, वे दुर्लभ और कठिन मामलों को सिंथेटिक शोर (synthetic noise) से डेटा भरने की तुलना में बहुत बेहतर तरीके से समझ सकते हैं।

हालाँकि, लेखक सावधानी बरतते हुए कहते हैं कि उनका सबसे अच्छा डिटेक्टिव भी सबसे दुर्लभ श्रेणियों, जैसे कि "कंपाउंड" और "पिलर", के साथ संघर्ष करता है, जिनमें क्रमशः केवल 8 और 5 सैंपल थे। इन अत्यंत दुर्लभ समूहों के लिए, सभी मॉडलों में F1-स्कोर 0.00 रहा, जो बताता है कि जब डेटा लगभग शून्य हो, तो पारिवारिक वृक्ष का नक्शा भी रहस्य सुलझाने के लिए पर्याप्त नहीं होता।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →