← नवीनतम पेपर
📊 statistics

POSSE-kNN: Pathwise Out-of-Bag Selected Subspace Ensembles for Binary Classification

यह शोध पत्र POSSE-kNN को प्रस्तुत करता है, जो एक पाथवाइज (pathwise) kk-निकटतम पड़ोसी (k-nearest neighbor) एन्सेम्बल है जो स्थानीय वर्ग ज्यामिति (local class geometry) के आधार पर पड़ोसियों को गतिशील रूप से चुनने के लिए बूटस्ट्रैप सैंपलिंग, रैंडम फीचर सबस्पेस और आउट-ऑफ-बैग स्क्रीनिंग को संयोजित करता है, जो स्थापित क्लासिफायर की तुलना में दस बाइनरी बेंचमार्क डेटासेट में बेहतर एग्रीगेट सटीकता, कोहेन का कप्पा (Cohen's kappa) और ब्रियर स्कोर (Brier scores) प्रदर्शित करता है।

मूल लेखक: Zardad Khan, Amjad Ali, Najd Adeed, Saeed Aldahmani

प्रकाशित 2026-08-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zardad Khan, Amjad Ali, Najd Adeed, Saeed Aldahmani

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक घने, कोहरे से भरे जंगल के माध्यम से एक विशिष्ट गंतव्य तक पहुँचने के लिए सबसे अच्छा रास्ता खोजने की कोशिश कर रहे हैं। कंप्यूटर विज्ञान की दुनिया में, यह कुछ हद तक "मशीन लर्निंग" जैसा है, जहाँ एल्गोरिदम डेटा के आधार पर स्मार्ट अनुमान लगाने की कोशिश करते हैं। करने का एक लोकप्रिय तरीका है जिसे "k-नेरेस्ट नेबर्स" (kNN) कहा जाता है। kNN को एक ऐसे पर्यटक के रूप में सोचें जो दिशा-निर्देशों के लिए अपने आस-पास दिखने वाले पाँच सबसे नज़दीकी लोगों से पूछता है। यदि उनमें से अधिकांश पाँच लोग कहते हैं कि "बाएँ मुड़ें," तो पर्यटक बाएँ मुड़ जाता है। यह सरल है और खुले मैदानों में अच्छी तरह काम करता है, लेकिन यह घुमावदार रास्तों वाले जंगल में भ्रमित हो सकता है। यदि "बाएँ मुड़ने वाले" लोग एक लंबी, घुमावदार रेखा में खड़े हैं, तो एक पर्यटक जो केवल एक सीधी रेखा में अपने सबसे नज़दीकी लोगों को देखता है, वह पूरे समूह को मिस कर सकता है और रास्ता भटक सकता है।

यह शोध पत्र ठीक इसी समस्या से निपटता है: हम अपने डिजिटल पर्यटक को डेटा के जंगल में घुमावदार, कठिन रास्तों पर फंसने के बिना कैसे नेविगेट करने में मदद कर सकते हैं? शोधकर्ता "पड़ोसियों से पूछने" की रणनीति का एक बेहतर संस्करण बना रहे हैं। वे केवल सबसे नज़दीकी लोगों को नहीं देख रहे हैं; वे उन लोगों को खोज रहे हैं जो एक तार्किक श्रृंखला में जुड़े हुए हैं, जैसे कि एक धारा के ऊपर रखे 'स्टेपिंग स्टोन्स' (कदम रखने वाले पत्थर)। वे एक चतुर तकनीक भी उपयोग करते हैं जिसे "आउट-ऑफ-बैग" (OOB) स्क्रीनिंगिंग कहा जाता है, जो अपने स्वयं के मानचित्रों को वास्तविक यात्रा शुरू होने से पहले एक अभ्यास सत्र में टेस्ट करने वाले स्काउट्स के एक समूह जैसा है, जो केवल उन्हीं मानचित्रों को रखता है जिनसे वे रास्ता नहीं भटके।

शोध पत्र की कहानी: रास्ता खोजने का एक बेहतर तरीका

शोधकर्ताओं, ज़ार्डद खान और उनकी टीम ने एक नई विधि पेश की जिसे POSSE-kNN कहा जाता है। आप इसे खोजकर्ताओं की एक सुपर-टीम के रूप में देख सकते हैं जो एक पहेली को हल करने की कोशिश कर रहे हैं। एक अकेले खोजकर्ता द्वारा मानचित्र देखने के बजाय, वे 500 अलग-अलग "उम्मीदवार" खोजकर्ता बनाते हैं। प्रत्येक थोड़ा अलग है: वे जंगल को थोड़े अलग लेंस (रैंडम फीचर सबस्पेस) के माध्यम से देखते हैं और वे अपने पड़ोसियों को खोजने के लिए एक अनूठा रास्ता अपनाते हैं।

यहाँ उनकी विशेष "पाथवाइज" (पथ आधारित) विधि कैसे काम करती है। कल्पना करें कि आप एक क्वेरी पॉइंट (वह स्थान जहाँ आपको निर्णय लेना है) पर खड़े एक खोजकर्ता हैं।

  1. पहला कदम: आप अपने चारों ओर देखते हैं और अपने सबसे नज़दीकी व्यक्ति को खोजते हैं।
  2. चेन रिएक्शन (श्रृंखला प्रतिक्रिया): अपने अगले नज़दीकी व्यक्ति को खोजने के बजाय, आप उस पहले व्यक्ति के सबसे नज़दीकी व्यक्ति को खोजते हैं जिसे आपने अभी पाया था। फिर, आप उस व्यक्ति के सबसे नज़दीकी व्यक्ति को खोजते हैं जिसे आपने अभी खोजा था।
  3. पथ (रास्ता): आप तब तक यह प्रक्रिया करते रहते हैं जब तक कि आपके पास kk लोगों की एक श्रृंखला नहीं बन जाती। यह भीड़ के स्थानीय आकार का अनुसरण करते हुए एक "पथ" बनाता है, भले ही वह भीड़ घुमावदार या मुड़ी हुई हो। यह केवल एक सीधी रेखा में अपने सबसे नज़दीकी पाँच लोगों को चुनने की तुलना में बहुत अधिक स्मार्ट है, जो शायद एक अजीब, अनुपयोगी क्लस्टर में खड़े हों।

लेकिन रुकिए, 500 खोजकर्ता बहुत सारा शोर पैदा कर सकते हैं। कुछ लोग नेविगेट करने में खराब हो सकते हैं। इसलिए, टीम आउट-ऑफ-बैग (OOB) स्क्रीनिंग का उपयोग करती है। अंतिम दौड़ से पहले, वे प्रत्येक 500 खोजकर्ताओं को एक अभ्यास सत्र के लिए भेजते हैं जिसमें वे डेटा का उपयोग करते हैं जिस पर उन्होंने प्रशिक्षण (ट्रेन) नहीं लिया है। यदि कोई खोजकर्ता अभ्यास के दौरान रास्ता भटक जाता है, तो उसे टीम से बाहर कर दिया जाता है। शोधकर्ताओं ने खोजकर्ताओं के शीर्ष 25% (500 में से सर्वश्रेष्ठ 125) को रखा और उन्हें अंतिम उत्तर पर मतदान करने दिया। यह एक रियलिटी शो की तरह है जहाँ जज उन प्रतियोगियों को बाहर कर देते हैं जो चुनौती में विफल रहते हैं, जिससे केवल विजेता तय करने के लिए चैंपियन ही बचते हैं।

उन्होंने क्या पाया

टीम ने इस नई POSSE-kNN विधि का परीक्षण दस अलग-अलग डेटासेट्स पर किया (जो दस अलग-अलग प्रकार के जंगलों की तरह हैं, जिनमें छोटे मेडिकल रिकॉर्ड से लेकर बड़े इंजीनियरिंग डेटा तक शामिल हैं)। उन्होंने इसकी तुलना छह अन्य स्थापित विधियों से की, जिसमें मानक kNN, रैंडम फॉरेस्ट और सपोर्ट वेक्टर मशीन (SVM) शामिल हैं।

परिणाम काफी उत्साहजनक थे। सभी क्षेत्रों में, POSSE-kNN समग्र रैंकिंग में शीर्ष पर रहा।

  • सटीकता (Accuracy): इसने औसतन 0.740 बार सही उत्तर दिया। यह परीक्षण की गई सभी विधियों में सबसे अधिक स्कोर था।
  • विश्वसनीयता (Reliability): इसने कोहेन के कप्पा (0.412) (एक पैमाना कि विधि सत्य के साथ कितनी सहमत है) और ब्रियर स्कोर (0.175) (जो इसके संभाव्यता अनुमानों की आत्मविश्वास और शुद्धता को मापता है) पर भी सर्वश्रेष्ठ स्कोर किया।

यह विधि दस में से आठ डेटासेट्स पर पहले स्थान पर आई या उसके लिए टाई रही। हालाँकि, शोध पत्र सावधानी बरतते हुए यह नहीं कहता कि यह हर चीज़ के लिए एक जादुई समाधान है। दो विशिष्ट डेटासेट्स (एक जिसे ILPD और दूसरा Chscase Vine कहा जाता है) पर, अन्य विधियों ने थोड़ा बेहतर प्रदर्शन किया। उदाहरण के लिए, Chscase Vine डेटा पर, एक लीनियर विधि जिसे SVM कहा जाता है, बेहतर थी, जो सुझाव देती है कि कभी-कभी "जंगल" वास्तव में एक सीधी रेखा होता है, और एक जटिल पथ की आवश्यकता नहीं होती है।

"कितने पड़ोसी?" वाला प्रश्न

शोधकर्ताओं ने समूह के आकार के साथ भी प्रयोग किया, पड़ोसियों (kk) की संख्या को 3, 5, या 7 में बदला। उन्होंने पाया कि कुछ जंगलों (जैसे "हार्ट" डेटासेट) के लिए, विधि ने काम किया चाहे उन्होंने जो भी संख्या चुनी हो। लेकिन अन्य (जैसे "ILPD") के लिए, संख्या बदलने से ज्यादा मदद नहीं मिली, और कभी-कभी एक अलग रणनीति बेहतर थी। यह सुझाव देता है कि जबकि पाथवाइज विधि शक्तिशाली है, फिर भी आपको विशिष्ट समस्या को हल करने के लिए अपनी सेटिंग्स को ट्यून करने की आवश्यकता होती है।

निष्कर्ष

शोध पत्र निष्कर्ष निकालता है कि POSSE-kNN एक मजबूत, प्रतिस्पर्धी उपकरण है। यह सुझाव देता है कि पड़ोसियों को खोजने के एक "स्टेपिंग स्टोन" (कदम रखने वाले पत्थर) तरीके और एक सख्त "अभ्यास सत्र" फ़िल्टर को जोड़कर, हम जटिल डेटा के लिए बेहतर क्लासिफायर बना सकते हैं। यह दावा नहीं करता है कि इसने मशीन लर्निंग की दुनिया की हर समस्या को हल कर दिया है, लेकिन यह दिखाता है कि जब डेटा घुमावदार और जटिल होता है, तो एक सीधी रेखा में सबसे नज़दीकी लोगों को देखने के बजाय एक पथ का अनुसरण करना अक्सर एक बेहतर विचार होता है। लेखक नोट करते हैं कि भविष्य के कार्य को यह देखने पर ध्यान देना चाहिए कि इसे और तेज़ कैसे बनाया जाए और सेटिंग्स को स्वचालित रूप से कैसे फाइन-ट्यून किया जाए, लेकिन फिलहाल, यह वास्तविक दुनिया के जटिल, घुमावदार जंगलों में कंप्यूटरों को नेविगेट करने में मदद करने के लिए एक ठोस कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →