← नवीनतम पेपर
🤖 machine learning

Enhancing Automated Machine Learning via Homogeneous Train-Test Splitting Methods

यह शोध पत्र एक अनुकूलित-वितरण (Optimised-Distribution) विधि का प्रस्ताव करता है जो उपसमुच्चयों के बीच सांख्यिकीय समानता को स्पष्ट रूप से अधिकतम करने के लिए ट्रेन-टेस्ट स्प्लिटिंग करती है, जो पंद्रह UCI डेटासेट में पांच स्थापित रणनीतियों से बेहतर प्रदर्शन करते हुए 89.0% का उच्चतम माध्य MMD समानता स्कोर प्राप्त करती है और वितरण बेमेल के कारण होने वाली मूल्यांकन अस्थिरता को कम करती है।

मूल लेखक: Yearn Tan Yin Tze, Charles Grellois

प्रकाशित 2026-07-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yearn Tan Yin Tze, Charles Grellois

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जो एक बेहतरीन पिज्जा के लिए एक नई रेसिपी बनाने की कोशिश कर रहे हैं। यह जानने के लिए कि आपकी रेसिपी वास्तव में स्वादिष्ट है या नहीं, आप केवल अपने द्वारा बनाए गए पिज्जा को चखकर काम नहीं चला सकते; आपको अजनबियों के साथ एक 'ब्लाइंड टेस्ट' (बिना देखे चखने का परीक्षण) करने की आवश्यकता है। लेकिन यहाँ एक पेंच है: यदि आप अजनबियों को केवल पिज्जा के वे स्लाइस देते हैं जो बिल्कुल वैसे ही हैं जैसे आपने अभ्यास किया था, तो उन्हें लग सकता है कि आपका पिज्जा अद्भुत है जबकि वास्तव में वह केवल औसत दर्जे का हो सकता है। कंप्यूटर विज्ञान की दुनिया में, विशेष रूप से मशीन लर्निंग नामक एक क्षेत्र में, कंप्यूटर डेटा का अध्ययन करके सीखते हैं, ठीक वैसे ही जैसे एक शेफ सामग्रियों का अध्ययन करता है। यह देखने के लिए कि कंप्यूटर ने अच्छी तरह से सीखा है या नहीं, वैज्ञानिक अपने डेटा को दो ढेरों में विभाजित करते हैं: एक "प्रशिक्षण" (training) ढेर जिसे कंप्यूटर अध्ययन के लिए उपयोग करता है, और एक "परीक्षण" (testing) ढेर जिसका उपयोग कंप्यूटर बाद में अपने कौशल को सिद्ध करने के लिए करता है।

बड़ा सवाल यह है कि आप उस डेटा को कैसे विभाजित करते हैं? यदि आप डेटा को बस बेतरतीब ढंग से दो ढेरों में फेंक देते हैं, तो आप गलती से कंप्यूटर को अध्ययन के लिए सभी आसान उदाहरण दे सकते हैं और परीक्षण के लिए सभी कठिन उदाहरण छोड़ सकते हैं। या, यदि डेटा में छिपे हुए पैटर्न हैं (जैसे कि एक जैसे दिखने वाली सामग्रियों का एक समूह), तो एक रैंडम स्प्लिट (बेतरतीब विभाजन) उन्हें पूरी तरह से छोड़ सकता है। यह एक बहुत बड़ी बात है क्योंकि यदि विभाजन अनुचित है, तो कंप्यूटर सोच सकता है कि वह एक जीनियस है जबकि वास्तव में वह केवल भाग्यशाली है, या वह सोच सकता है कि वह एक विफलता है जबकि वास्तव में वह प्रतिभाशाली है। इस विभाजन को सही करना एक ऐसे कंप्यूटर और एक ऐसे कंप्यूटर के बीच का अंतर है जो वास्तविक दुनिया में काम करता है और एक ऐसा जो विफल हो जाता है।

यह शोध पत्र, जिसे यर्न टैन यिन त्ज़े और चार्ल्स ग्रेलोइस द्वारा लिखा गया है, एक कठोर स्वाद-परीक्षण प्रतियोगिता की तरह है यह देखने के लिए कि डेटा को विभाजित करने का कौन सा तरीका सबसे निष्पक्ष है। लेखकों ने डेटा को विभाजित करने के पांच अलग-अलग तरीकों को देखा, जिसमें कुछ पुराने तरीके और एक बिल्कुल नया तरीका शामिल है जिसे उन्होंने "ऑप्टिमाइज्ड-डिस्ट्रीब्यूशन" (Optimised-Distribution) नाम दिया है। उन्होंने पंद्रह अलग-अलग डेटासेट्स पर इन तरीकों का परीक्षण किया, जो लगभग 150 वस्तुओं के छोटे संग्रह से लेकर 250,000 से अधिक प्रविष्टियों वाले विशाल डेटाबेस तक विस्तृत थे।

शोधकर्ताओं ने पाया कि विशेषज्ञों द्वारा उपयोग किए जाने वाले कुछ लोकप्रिय, फैंसी तरीके वास्तव में विभाजन को और भी खराब बना देते हैं। उन्होंने पाया कि प्रशिक्षण सेट के लिए सबसे "विविध" या "चरम" उदाहरणों को चुनने के लिए डिज़ाइन किए गए तरीके (जैसे कि केनार्ड-स्टोन और SPXY एल्गोरिदम) अक्सर एक ऐसा प्रशिक्षण ढेर बनाते हैं जो परीक्षण ढेर जैसा बिल्कुल नहीं होता। यह ऐसा ही है जैसे आपने एक शेफ को केवल तीखे, जले हुए और अजीब आकार के पिज्जा पर प्रशिक्षित किया हो, और फिर उनसे एक सामान्य, ताज़ा पिज्जा का न्याय करने के लिए कहा हो। शेफ भ्रमित हो जाएगा, और परिणाम अस्त-व्यस्त हो जाएंगे। वास्तव में, इन फैंसी विधियों ने "एमएमडी" (MMD) नामक एक "समानता परीक्षण" पर शून्य के करीब स्कोर किया, जिसका अर्थ है कि दोनों ढेर मौलिक रूप से भिन्न थे।

दूसरी ओर, लेखकों का नया तरीका, "ऑप्टिमाइज्ड-डिस्ट्रीब्यूशन", ने इस विभाजन को एक संतुलन बनाने वाले कार्य की तरह माना। केवल रैंडम नमूने लेने या सबसे चरम नमूनों को चुनने के बजाय, इसने लगातार डेटा के टुकड़ों को प्रशिक्षण और परीक्षण ढेरों के बीच जांचा और बदला ताकि यह सुनिश्चित हो सके कि वे सांख्यिकीय रूप से समान दिखें। इस विधि ने प्रतियोगिता जीती, जिसने औसतन 89.0% का समानता स्कोर प्राप्त किया, जो परीक्षण किए गए सभी रणनीतियों में सबसे अधिक था।

हालाँकि, यह शोध पत्र एक बहुत ही महत्वपूर्ण वास्तविकता की जांच भी प्रदान करता है। लेखकों ने पाया कि हालांकि एक आदर्श विभाजन होना अच्छी बात है, लेकिन यह हमेशा अंतिम स्कोर को नहीं बदलता है। यदि डेटा बहुत बड़ा है (जैसे 253,680 प्रविष्टियों वाला डेटासेट) या समझने में बहुत आसान है, तो एक रैंडम स्प्लिट भी ठीक काम करता है क्योंकि कंप्यूटर के पास इतनी जानकारी होती है कि वह सही पैटर्न सीख ही लेगा। नया तरीका तब सबसे अधिक चमकता है जब डेटा छोटा, अव्यवस्थित या जटिल होता है। उन विशिष्ट स्थितियों में, एक बुरा विभाजन कंप्यूटर को बेकार दिखा सकता है, जबकि लेखकों का नया तरीका उसे बहुत अधिक विश्वसनीय रूप से प्रदर्शन करने में मदद करता है। इसलिए, भले ही आपको हमेशा एक पूर्ण विभाजन की आवश्यकता न हो, जब आप सीमित या कठिन डेटा के साथ काम कर रहे हों, तो पाई (pie) को विभाजित करने का यह नया तरीका यह सुनिश्चित करता है कि कंप्यूटर को अपने वास्तविक कौशल को सिद्ध करने का एक निष्पक्ष अवसर मिले।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →