← नवीनतम पेपर
📊 statistics

Winning by Peeking: Unenforced Budgets and Test-Set Selection Inflate Short-Budget AutoML Comparisons

यह शोध पत्र प्रदर्शित करता है कि कम-बजट वाले AutoML तुलनात्मक अध्ययन अक्सर टेस्ट-सेट चयन पूर्वाग्रह और लागू न किए गए समय सीमा जैसे प्रोटोकॉल दोषों के कारण अतिरंजित होते हैं, जो यह दर्शाता है कि एक विशिष्ट केस स्टडी में इन समस्याओं को सुधारने से एक पूर्व में प्रभावी सिस्टम की जीत की दर ढह गई और प्रतिस्पर्धियों पर इसके सांख्यिकीय रूप से महत्वपूर्ण लाभ समाप्त हो गए।

मूल लेखक: Guilin Zhang, Kai Zhao

प्रकाशित 2026-08-10
📖 10 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guilin Zhang, Kai Zhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक ऐसी दुनिया है जहाँ वैज्ञानिक "सीखने वाली मशीनें" (learning machines) बनाते हैं जो डेटा के स्प्रेडशीट को देख सकती हैं—जैसे घरों की कीमतों या मेडिकल रिकॉर्ड की सूची—और यह पता लगा सकती हैं कि भविष्य की भविष्यवाणी कैसे की जाए। इस क्षेत्र को AutoML (ऑटोमेटेड मशीन लर्निंग) कहा जाता है। इसका लक्ष्य यह है कि कंप्यूटर अपने आप हजारों अलग-अलग गणितीय तरीकों को आजमा सके ताकि वह सबसे अच्छा काम करने वाले तरीके को खोज सके। आमतौर पर, इन मशीनों का परीक्षण घंटों तक चलने वाले लंबे, सावधानीपूर्ण मैराथन में किया जाता है, जहाँ उन्हें सख्ती से निगरानी में रखा जाता है ताकि वे नियमों का उल्लंघन न करें। लेकिन वास्तविक दुनिया में, डेवलपर्स अक्सर त्वरित परिणाम चाहते हैं। वे इन मशीनों को केवल 30 या 60 सेकंड के लिए चलाते हैं ताकि यह देख सकें कि कौन सा सबसे तेज़ विजेता है। यह एक मैराथन के बजाय एक स्प्रिंट (तेज़ दौड़) की तरह है। समस्या यह है कि जब आप इतनी तेज़ दौड़ लगाते हैं, तो अनजाने में ही नियम तोड़ना बहुत आसान हो जाता है, जिससे एक धीमा और अनाड़ी धावक एक विश्व-रिकॉर्ड बनाने वाले स्प्रिंटर जैसा दिखने लगता है।

यह शोध पत्र एक ऐसे शोधकर्ता की कहानी बताता है जिसने अपनी खुद की एक छोटी, सरल सीखने वाली मशीन "Orcetra" बनाई। उन्होंने इसे दो प्रसिद्ध, भारी-भरकम दिग्गजों (FLAML और AutoGluon) के खिलाफ 513 त्वरित 60-सेकंड की दौड़ में उतारा। पहली नज़र में, परिणाम अद्भुत लग रहे थे: Orcetra ने आधे से अधिक दौड़ जीती, और दिग्गजों को बहुत बड़े अंतर से पीछे छोड़ दिया। संख्याएँ इतनी सटीक थीं, और गणित इतना विश्वसनीय था, कि यह एक बड़ी सफलता लग रही थी। लेकिन लेखकों को एहसास हुआ कि वे अपने ही प्रयोग के झांसे में आ गए थे। उन्होंने पाया कि Orcetra वास्तव में स्मार्ट नहीं था; यह केवल दो बहुत ही चालाकी भरे तरीकों से नियमों का उल्लंघन कर रहा था। पहला, यह अभ्यास करते समय "उत्तर कुंजी" (टेस्ट डेटा) पर नज़र डाल रहा था, जिससे इसे कौशल के बजाय भाग्य के आधार पर विजेता चुनने में मदद मिली। दूसरा, इसने स्टॉपवॉच को अनदेखा कर दिया, और अन्य मशीनों की तुलना में दोगुना समय चलते हुए भी यह दिखावा करता रहा कि यह उसी समय पर रुक गया है। जब शोधकर्ताओं ने नियमों को ठीक किया, नज़र रखने (peeking) को रोका, और समय सीमा को लागू किया, तो Orcetra की "सुपरपावर्स" गायब हो गईं। यह एक चैंपियन से घटकर केवल औसत दर्जे का रह गया, जिससे यह साबित हुआ कि त्वरित AI परीक्षणों की दुनिया में, आप दौड़ को कैसे मापते हैं, यह इस बात से कहीं अधिक महत्वपूर्ण है कि आप कितनी तेज़ दौड़ते हैं।

सेटअप: एक टूटे हुए स्टॉपवॉच वाली दौड़

कहानी को समझने के लिए, आइए तीनों धावकों को देखें। FLAML और AutoGluon पेशेवर एथलीटों की तरह हैं जो घंटों प्रशिक्षण लेते हैं। वे जटिल, शक्तिशाली सिस्टम हैं जिन्हें लंबी अवधि में सर्वोत्तम समाधान खोजने के लिए डिज़ाइन किया गया है। Orcetra, जिसे शोध पत्र के लेखकों ने बनाया है, एक कमजोर दावेदार (underdog) है। यह केवल 1,661 लाइनों के कोड से लिखा गया एक छोटा, सरल स्क्रिप्ट है। इसमें कोई फैंसी ट्रिक्स नहीं हैं; यह बस कई मानक गणितीय मॉडल आज़माता है, सबसे अच्छा चुनता है, और आगे बढ़ जाता है।

शोधकर्ताओं ने एक "स्प्रिंट" प्रतियोगिता आयोजित की। उन्होंने 513 अलग-अलग डेटासेट लिए और हर मशीन को सर्वोत्तम भविष्यवाणी खोजने के लिए ठीक 60 सेकंड दिए। पहले दौर में, अपने मूल नियमों का उपयोग करते हुए, Orcetra एक चमत्कार की तरह दिखा। इसने अन्य दो के मुकाबले 57.1% दौड़ जीतीं, जबकि दिग्गज क्रमशः 21.6% और 10.9% ही जीत पाए। केवल FLAML के खिलाफ 30-सेकंड की स्प्रिंट में, Orcetra ने चौंका देने वाले 78.4% बार जीत हासिल की। गणित कह रहा था कि यह एक बड़ी, निर्विवाद जीत थी।

लेकिन लेखकों को संदेह हुआ कि कुछ गलत है। उन्होंने अपने स्वयं के प्रयोग का ऑडिट करने का निर्णय लिया, उन "भूतों" की तलाश करने के लिए जो उनकी मशीन में हो सकते थे और जिनके कारण ये नकली जीतें हुई थीं।

पहला दोष: "नज़र रखने" (Peeking) की समस्या

पहला बड़ा दोष यह था कि Orcetra अपना विजेता कैसे चुनता था। कल्पना कीजिए कि एक छात्र अभ्यास परीक्षा दे रहा है। एक ईमानदार छात्र पढ़ाई करता है, परीक्षा देता है, और फिर एक स्कोर प्राप्त करता है। लेकिन Orcetra कुछ अलग कर रहा था। वह अभ्यास परीक्षा ले रहा था, उत्तर देख रहा था, और फिर से परीक्षा दे रहा था, बार-बार।

तकनीकी शब्दों में, मशीन अपने द्वारा आजमाए गए प्रत्येक मॉडल को टेस्ट स्प्लिट (वह डेटा जो अंतिम परीक्षा के लिए है) के विरुद्ध स्कोर कर रही थी। इसने 60 सेकंड में दर्जनों मॉडल आजमाए, टेस्ट डेटा पर उनके प्रदर्शन की जांच की, और फिर बस अपना सर्वश्रेष्ठ स्कोर रिपोर्ट कर दिया। यह सिलेक्शन बायस (चयन पूर्वाग्रह) नामक एक क्लासिक जाल है।

इसे पासा फेंकने की तरह सोचिए। यदि आप एक बार पासा फेंकते हैं, तो आपको एक रैंडम नंबर मिलता है। लेकिन यदि आप 50 बार पासा फेंकते हैं और मुझे केवल उच्चतम संख्या दिखाते हैं, तो मुझे लग सकता है कि आपके पास एक जादुई पासा है जो हमेशा छह ही लाता है। वास्तव में, आपने बस भाग्यशाली होने के लिए पर्याप्त बार पासा फेंका था। क्योंकि Orcetra ने बहुत सारे मॉडल आजमाए और टेस्ट डेटा के आधार पर "सबसे भाग्यशाली" वाला चुना, इसलिए इसका स्कोर कृत्रिम रूप से बढ़ गया। अन्य मशीनें, FLAML और AutoGluon, ईमानदार थीं: उन्होंने केवल प्रशिक्षण डेटा (training data) का उपयोग करके अपने सर्वश्रेष्ठ मॉडल को चुना और टेस्ट डेटा को केवल अंत में एक बार देखा।

दूसरा दोष: "लूपहोल" स्टॉपवॉच

दूसरा दोष और भी भौतिक था। प्रयोग का एक नियम था: "60 सेकंड के बाद रुकें।"

FLAML और AutoGluon ने इस नियम का सम्मान किया। यदि वे 60 सेकंड के समय पर गणना के बीच में थे, तो वे रुक जाते या जल्दी समाप्त करने की कोशिश करते। वे अनुशासित थे। हालाँकि, Orcetra में इसके लॉजिक में एक बग था। इसने एक नया कार्य शुरू करने से पहले समय की जाँच की, लेकिन एक बार कार्य शुरू होने के बाद, इसे इससे कोई फर्क नहीं पड़ा कि समय समाप्त हो गया है या नहीं। यह एक गणना को तब तक चलने देता था जब तक वह चाहे।

डेटा से पता चला कि जबकि बजट 60 सेकंड निर्धारित किया गया था, Orcetra वास्तव में 120 सेकंड के औसत (median) तक चला—यानी सीमा से दोगुना लंबा! वास्तव में, इसने 78% डेटासेट पर समय सीमा का उल्लंघन किया। इस बीच, अन्य मशीनें 60-सेकंड के करीब रहीं। यह एक ऐसी दौड़ की तरह है जहाँ अन्य धावक फिनिश लाइन पर रुक जाते हैं, लेकिन Orcetra एक और चक्कर लगाने के लिए दौड़ता रहता है, जिससे उसे समस्या हल करने के लिए बहुत अधिक समय मिल जाता है। "60-सेकंड" का लेबल Orcetra के लिए केवल एक सुझाव था, नियम नहीं।

तीसरा ग्लिच: "स्प्लिस" (Spliced) परिणाम

लेखक द्वारा लिखते समय एक तीसरा, छोटा मुद्दा भी पाया गया। शोधकर्ताओं ने बाद में एक दूसरा प्रयोग चलाया था, लेकिन उन्होंने अनजाने में पहले रन के परिणामों को दूसरे रन के साथ मिला दिया था जब वे जीत की गिनती कर रहे थे। इस "स्प्लिसिंग" ने Orcetra को उसकी वास्तविकता से भी बेहतर दिखाया, जिससे उसकी जीत की दर कुछ गणनाओं में बढ़कर 61.2% हो गई। जब उन्होंने रनों को अलग किया, तो संख्याएँ वापस नीचे आ गईं। यह एक साधारण मानवीय त्रुटि थी, लेकिन इसने दिखाया कि यदि आप अपनी फाइलों के साथ सावधान नहीं हैं, तो परिणाम कितनी आसानी से बिगड़ सकते हैं।

महान सुधार: निष्पक्ष रूप से दौड़ना

सच्चाई जानने के लिए, लेखकों ने एक नए, सख्त प्रोटोकॉल के साथ पूरा प्रयोग फिर से चलाया। उन्होंने तीन समस्याओं को ठीक किया:

  1. अब नज़र नहीं डालना (No more peeking): Orcetra को एक "वैलिडेशन" सेट (एक अभ्यास परीक्षा) का उपयोग करके अपना सर्वश्रेष्ठ मॉडल चुनना था, और फिर केवल अंत में एक ही बार "टेस्ट" सेट (अंतिम परीक्षा) को देखना था, ठीक अन्य मशीनों की तरह।
  2. सख्त समय सीमा: उन्होंने प्रक्रिया को मारने के लिए एक बाहरी टाइमर का उपयोग किया यदि यह 60 सेकंड से ऊपर जाती, यह सुनिश्चित करने के लिए कि किसी को अतिरिक्त समय न मिले।
  3. निष्पक्ष संसाधन: उन्होंने सुनिश्चित किया कि सभी मशीनों को समान मात्रा में कंप्यूटर पावर मिले ताकि कोई भी केवल अधिक कोर होने के कारण तेज़ न हो।

परिणाम: जादू गायब हो जाता है

जब उन्होंने निष्पक्ष रूप से दौड़ आयोजित की, तो "चमत्कार" गायब हो गया।

  • मूल (नियमों का उल्लंघन करने वाला) जीत दर: Orcetra ने पुन: चलाए गए सबसेट में 59.4% जीत हासिल की।
  • सुधारित (निष्पक्ष) जीत दर: Orcetha की जीत दर गिरकर 34.3% रह गई।

निष्पक्ष दौड़ में, Orcetra अब दिग्गजों को नहीं हरा रहा था। उसने 34.3% बार जीत हासिल की, जबकि FLAML ने 28.0% और AutoGluon ने 27.3% बार जीत हासिल की। अंतर इतना कम था कि यह आसानी से केवल संयोग (random chance) हो सकता था। सांख्यिकीय "महत्व" (statistical significance), जिसने मूल परिणामों को एक बड़ी खोज बना दिया था, पूरी तरह से गायब हो गया (p-values 9.5 × 10⁻⁴⁶ से बदलकर 0.39 हो गए, जो कि लगभग एक सिक्के के उछाल जैसा है)।

हमने क्या सीखा?

शोध पत्र निष्कर्ष निकालता है कि यह "जीत" एक भ्रम था जो दो मुख्य कारकों द्वारा बनाया गया था:

  1. नज़र रखना (Peeking/Selection Bias): इसने जीत दर में लगभग 4.8 प्रतिशत अंक का योगदान दिया। यह वास्तविक था, लेकिन छोटा था।
  2. अतिरिक्त समय (Compute): यह सबसे बड़ा कारक था। क्योंकि Orcetra अन्य की तुलना में दोगुना समय तक चला, इसलिए उसे अधिक मॉडल आज़माने का मौका मिला। इस अनुचित लाभ ने बाकी की बड़ी जीत दर को समझाया।

लेखकों ने यह भी मापा कि "नज़र रखने" से वास्तव में कितना लाभ होता है। उन्होंने पाया कि हालांकि नज़र रखने से थोड़ा बढ़ावा मिलता है, लेकिन यह उतना बड़ा नहीं है जितना कि कुछ गणितीय सिद्धांत भविष्यवाणी करते हैं। चूंकि सभी मॉडलों का परीक्षण एक ही डेटा पर किया गया था, इसलिए "भाग्य" ने काफी हद तक प्रभाव को बेअसर कर दिया। यह उछाल लगभग 0.27 सटीकता अंक था, जो उनके द्वारा देखे गए विशाल अंतर की तुलना में बहुत कम था।

सभी के लिए सीख

यह कहानी केवल एक कोड के बारे में नहीं है; यह उन लोगों के लिए एक चेतावनी है जो तेज़ AI टूल की तुलना कर रहे हैं। यदि आप 60-सेकंड का परीक्षण चलाते हैं, तो आपको बहुत सावधान रहना होगा।

  • टेस्ट डेटा को देखने न दें: सुनिश्चित करें कि मशीन अंतिम उत्तर देखने से पहले अपना विजेता चुन ले।
  • समय सीमा लागू करें: यदि आप 60 सेकंड कहते हैं, तो सुनिश्चित करें कि वह 60 सेकंड पर ही रुके।
  • घड़ी की जाँच करें: हमेशा यह रिपोर्ट करें कि मशीन वास्तव में कितनी देर तक चली, न कि केवल वह जो आपने उसे चलाने के लिए कहा था।

शोध पत्र उन लोगों के लिए एक चेकलिस्ट के साथ समाप्त होता है जो इन त्वरित तुलनाओं को कर रहे हैं। यह सुझाव देता है कि यदि आप देखते हैं कि कोई सिस्टम कम समय में बहुत बड़े अंतर से जीत रहा है, तो यह संभवतः इसलिए नहीं है कि वह स्मार्ट है—बल्कि इसलिए है क्योंकि उसने नियमों का उल्लंघन किया है। मूल दौड़ का "विजेता" कोई जीनियस नहीं था; वह केवल एक ऐसा धावक था जिसने रेफरी की सीटी को अनदेखा कर दिया था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →