← नवीनतम पेपर
💻 computer science

An Audit of Machine Learning Experiments on Software Defect Prediction

यह शोध पत्र 2019 और 2023 के बीच प्रकाशित 101 सॉफ्टवेयर दोष भविष्यवाणी अध्ययनों का ऑडिट करता है, जो प्रयोगात्मक डिजाइन और रिपोर्टिंग में व्यापक विसंगतियों को प्रकट करता है जो पुनरुत्पादकता को गंभीर रूप से सीमित करती हैं और बेहतर अनुसंधान प्रथाओं की महत्वपूर्ण आवश्यकता को रेखांकित करती हैं।

मूल लेखक: Giuseppe Destefanis, Leila Yousefi, Martin Shepperd, Allan Tucker, Stephen Swift, Steve Counsell, Mahir Arzoky

प्रकाशित 2026-01-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Giuseppe Destefanis, Leila Yousefi, Martin Shepperd, Allan Tucker, Stephen Swift, Steve Counsell, Mahir Arzoky

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक विशाल, हलचल भरी रसोई है जहाँ हज़ारों शेफ (शोधकर्ता) एक नया नुस्खा बनाने की कोशिश कर रहे हैं ताकि यह अनुमान लगाया जा सके कि एक विशाल गोदाम में कौन सी सामग्री खराब होने वाली है (सॉफ्टवेयर दोष)। वे सभी दावा करते हैं कि उनके पास सबसे अच्छा "मशीन लर्निंग" का नुस्खा है। लेकिन हमें कैसे पता चलेगा कि उनके नुस्खे वास्तव में काम करते हैं, या वे केवल कागज़ पर अच्छे दिखते हैं?

यह पेपर एक स्वास्थ्य निरीक्षक (हेल्थ इंस्पेक्टर) की तरह है जो उस रसोई में जाकर पिछले पाँच वर्षों के खाना पकाने का ऑडिट करता है। भोजन को चखने के बजाय, निरीक्षकों ने नुस्खों (प्रयोगों) की जाँच की कि क्या शेफ ने विज्ञान के बुनियादी नियमों का पालन किया, अपनी सामग्रियों की ईमानदारी से रिपोर्ट की, और पर्याप्त नोट्स छोड़े ताकि कोई और बाद में वही व्यंजन बना सके।

यहाँ ऑडिट का निष्कर्ष दिया गया है, जिसे सरल भाषा में समझाया गया है:

1. "नुस्खे" की अराजकता (The "Recipe" Chaos)

निरीक्षकों ने पाया कि हर शेफ अलग-अलग तरीके से काम कर रहा था।

  • सामग्रियाँ (The Ingredients): कुछ शेफ ने केवल एक डेटासेट (सामग्रियों का एक ढेर) का उपयोग किया, जबकि अन्य ने 365 अलग-अलगों का। यह एक अजीब मिश्रण था।
  • औज़ार (The Tools): उन्होंने कहीं 1 तो कहीं 34 अलग-अलग "लर्नर्स" (खाना पकाने के तरीके) का उपयोग किया।
  • स्कोरकार्ड (The Scorecards): उन्होंने सफलता को मापने के लिए अलग-अलग स्कोरकार्ड का उपयोग किया। कुछ ने "F1" या "एक्यूरेसी" (सटीकता) जैसे मीट्रिक का उपयोग किया, जिसके बारे में निरीक्षकों ने चेतावनी दी कि ये एक दौड़ को इस आधार पर आंकने जैसे हैं कि कितने लोग फिनिश लाइन तक पहुँचे, इस बात को नज़रअंदाज़ करते हुए कि क्या उन्होंने वास्तव में सही दूरी तय की थी। ये स्कोर भ्रामक हो सकते हैं, खासकर जब "खराब" सामग्रियाँ दुर्लभ हों।

2. "ब्लाइंड टेस्ट" की समस्या (The "Blind Taste Test" Problem)

एक निष्पक्ष प्रयोग में, आपको अपने नुस्खे का परीक्षण उन नई सामग्रियों पर करना चाहिए जिन्हें आपने पहले कभी नहीं पकाया है। इसे "आउट ऑफ सैंपल" (Out of Sample) वैलिडेशन कहा जाता है।

  • समस्या: लगभग 35% शेफों ने ऐसा नहीं किया। उन्होंने अपने नुस्खे का परीक्षण उन्हीं सामग्रियों पर किया जिनका उपयोग उन्होंने सीखने के लिए किया था। यह एक शेफ द्वारा सूप में नमक डालते समय ही सूप को चखने जैसा है। बेशक, यह स्वादिष्ट लगेगा! लेकिन इसका मतलब यह नहीं है कि यह ग्राहक के लिए भी स्वादिष्ट होगा।
  • परिणाम: कई अध्ययनों ने दावा किया कि उनके नुस्खे बेहतरीन थे, लेकिन हो सकता है कि वे केवल सामग्रियों को याद कर रहे थे, न कि खाना बनाना सीख रहे थे।

3. "नोट्स की कमी" (The "Missing Notes" - Reproducibility)

यदि आपको किसी पत्रिका में एक शानदार नुस्खा मिलता है, तो आप उम्मीद करते हैं कि आप उसे स्वयं बना सकेंगे। निरीक्षकों ने जाँच की कि क्या पेपर्स ने पर्याप्त नोट्स (कोड, डेटा लिंक, विशिष्ट सेटिंग्स) छोड़े हैं ताकि अन्य लोग अपने परिणामों को दोहरा सकें।

  • स्कोर: औसत "पुनरुत्पादकता स्कोर" (reproducibility score) केवल 52% था। इसका मतलब है कि यदि आप इन व्यंजनों को बनाने की कोशिश करते हैं, तो आपके पास आधे निर्देश गायब होंगे।
  • पेवॉल (Paywall): लगभग आधे पेपर्स एक "पेवॉल" (जैसे कि एक बंद दरवाज़ा) के पीछे थे। नुस्खा देखने के लिए आपको भुगतान करना पड़ता था। निरीक्षकों ने नोट किया कि यदि आप नुस्खा देख ही नहीं सकते, तो आप इसकी जाँच कैसे करेंगे कि यह असली है या नहीं।
  • टूटे हुए लिंक (Broken Links): भले ही डेटा के लिंक दिए गए थे, फिर भी लगभग 35% लिंक टूटे हुए थे (जैसे कि किसी किराने की दुकान का लिंक जो अब अस्तित्व में नहीं है)।

4. "पेपर मिल" का संदेह (The "Paper Mill" Suspicion)

निरीक्षकों को दो बहुत अजीब पेपर्स मिले। लेखकों ने "नए कीड़ों" (new bugs) के बजाय "अनोखे कीटों" (novel insects) और "दोषों के विश्लेषण" (analyzing defects) के बजाय "विकृतियों की व्यवस्था" (arranging of deformities) जैसे अजीब, मनगढ़ंत वाक्यांशों का उपयोग किया।

  • रूपक (Metaphor): यह एक शेफ द्वारा ऐसा नुस्खा लिखने जैसा है जिसमें वह "नमक" के बजाय "फ्लफ़नटर का एक चुटकी" डालने को कहता है। यह "पेपर मिल" के लिए एक रेड फ्लैग है—ऐसे कारखाने जो केवल प्रकाशित होने के लिए नकली या निम्न-गुणवत्ता वाले वैज्ञानिक पेपर बनाते हैं, जो अक्सर टेक्स्ट को भाषाओं के बीच आगे-पीछे अनुवाद करके बनाया जाता है जब तक कि वह निरर्थक लगने लगे।

5. "जादुई संख्या" का जाल (The "Magic Number" Trap)

कई शेफों ने अपने प्रयोग दर्जनों बार चलाए और किसी भी ऐसे परिणाम की तलाश की जो "सांख्यिकीय रूप से महत्वपूर्ण" (statistically significant) दिखता था (जैसे कि बहुत सारे टिकट खरीदकर जीतने वाली लॉटरी टिकट ढूंढना)।

  • समस्या: उन्होंने इतने सारे परीक्षण करने के लिए अपने नियमों को समायोजित नहीं किया। यह 100 बार सिक्का उछालने और यह दावा करने जैसा है कि आपने एक "जादुई पैटर्न" खोज लिया है क्योंकि आपको एक बार लगातार 10 बार 'हेड्स' मिला। निरीक्षकों ने पाया कि कई अध्ययनों ने यह गलती की, जिससे उनके "निष्कर्ष" केवल भाग्य या संयोग लगने लगे।

6. जर्नल बनाम कॉन्फ्रेंस (मैगज़ीन बनाम फ्लायर)

निरीक्षकों ने विस्तृत जर्नल्स (Jour-nals) और छोटे कॉन्फ्रेंस पेपर्स के बीच अंतर देखा।

  • निष्कर्ष: जर्नल पेपर्स थोड़े बेहतर थे। उनमें अधिक पूर्ण नोट्स, कम टूटे हुए लिंक और कम गलतियाँ थीं। यह एक पूरी रेसिपी वाली कुकबुक बनाम केवल सामग्रियों की सूची वाले फ्लायर जैसा है। जर्नल्स में अधिक स्थान और सख्त समीक्षा प्रक्रिया ने मदद की।

निचोड़ (The Bottom Line)

ऑडिट ने निष्कर्ष निकाला कि हालांकि इस क्षेत्र में बहुत प्रयास किए जा रहे हैं (पाँच वर्षों में 1,500 से अधिक अध्ययन), लेकिन गुणवत्ता डगमगा रही है।

  • अच्छी खबर: अधिकांश समस्याएँ कठिन नहीं हैं। बस शेफ को अपने चरणों को स्पष्ट रूप से लिखने, बेहतर स्कोरकार्ड का उपयोग करने और नई सामग्रियों पर परीक्षण करने की आवश्यकता है।
  • बुरी खबर: वर्तमान में, यदि आप इन प्रयोगों को दोहराने की कोशिश करते हैं, तो आप विफल हो जाएंगे क्योंकि निर्देश गायब हैं या गणित त्रुटिपूर्ण है।

संक्षेप में: यह क्षेत्र क्षमता से भरा है, लेकिन अभी, यह एक ऐसी रसोई की तरह है जहाँ आधे शेफ अपना नुस्खा लिखना भूल गए हैं, और जो लिखे भी हैं, वे ऐसी भाषा में हैं जिसका कोई अर्थ नहीं निकलता। निरीक्षक सभी से अपनी रसोई साफ करने के लिए कह रहे हैं ताकि हम वास्तव में भोजन खा सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →