← नवीनतम पेपर
💻 computer science

Double descent for least-squares interpolation on contaminated data: A simulation study

यह सिमुलेशन अध्ययन प्रदर्शित करता है कि दूषित डेटा वाले लीनियर रिग्रेशन में, अत्यधिक ओवरपैरामीटराइज्ड लीस्ट-स्क्वेयर्स इंटरपोलेटर्स 'डबल डिसेंट' घटना प्रदर्शित कर सकते हैं, जो अंततः मजबूत वैकल्पिक एस्टिमेटर्स की तुलना में बेहतर सामान्यीकरण प्रदर्शन प्राप्त करते हैं।

मूल लेखक: Tino Werner

प्रकाशित 2026-05-22✓ Author reviewed
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tino Werner

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को पिछले डेटा के आधार पर मौसम की भविष्यवाणी करना सिखाने की कोशिश कर रहे हैं। आमतौर पर, सांख्यिकीविद् (statisticians) का एक सुनहरा नियम होता है: "अपने रोबोट को बहुत अधिक स्मार्ट न बनाएं।" यदि आप इसे याद करने के लिए बहुत अधिक नियम (पैरामीटर्स) दे देते हैं, तो यह पिछले सप्ताह के मौसम को ही रट लेगा (overfitting) और अगले सप्ताह के मौसम की भविष्यवाणी करने में विफल हो जाएगा। आप एक "गोल्डिलॉक्स" (Goldilocks) मॉडल चाहते हैं—न बहुत सरल, न बहुत जटिल।

लेकिन हाल ही में, वैज्ञानिकों ने एक अजीब घटना की खोज की जिसे "डबल डिसेंट" (Double Descent) कहा जाता है। यह एक रोलरकोस्टर की तरह है जहाँ जैसे-जैसे आप अधिक नियम जोड़ते हैं, सवारी डरावनी (उच्च त्रुटि/error) हो जाती है, लेकिन फिर, यदि आप और भी अधिक नियम जोड़ते हैं, तो सवारी अचानक फिर से सुचारू हो जाती है, और आपका रोबोट अविश्वसनीय रूप से सटीक हो जाता है। ऐसा तब होता है जब रोबोट इतना "शक्तिशाली" (overparametrized) हो जाता है कि वह अराजकता के बीच एक छिपा हुआ, सरल पैटर्न ढूंढ लेता है।

समस्या: "गंदा" डेटा (The "Gross" Data)
वास्तविक दुनिया का डेटा अव्यवस्थित होता है। कभी-कभी, कोई सेंसर खराब हो जाता है, या कोई टाइपिंग की गलती हो जाती है, जिससे "आउटलेयर्स" (outliers) पैदा होते हैं—ऐसे डेटा पॉइंट्स जो पूरी तरह से गलत होते हैं (जैसे कि बर्फबारी के बीच तापमान 100°F बताना)।

  • शास्त्रीय मजबूत सांख्यिकी (Classical Robust Statistics): पारंपरिक रूप से, विशेषज्ञ कहते हैं, "यदि डेटा अव्यवस्थित है, तो हमें विशेष, सावधानीपूर्ण उपकरणों (robust estimators) का उपयोग करना चाहिए ताकि खराब बिंदुओं को अनदेखा किया जा सके।" उनका मानना है कि यदि आप अव्यवस्थित डेटा पर एक मानक, सरल उपकरण का उपयोग करते हैं, तो आपका रोबोट पागल हो जाएगा।
  • ट्विस्ट: यह शोध पत्र पूछता है: क्या होगा यदि हम उस "शक्तिशाली" रोबोट (वह वाला जो डबल डिसेंट का उपयोग करता है) का उपयोग अव्यवस्थित डेटा पर करें? क्या यह अभी भी काम करेगा, या गंदगी इस जादू को बर्बाद कर देगी?

प्रयोग
इस उदाहरण में, रोबोट का काम अन्य मौसम मापों (जैसे हवा की गति, आर्द्रता आदि) के आधार पर तापमान (TEMPERATURE) की भविष्यवाणी करना है। इसलिए तापमान वह उत्तर है जिसे रोबक अनुमान लगाने की कोशिश कर रहा है (इसे Y कहें), और अन्य माप वे इनपुट हैं जिनका वह उपयोग करता है (इन्हें X कहें)। यह अंतर अगले भाग के लिए महत्वपूर्ण है:

लेखक, टिनो वर्नर (Tino Werner) ने एक विशाल सिमुलेशन चलाया। उन्होंने एक "साफ" दुनिया बनाई और फिर जानबूझकर प्रशिक्षण डेटा को दो प्रकार की गंदगी से "दूषित" किया:

  1. Y-संदूषण (Y-Contamination): उत्तरों को बिगाड़ना (जैसे, रोबोट को बताना कि तापमान वास्तव में 50°F था जबकि वह 100°F था)।
  2. X-संदूषण (X-Contamination): सवालों को बिगाड़ना (जैसे, रोबोट को बताना कि हवा की गति 5 mph थी जबकि वह 500 mph थी)।

उन्होंने फिर "शक्तिशाली" रोबोट (जो लीस्ट-स्क्वेयर्स इंटरपोलेशन का उपयोग करता है, जो हर एक बिंदु के माध्यम से, यहाँ तक कि खराब बिंदुओं के माध्यम से भी, एक रेखा को पूरी तरह से फिट करता है) की तुलना कई "सावधान" रोबोटों से की जो खराब डेटा को अनदेखा करने के लिए डिज़ाइन किए गए थे (जैसे Huber loss, Tukey loss, SLTS, और RRBoost का उपयोग करते हैं)।

चौंकाने वाले परिणाम

  1. "शक्तिशाली" रोबोट जीतता है:
    सबसे चौंकाने वाला निष्कर्ष यह है कि लीस्ट-स्क्वेयर्स इंटरपोलेटर (वह जो कचरे सहित हर बिंदु को अंधाधुंध फिट करता है) ने कई परिदृश्यों में सबसे अच्छा प्रदर्शन किया।

    • उपमा: कल्पना कीजिए कि एक छात्र परीक्षा दे रहा है। "सावधान" छात्र चालाकी भरे सवालों को अनदेखा करने की कोशिश करते हैं। "शक्तिशाली" छात्र हर सवाल का जवाब देने की कोशिश करता है, यहाँ तक कि चालाकी भरे सवालों का भी। आश्चर्यजनक रूप से, यदि छात्र के पास पर्याप्त दिमागी शक्ति (पैरामीटर्स) है कि वह पूरी तस्वीर देख सके, तो वह किसी तरह चालाकी भरे सवालों का औसत निकाल सकता है और अंतिम परीक्षा में एक आदर्श स्कोर प्राप्त कर सकता है।
    • शोध में पाया गया कि एक बार जब मॉडल की जटिलता एक निश्चित सीमा (इंटरपोलेशन रिजीम) को पार कर गई, तो त्रुटि दर फिर से गिर गई, और इसने सभी "सावधान" मजबूत तरीकों को पीछे छोड़ दिया।
  2. "सावधान" रोबोट संघर्ष करते हैं:
    वे तरीके जिन्हें मजबूत (robust) होने के लिए डिज़ाइन किया गया था (Huber, Tukey, SLTS, RRBoost), अक्सर इस "डबल डिसेंट" जादू को दिखाने में विफल रहे। कुछ मामलों में, वे उच्च त्रुटियों के साथ फंस गए और कभी उबर नहीं पाए, भले ही मॉडल बहुत बड़ा हो गया हो। वे छिपी हुई सरलता खोजने के बजाय "सुरक्षित" रहने में बहुत व्यस्त थे।

  3. "क्लीन सबसेट" (Clean Subset) का तरीका:
    लेखक ने एक हाइब्रिड दृष्टिकोण भी आज़माया: पहले, एक "सावधान" रोबोट का उपयोग करके "साफ" डेटा बिंदुओं को खोजें, फिर केवल उन साफ बिंदुओं पर "शक्तिशाली" रोबोट का उपयोग करें।

    • परिणाम: यह ठीक काम कर गया, लेकिन यह उस "शक्तिशाली" रोबोट को नहीं हरा सका जिसने पूरे गंदे डेटासेट को निगल लिया था। गंदे डेटा ने शक्तिशाली मॉडल को उतना नुकसान नहीं पहुँचाया जितना कि हर कोई सोच रहा था।
  4. "डबल डिसेंट" का आकार:

    • साफ डेटा: त्रुटि कम होती है, फिर बढ़ती है (overfitting), फिर फिर से कम होती है (Double Descent)।
    • गंदा Y-डेटा (बुरे उत्तर): त्रुटि ऊपर जाती है और ऊँची बनी रहती है जब तक कि मॉडल बहुत बड़ा न हो जाए, फिर यह गिरती है। यह शिखर के बाद एक "एकतरफा गिरावट" (one-way descent) है, लेकिन अंत में यह बहुत अच्छी हो जाती है।
    • गंदा X-डेटा (बुरे सवाल): मॉडल इसे लगभग साफ डेटा के समान ही संभालता है।

मुख्य निष्कर्ष (The Bottom Line)
यह शोध पत्र इस पुराने विचार को चुनौती देता है कि "अव्यवस्थित डेटा के लिए सावधानीपूर्ण और मजबूत उपकरणों की आवश्यकता होती है।" यह सुझाव देता है कि यदि आपके पास एक बहुत बड़ा, शक्तिशाली मॉडल है, तो आपको अपने डेटा को साफ करने या जटिल मजबूत एल्गोरिदम का उपयोग करने की आवश्यकता नहीं हो सकती है। मॉडल का विशाल आकार इसे शोर (noise) के माध्यम से "इंटरपोलेट" करने और सत्य खोजने की अनुमति देता है, जो अक्सर उन तरीकों से बेहतर प्रदर्शन करता है जो विशेष रूप से मजबूत होने के लिए बनाए गए हैं।

यह शोध पत्र क्या नहीं कहता है

  • यह दावा नहीं करता है कि यह बिना परीक्षण के हर प्रकार के डेटा (जैसे मेडिकल इमेज या शेयर बाजार) के लिए काम करता है।
  • यह यह नहीं कहता कि आप मजबूत सांख्यिकी का उपयोग करना हमेशा के लिए बंद कर दें; यह केवल यह कहता है कि इस विशिष्ट लीनियर रिग्रेशन सिमुलेशन में, सरल, शक्तिशाली विधि जीत गई।
  • यह कोई नया सिद्धांत पेश नहीं करता है कि गणितीय रूप से यह क्यों होता है; यह केवल कंप्यूटर सिमुलेशन के माध्यम से यह दिखाता है कि यह होता है।

संक्षेप में: कभी-कभी, एक गंदे कमरे को संभालने का सबसे अच्छा तरीका हर एक कचरे के टुकड़े को सावधानी से उठाना नहीं है, बल्कि एक विशाल वैक्यूम क्लीनर लाना है जो सब कुछ खींच ले और आश्चर्यजनक रूप से फर्श को उम्मीद से अधिक साफ कर दे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →