← नवीनतम पेपर
🤖 machine learning

A Theory of Generalization in Deep Learning

यह शोध पत्र आउटपुट स्पेस के एम्पिरिकल न्यूरल टेंट कर्नेल (empirical neural tangent kernel) के विभाजन पर आधारित डीप लर्निंग जनरलाइजेशन का एक नॉन-एसिम्प्टोटिक सिद्धांत प्रस्तुत करता है, जो बेनाइन ओवरफिटिंग और ग्रोकिंग जैसी घटनाओं की व्याख्या करता है और एक व्यावहारिक SNR-आधारित प्रीकंडीशनर पेश करता है जो बिना किसी वैलिडेशन डेटा की आवश्यकता के ट्रेनिंग को तेज करता है और मेमोराइजेशन को दबाता है।

मूल लेखक: Elon Litman, Gabe Guo

प्रकाशित 2026-05-05
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Elon Litman, Gabe Guo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक बड़ी तस्वीर: इतने जटिल AI मॉडल काम क्यों करते हैं?

कल्पना कीजिए कि आप एक छात्र (एक न्यूरल नेटवर्क) को फाइनल परीक्षा के लिए पढ़ा रहे हैं। आप उन्हें 100 उदाहरणों वाली एक पाठ्यपुस्तक देते हैं। लेकिन यहाँ एक ट्विस्ट है: छात्र के पास फोटोग्राफिक मेमोरी है और वह इतना बुद्धिमान है कि वह पाठ्यपुस्तक के हर एक शब्द को याद कर सकता है, जिसमें गलतियाँ (typos) और हाशिए में लिखे बेतरतीब निशान भी शामिल हैं।

अतीत में, वैज्ञानिकों ने सोचा था: "यदि छात्र इन गलतियों को भी याद कर लेता है, तो वह परीक्षा में फेल हो जाएगा क्योंकि परीक्षा में वे गलतियाँ नहीं होंगी।" यह ओवरफिटिंग (overfitting) की समस्या है।

हालाँकि, आधुनिक AI में, हम कुछ अजीब देखते हैं: ये "सुपर-मेमोराइज़र" अक्सर परीक्षा में टॉप करते हैं, भले ही ट्रेनिंग डेटा बिखरा हुआ या खराब हो। यह शोध पत्र एक नया नक्शा प्रदान करता है जो यह समझाने के लिए है कि यह कैसे और क्यों होता है, और यह हमें उन्हें इसे तेज़ी से और बेहतर तरीके से करने के लिए प्रशिक्षित करने का एक नया तरीका भी देता है।


1. दो कमरे: "सिग्नल चैनल" और "रिजर्वायर" (The Reservoir)

लेखक AI की सीखने की प्रक्रिया को दो अलग-अलग कमरों वाली एक इमारत के रूप में कल्पना करते हैं।

  • कमरा A: सिग्नल चैनल (मंच/The Stage)
    यह वह जगह है जहाँ "असली" सीखना होता है। यह एक मंच की तरह है जहाँ छात्र कहानी के वास्तविक कथानक को सीखता है। जब AI इस दिशा में बढ़ता है, तो वह उन पैटर्न्स को सीख रहा होता है जो वास्तविक दुनिया (टेस्ट) पर लागू होते हैं।

    • यहाँ क्या होता है: AI तेज़ी से और स्थिरता से सीखता है। यह एक ट्रैक पर दौड़ने वाले धावक की तरह है।
  • कमरा B: रिजर्वायर (ध्वनिरोधी बेसमेंट/The Soundproof Basement)
    यह एक विशाल, अंधेरा बेसमेंट है जहाँ AI "शोर" (noise) को स्टोर करता है—जैसे गलतियाँ, बेतरतीब निशान और डेटा में मौजूद बेकार चीज़ें।

    • जादुई ट्रिक: लेखक सिद्ध करते हैं कि यह बेसमेंट ध्वनिरोधी (soundproof) है। भले ही AI बेसमेंट में मौजूद हर एक गलती को याद कर ले, लेकिन कोई भी आवाज़ बाहर नहीं निकल सकती। टेस्ट (परीक्षा) उस शोर को नहीं सुन सकता जो रिजर्वायर में हो रहा है।
    • परिणाम: AI शोर को याद कर सकता है बिना अपने परीक्षा स्कोर को नुकसान पहुँचाए, क्योंकि शोर एक ऐसी जगह कैद है जिसे टेस्ट देख ही नहीं सकता।

2. ट्रैफिक पुलिस: SGD चीजों को व्यवस्थित कैसे रखता है?

AI को कैसे पता चलता है कि कौन सी दिशा "मंच" (Stage) की है और कौन सी "बेसमेंट" (Basement) की? यह पेपर समझाता है कि मानक प्रशिक्षण विधि (जिसे SGD या Stochastic Gradient Descent कहा जाता है) एक चतुर ट्रैफिक पुलिस की तरह काम करती है।

  • ड्रिफ्ट बनाम शफल (Drift vs. The Shuffle):
    • असली सिग्नल (मंच): जब AI एक वास्तविक पैटर्न देखता है, तो ट्रैफिक पुलिस उसे एक सीधी, तेज़ रेखा में आगे धकेलती है (एक "ड्रिफ्ट")। यह तेज़ी से जमा होता है।
    • शोर (बेसमेंट): जब AI रैंडम शोर देखता है, तो ट्रैफिक पुलिस उसे बस अपनी जगह पर इधर-उधर घूमने (एक "रैंडम वॉक") के लिए कहती है। वह हिलता तो है, लेकिन किसी उपयोगी दिशा में नहीं पहुँच पाता।
    • परिणाम: समय के साथ, असली पैटर्न्स ऊँचे जमा हो जाते हैं, जबकि शोर छोटा रहता है और भीड़ में खो जाता है। AI स्वाभाविक रूप से अनाज से भूसे को अलग कर देता है।

3. "ग्रोकिंग" (Grokking) का रहस्य सुलझाना

आपने शायद "ग्रोकिंग" (Grokking) नामक एक घटना के बारे में सुना होगा। यह तब होता है जब एक AI लंबे समय तक असफल (डेटा को रटने वाला) दिखता है, और फिर अचानक, बिना किसी चेतावनी के, वह चीज़ को "समझ" जाता है और समस्या को पूरी तरह से हल करने लगता है।

  • पेपर का स्पष्टीकरण:
    कल्पना कीजिए कि AI धीरे-धीरे "सिग्नल" को साउंडप्रूफ बेसमेंट से उठाकर मंच (Stage) पर ला रहा है।
    • शुरुआत में, AI बेसमेंट में फंसा होता है, केवल शोर को याद कर रहा होता है।
    • धीरे-धीरे, "कर्नेल" (AI का आंतरिक मानचित्र) विकसित होता है।
    • अंततः, असली सिग्नल आखिरकार बेसमेंट से मंच पर माइग्रेट (स्थानांतरित) हो जाता है।
    • ग्रोकिंग बस वही क्षण है जब सिग्नल मंच पर पहुँच जाता है। यह कोई जादू नहीं है; यह बस सिग्नल का टेस्ट तक पहुँचना है।

4. नया टूल: "पॉपुलेशन रिस्क" (Population Risk) ट्रेनिंग

लेखकों ने केवल सिद्धांत ही नहीं समझाया; उन्होंने इस पर आधारित एक व्यावहारिक उपकरण भी बनाया है।

  • समस्या: आमतौर पर, AI को प्रशिक्षित करने के लिए, हमें एक "वैलिडेशन सेट" (एक अभ्यास परीक्षा) की आवश्यकता होती है ताकि यह जाँच की जा सके कि वह सही चीज़ सीख रहा है या नहीं। यदि हमारे पास यह नहीं है, तो हम अनजाने में उसे शोर सिखा सकते हैं।
  • समाधान: उन्होंने एक नया प्रशिक्षण नियम बनाया है जो एक स्व-सुधारने वाले फिल्टर (Self-Correcting Filter) की तरह काम करता है।
    • केवल पूरे डेटा बैच को देखने के बजाय, यह नई विधि हर एक उदाहरण को देखती है और पूछती है: "यदि मैं इस एक उदाहरण को हटा दूँ, तो क्या AI अभी भी वही चीज़ सीख पाएगा?"
    • यदि उत्तर है "नहीं, यह सिर्फ इस विशिष्ट शोर को याद कर रहा है," तो फ़िल्टर उस अपडेट को ब्लॉक कर देता है।
    • यदि उत्तर है "हाँ, यह एक वास्तविक पैटर्न है," तो फ़िल्टर उस अपडेट को अनुमति देता है।

उपमा (Analogy):
कल्पना कीजिए कि एक शिक्षक एक छात्र को ग्रेड दे रहा है।

  • पुराना तरीका (AdamW): शिक्षक पूरे टेस्ट को देखता है और कहता है, "तुमने 90% सही किया, बहुत अच्छे!" (भले ही छात्र ने 10 सवालों में नकल की हो)।
  • नया तरीका (Population Risk): शिक्षक प्रत्येक प्रश्न को देखता है और पूछता है, "क्या तुमने यह अवधारणा (concept) सीखी है, या तुमने सिर्फ उत्तर कुंजी (answer key) को रटा है?" यदि यह केवल रटना है, तो शिक्षक उस अंक को अनदेखा कर देता है। यह छात्र को अवधारणाओं को तेज़ी से सीखने के लिए मजबूर करता है।

5. उन्होंने क्या हासिल किया?

इस पेपर ने इस नए तरीके का परीक्षण तीन कठिन कार्यों पर किया जहाँ AI आमतौर पर विफल हो जाता है या अटक जाता है:

  1. फिजिक्स सिमुलेशन (PINNs): जब AI को शोर वाले डेटा के साथ भौतिकी के समीकरणों को हल करने के लिए प्रशिक्षित किया गया, तो इस नए तरीके ने मानक तरीकों की तुलना में 2.4 गुना तेज़ी से सही उत्तर प्राप्त किया।
  2. गणित की पहेलियाँ (Grokking): एक मॉड्यूलर डिवीजन गणित की समस्या पर, AI सामान्य 29,450 स्टेप्स के बजाय केवल 5,950 स्टेप्स में 95% सटीकता तक पहुँच गया। इसने 5 गुना तेज़ी से "ग्रॉक" किया।
  3. AI चैटबॉट्स (DPO): जब एक चैटबॉट को बिखरे हुए मानवीय फीडबैक (जहाँ लोग इस पर असहमत होते हैं कि क्या अच्छा है) के साथ फाइन-ट्यून किया गया, तो इस नए तरीके ने बॉट के मूल, सुरक्षित व्यवहार के बहुत करीब रहते हुए बेहतर प्राथमिकताएँ सीखीं।

सारांश

यह पेपर बताता है कि डीप लर्निंग इसलिए काम करता है क्योंकि प्रशिक्षण प्रक्रिया स्वाभाविक रूप से "असली सीखने" को "रटे हुए शोर" से अलग करके दो अलग-अलग कमरों में डाल देती है। "शोर" एक ध्वनिरोधी बेसमेंट में कैद हो जाता है जहाँ वह AI के प्रदर्शन को नुकसान नहीं पहुँचा सकता।

इसे समझकर, लेखकों ने एक नया प्रशिक्षण उपकरण बनाया है जो एक स्मार्ट फ़िल्टर की तरह काम करता है, जो शोर को स्वचालित रूप से अनदेखा करता है और केवल असली संकेतों पर ध्यान केंद्रित करता है। यह AI को तेज़ी से सीखने, कठिन समस्याओं को हल करने और बिना अतिरिक्त डेटा के "मेमोरी ट्रैप" (रटने के जाल) से बचने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →