← नवीनतम पेपर
📊 statistics

Canonical Regularisation of Wide Feature-Learning Neural Networks

यह शोध पत्र फीचर-लर्निंग न्यूरल नेटवर्क में मानक रिज रेगुलराइजेशन (ridge regularisation) की सीमाओं की पहचान करता है और एक नवीन फ्रेमवर्क प्रस्तावित करता है जो रिमानियन ज्योमेट्री (Riemannian geometry) पर आधारित है ताकि एक कैनोनिकल "जियोडेसिक रिज" (geodesic ridge) रेगुलराइज़र व्युत्पन्न किया जा सके जो कर्नेल और फीचर-लर्निंग दोनों व्यवस्थाओं में ग्रेडिएंट फ्लो के निहित प्रायोर (implicit prior) का सामान्यीकरण करता है।

मूल लेखक: George Whittle, Pranav Vaidhyanathan, Juliusz Ziomek, Natalia Ares, Maike A. Osborne

प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: George Whittle, Pranav Vaidhyanathan, Juliusz Ziomek, Natalia Ares, Maike A. Osborne

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक बड़ी तस्वीर: सीखने के दो तरीके

कल्प Imagine कीजिए कि एक न्यूरल नेटवर्क (एक प्रकार का AI) मिट्टी से बनी एक विशाल, लचीली मूर्ति की तरह है। जब हम इसे ट्रेन करते हैं, तो हम मिट्टी को एक विशिष्ट आकार (डेटा) देने के लिए उसे दबाते और खींचते हैं।

यह पेपर तर्क देता है कि लंबे समय से वैज्ञानिक इन मूर्तियों का अध्ययन एक बहुत ही सरल नियम का उपयोग करके कर रहे हैं: "मिट्टी वास्तव में अपना आकार नहीं बदलती; यह बस एक सपाट मेज पर फिसलती है।" इसे कर्नल रिजीम (Kernel Regime) कहा जाता है। इस दुनिया में, गणित आसान है, और मिट्टी को धकेलने का "सबसे अच्छा" तरीका अच्छी तरह से समझ में आता है।

हालाँकि, आधुनिक AI वास्तव में एक अलग दुनिया में काम करता है, जिसे फीचर-लर्निंग रिजीम (Feature-Learning Regime) कहा जाता है। यहाँ, मिट्टी अपना आकार बदलती है। जैसे-जैसे यह सीखता है, मूर्ति मुड़ती है, घूमती है और झुकती है। मिट्टी को धकेलने के पुराने नियम यहाँ अब काम नहीं करते, लेकिन लोग फिर भी उनका उपयोग करते रहे, जिससे अक्सर खराब परिणाम मिले।

समस्या: गलत "धक्का"

पुरानी, सपाट दुनिया (Kernel Regime) में, मूर्ति को निर्देशित करने का सबसे अच्छा तरीका एक विशिष्ट प्रकार का "धक्का" है जिसे एंकोर्ड रिज (Anchored Ridge) कहा जाता है। इसे मूर्ति की शुरुआती स्थिति से बंधी एक रबर बैंड के रूप में सोचें। जैसे-जैसे आप मूर्ति को उसके लक्ष्य की ओर धकेलते हैं, रबर बैंड उसे वापस शुरुआत की ओर खींचता है, जिससे वह बहुत दूर नहीं भटक पाती। यह एक सपाट मेज पर पूरी तरह से काम करता है।

पेपर की मुख्य खोज: घुमावदार दुनिया (Feature-Learning Regime) में, यही रबर बैंड खतरनाक है।

क्योंकि "मेज" (वह रास्ता जिस पर मूर्ति चलती है) अब एक रोलरकोस्टर ट्रैक की तरह घुमावदार है, इसलिए रबर बैंड गलत दिशा में खींचता है। यह मूर्ति को सीधे वापस शुरुआत की ओर खींचने की कोशिश करता है, लेकिन ट्रैक मुड़ जाता है। इससे एक "फैंटम फोर्स" (भ्रमित बल) पैदा होता है जो मूर्ति को ट्रैक से हटाकर शून्य में धकेल देता है।

  • परिणाम: मूर्ति एक ऐसे स्थान पर पहुँच जाती है जो ट्रेनिंग डेटा पर तो अच्छा दिखता है, लेकिन नए, अनदेखे डेटा के लिए वास्तव में खराब है। यह एक रस्सी पर चलने की कोशिश करने जैसा है जबकि कोई आपको आपकी शुरुआती जगह से बंधी रस्सी से बगल की ओर खींच रहा हो; आप रस्सी से गिर जाएंगे।

यही कारण है कि आधुनिक AI कभी-कभी ठीक से सीखने में विफल रहता है या वह "ज्ञान" खो देता है जो उसने प्री-ट्रेनिंग के दौरान प्राप्त किया था (इस समस्या को "कैटास्ट्रोफिक फॉरगेटिंग" या डिग्रेडेड ट्रांसफर लर्निंग कहा जाता है)।

समाधान: "जियोडेसिक" (Geodesic) धक्का

लेखकों ने पूछा: यदि मेज घुमावदार है, तो मूर्ति को वापस उसके शुरुआती बिंदु पर लाने का सही तरीका क्या है?

उन्होंने महसूस किया कि एक घुमावदार सतह पर, दो बिंदुओं के बीच की सबसे छोटी दूरी एक सीधी रेखा (chord) नहीं है; बल्कि यह एक घुमावदार रेखा है जो सतह का अनुसरण करती है। गणित में, इसे जियोडेसिक (Geodesic) कहा जाता है।

उन्होंने एक नया नियम प्रस्तावित किया जिसे जियोडेसिक रिज (Geodesic Ridge) कहा जाता है:

  • एक रबर बैंड के बजाय जो हवा में एक सीधी रेखा में खींचता है, एक फिसलने वाली रेल (sliding rail) की कल्पना करें जो घुमावदार ट्रैक से पूरी तरह चिपकी हुई है।
  • यह रेल मूर्ति को घुमाव के साथ ही वापस शुरुआत की ओर खींचती है।
  • यह सुनिश्चित करता है कि मूर्ति ट्रैक पर बनी रहे, जिससे AI के फीचर्स सीखने का स्वाभाविक तरीका सुरक्षित रहता है।

व्यावहारिक शॉर्टकट: "आर्क रिज" (Arc Ridge)

एक समस्या है। विशाल AI मॉडल के लिए सटीक "फिसलने वाली रेल" (Geodesic Ridge) की गणना करना अविश्वसनीय रूप से कठिन और धीमा है। यह हर कदम उठाने के लिए पहाड़ की सड़क के सटीक घुमाव की गणना करने जैसा है।

इसलिए, लेखकों ने एक चतुर शॉर्टकट खोजा जिसे आर्क रिज (Arc Ridge) कहा जाता है।

  • उपमा: कल्पना करें कि आप एक पहाड़ पर चढ़ रहे हैं। आपको यह जानने के लिए कि आपने कितनी दूरी तय की है, पृथ्वी के सटीक घुमाव की गणना करने की आवश्यकता नहीं है। आपको बस अपने कदमों को गिनने की आवश्यकता है।
  • यह कैसे काम करता है: आर्क रिज बस ट्रेनिंग के दौरान मूर्ति द्वारा तय की गई कुल दूरी को मापता है।
  • जादू: पेपर यह सिद्ध करता है कि यह सरल "स्टेप काउंटर" (कदम गिनने वाला यंत्र) बिल्कुल एक जटिल "फिसलने वाली रेल" की तरह काम करता है। यह मूर्ति को ट्रैक से भटकने से रोकता है, लेकिन इसे कैलकुलेट करना बेहद आसान है।

यह क्यों महत्वपूर्ण है (पेपर के अनुसार)

  1. यह "बायस" (Bias) को ठीक करता है: पुराने तरीके (Standard और Anchored Ridge) गुप्त रूप से AI को पक्षपाती बनाते हैं, उसे एक बुरी स्थिति में धकेल देते हैं भले ही आपको लगे कि आप बहुत कम रेगुलराइजेशन का उपयोग कर रहे हैं। नया तरीका इस बायस को हटा देता है।
  2. यह "अर्ली स्टॉपिंग" (Early Stopping) से जुड़ता है: पेपर दिखाता है कि इस "स्टेप काउंटर" (Arc Ridge) का उपयोग करना गणितीय रूप से ठीक उसी क्षण प्रशिक्षण को रोकने (Early Stopping) के समान है। यदि आप जानते हैं कि आपने कितने कदम चले हैं, तो आप बिना किसी अलग टेस्ट सेट के, सर्वोत्तम परिणाम प्राप्त करने के लिए सही समय पर रुकना जान सकते हैं।
  3. वास्तविक दुनिया का प्रमाण: लेखकों ने इमेज रिकग्निशन (चेहरों से उम्र का अनुमान लगाना) और टेक्स्ट एनालिसिस (रिव्यू स्कोर का अनुमान लगाना) पर इसका परीक्षण किया। उन्होंने पाया कि जब उन्होंने उच्च रेगुलराइजेशन के साथ पुराने तरीकों का उपयोग किया, तो AI और खराब हो गया। जब उन्होंने अपने नए "आर्क रिज" तरीके का उपयोग किया, तो AI स्थिर रहा और बहुत बेहतर प्रदर्शन किया।

सारांश

  • पुराना दृष्टिकोण: AI सीखना एक सपाट फर्श पर फिसलने जैसा है। हम इसे एक सीधी रबर बैंड से पीछे खींचते हैं।
  • नई वास्तविकता: AI सीखना एक घुमावदार रोलरकोस्टर पर फिसलने जैसा है। एक सीधी रबर बैंड आपको ट्रैक से बाहर खींच लेती है।
  • समाधान: एक "फिसलने वाली रेल" (Geodesic Ridge) का उपयोग करें जो घुमाव का अनुसरण करती है।
  • शॉर्टकट: आपको रेल बनाने की आवश्यकता नहीं है। बस अपने कदम गिनें (Arc Ridge), और यह वही काम पूरी तरह से करेगा।

यह पेपर गणितीय प्रमाण प्रदान करता है कि पुराने नियम आधुनिक AI में क्यों विफल होते हैं और इसे ठीक करने के लिए एक सरल, व्यावहारिक उपकरण प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →