← नवीनतम पेपर
🤖 machine learning

RADE: Random Add-Drop Edge as a Regularizer

यह शोध पत्र RADE का प्रस्ताव करता है, जो एक स्टोकेस्टिक ग्राफ ऑग्मेंटेशन विधि है जो ट्रेन-इन्फरेंस अलाइनमेंट और एक एडेप्टिव, हाइपरपैरामीटर-मुक्त रेट बैलेंसिंग एल्गोरिदम के साथ ग्राफ न्यूरल नेटवर्क में ओवरफिटिंग और ओवर-स्क्वैशिंगिंग को एक साथ कम करती है।

मूल लेखक: Danial Saber, Amirali Salehi-Abari

प्रकाशित 2026-06-02
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Danial Saber, Amirali Salehi-Abari

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "RADE: Random Add-Drop Edge as a Regularizer" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ हिंदी अनुवाद दिया गया है।

समस्या: "अत्यधिक निर्भर" और "अत्यधिक भ्रमित" छात्र

कल्पना कीजिए कि एक ग्राफ न्यूरल नेटवर्क (GNN) एक छात्र है जो एक जटिल सामाजिक नेटवर्क (जैसे कोई स्कूल या शहर) के बारे में सीखने की कोशिश कर रहा है। छात्र अपने दोस्तों (पड़ोसियों) से बात करके और उनसे पूछकर सीखता है, "तुम क्या जानते हो?"

पेपर में इस छात्र के सामने दो मुख्य समस्याओं की पहचान की गई है:

  1. ओवरफिटिंग (The "Over-Reliant" या अत्यधिक निर्भर छात्र): छात्र अभ्यास के दौरान अपने विशिष्ट दोस्तों के साथ हुई बातचीत को रट लेता है। यदि वह टेस्ट के दौरान दोस्तों के थोड़े अलग समूह को देखता है, तो वह भ्रमित हो जाता है क्योंकि उसने सामान्य नियम नहीं सीखे, बल्कि केवल अपने अभ्यास सत्र के विशिष्ट विवरणों को रटा है। उन्हें रटने के बजाय अंतर्निहित पैटर्न (underlying patterns) सीखने की आवश्यकता है।
  2. ओवर-स्क्वैशिंग (The "Over-Confused" या अत्यधिक भ्रमित छात्र): कल्पना कीजिए कि छात्र को शहर के दूसरी ओर रहने वाले एक दोस्त से एक रहस्य जानने की आवश्यकता है। उस संदेश को प्राप्त करने के लिए इसे 100 लोगों से होकर गुजरना होगा। जब तक संदेश छात्र तक पहुँचता है, उसे एक बहुत ही छोटे, संकुचित नोट में दबा (squeeze) दिया जाता है। छात्र को संदेश तो मिलता है, लेकिन "दबाव" के कारण सभी महत्वपूर्ण विवरण खो जाते हैं। इसे ओवर-स्क्वैशिंग (over-squashing) कहा जाता है। छात्र लंबी दूरी के संबंधों के लिए डॉट्स को जोड़ने में असमर्थ होता है।

पुराने समाधान: "एक ही आकार सबके लिए" (One-Size-Fits-All) वाले उपाय

पिछले तरीकों ने इन समस्याओं को अलग-अलग हल करने की कोशिश की, लेकिन उनमें कुछ कमियाँ थीं:

  • ओवरफिटिंग को रोकने के लिए: शिक्षकों ने छात्र को याद से कुछ दोस्तों को अनदेखा करने के लिए कहा (Edge Deletion)। यह छात्र को केवल एक तेज़ आवाज़ सुनने के बजाय पूरे समूह को सुनने के लिए मजबूर करता है। लेकिन, यह छात्र को शहर के दूसरी ओर रहने वाले दोस्त से सुनने में मदद नहीं करता; यह केवल सिग्नल को कमजोर बनाता है।
  • ओवर-स्क्वैशिंग को रोकने के लिए: शिक्षकों ने दूर के दोस्तों को सीधे जोड़ने के लिए नए "शॉर्टकट ब्रिज" (Rewiring) बनाए। लेकिन, यह एक कठोर, स्थायी परिवर्तन है। यह छात्र को लचीला या मजबूत (robust) बनना नहीं सिखाता; यह केवल मानचित्र (map) को बदल देता है।

नया समाधान: RADE (Random Add-Drop Edge)

लेखकों ने RADE का प्रस्ताव दिया है, जो इन दोनों समस्याओं को एक साथ हल करता है। RADE को एक "डायनेमिक प्रैक्टिस ड्रिल" के रूप में सोचें जहाँ शिक्षक अभ्यास के दौरान लगातार क्लासरूम का सीटिंग चार्ट बदलता रहता है, लेकिन एक बहुत ही चतुर मोड़ के साथ।

1. ड्रिल: सीटों को बेतरतीब ढंग से बदलना

अभ्यास (training) के दौरान, RADE दो चीजें एक साथ करता है:

  • Edges को हटाना (Drops Edges): यह याद से कुछ दोस्तों को कहता है, "आप इस राउंड के लिए एक-दूसरे से बात नहीं कर सकते।"
  • Edges को जोड़ना (Adds Edges): यह याद से अजनबियों को कहता है, "आप दोनों इस राउंड के लिए बात कर सकते हैं!"

यह एक अराजक, बदलता हुआ वातावरण बनाता है। छात्र विशिष्ट बातचीत को याद नहीं रख सकता क्योंकि हर बार सीटिंग चार्ट बदल जाता है। यह उन्हें नेटवर्क की वास्तविक संरचना को सीखने के लिए मजबूर करता है, जिससे ओवरफिटिंग ठीक होती है।

2. जादुई ट्रिक: "एक्सपेक्टेशन-प्रिजर्विंग" (Expectation-Preserving) सुधार

यहाँ पेचीदा बात यह है। यदि आप एक बदले हुए मानचित्र पर अभ्यास करते हैं लेकिन मूल मानचित्र पर टेस्ट देते हैं, तो छात्र असफल हो जाएगा क्योंकि उसने गलत नियमों का अभ्यास किया था। इसे ट्रेन-इन्फरेंस मिसअलाइनमेंट (train-inference misalignment) कहा जाता है।

RADE इसे एक गणितीय "सुधार नियम" के साथ हल करता है:

  • RADE-OF (ओवरफिटिंग फोकस) के लिए: जब शिक्षक एक दोस्त को हटाता है, तो वे छात्र को कहते हैं, "अपने शेष दोस्तों से जो तुम सुन रहे हो, उसे 1.5 से गुणा करो।" जब वे एक अजनबी को जोड़ते हैं, तो वे कहते हैं, "उस अजनबी की बात को अनदेखा करो।"

    • उपमा: यह एक साउंड इंजीनियर की तरह है जो वास्तविक समय में वॉल्यूम नॉब को एडजस्ट करता है। भले ही बैंड के सदस्य (edges) बदल रहे हों, संगीत का अंतिम वॉल्यूम (संदेश) बिल्कुल वैसा ही रहता है जैसा कि बैंड बदले बिना होता। यह सुनिश्चित करता है कि छात्र शोर से भ्रमित हुए बिना सही नियम सीखे।
  • RADE-OFS (ओवर-स्क्वैशिंग फोकस) के लिए: यह संस्करण और भी स्मार्ट है। यह अभी भी हटाए गए दोस्तों के लिए वॉल्यूम को ठीक करता है, लेकिन यह नए अजनबियों के लिए वॉल्यूम को ऊपर रखता है।

    • उपमा: कल्पना कीजिए कि शिक्षक कहता है, "उन दोस्तों को अनदेखा करें जो चले गए, लेकिन नए अजनबियों को सुनना जारी रखें क्योंकि उनके पास शहर के दूसरी ओर के दोस्त तक पहुँचने का शॉर्टकट हो सकता है।" यह नए "शॉर्टकट" बनाता है जो छात्र को दूर की जानकारी स्पष्ट रूप से सुनने में मदद करते हैं, जिससे ओवर-स्क्वैशिंग ठीक होती है।

3. ऑटो-पायलट: GradNorm

आमतौर पर, शिक्षकों को यह अनुमान लगाना पड़ता है कि कितने दोस्तों को हटाना या जोड़ना है (हाइपरपैरामीटर्स)। यदि वे बहुत अधिक हटा देते हैं, तो छात्र घबरा जाता है। यदि वे बहुत कम हटाते हैं, तो छात्र पर्याप्त नहीं सीख पाता।

RADE में एक ऑटो-पायलट (GradNorm) शामिल है।

  • उपमा: कल्पना कीजिए कि शिक्षक के पास एक डैशबोर्ड है जो यह मापता है कि छात्र कितना "तनावग्रस्त" है। यदि छात्र बहुत शांत है (पर्याप्त नहीं सीख रहा), तो शिक्षक स्वचालित रूप से अराजकता (अधिक एज परिवर्तन) बढ़ा देता है। यदि छात्र बहुत तनावग्रस्त है (भ्रमित है), तो शिक्षक चीज़ों को शांत कर देता है। सिस्टम कठिनाई को स्वचालित रूप से समायोजित करता है, ताकि शिक्षक को सेटिंग्स का अनुमान न लगाना पड़े।

परिणाम: यह क्यों काम करता है

पेपर ने कई अलग-अलग "स्कूलों" (डेटासेट्स) और "विषयों" (GCN, GIN, GAT जैसे मॉडल) पर इसका परीक्षण किया।

  • फैसला: RADE एक मजबूत रेगुलराइज़र है। यह लगातार पिछले तरीकों की तुलना में टेस्ट पर छात्र के प्रदर्शन को बेहतर बनाने में मदद करता है।
  • विशेष मामला: जब कार्य के लिए बहुत दूर से सुनने की आवश्यकता होती है (जैसे जटिल अणुओं के गुणों की भविष्यवाणी करना), तो RADE-OFS संस्करण (जो नए शॉर्टकट को बनाए रखता है) सबसे अधिक चमकता है। यह साबित करता है कि यादृच्छिक कनेक्शन जोड़ना मददगार हो सकता है यदि आप उन्हें संतुलित करना जानते हैं।
  • "ड्रॉप बनाम ऐड" की खोज: लेखकों ने पाया कि केवल दोस्तों को हटाना (Drop) और केवल दोस्तों को जोड़ना (Add) एक-दूसरे के विकल्प नहीं हैं। वे दो अलग-अलग उपकरणों की तरह हैं: एक हथौड़ा और एक स्क्रूड्राइवर। आपको सबसे अच्छा ढांचा बनाने के लिए दोनों को एक साथ काम करने की आवश्यकता है। केवल एक का उपयोग करना RADE दृष्टिकोण की तुलना में कम प्रभावी है।

सारांश

RADE एक प्रशिक्षण विधि है जो नेटवर्क में कनेक्शनों को याद से बदल देती है ताकि याद रखने (overfitting) को रोका जा सके और साथ ही दूर की जानकारी सुनने के लिए नए रास्ते (over-squashing) बनाए जा सकें। यह एक गणितीय "वॉल्यूम कंट्रोल" का उपयोग करता है ताकि यह सुनिश्चित हो सके कि अभ्यास सत्र वास्तविक टेस्ट से मेल खाते हैं, और इसमें कठिनाई को ऑन-द-फ्लाई समायोजित करने के लिए एक ऑटो-पायलट है। यह ग्राफ न्यूरल नेटवर्क को स्मार्ट और अधिक मजबूत बनाने का एक सरल और प्रभावी तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →