← नवीनतम पेपर
🤖 machine learning

Gradient-Direction Sensitivity Reveals Linear-Centroid Coupling Hidden by Optimizer Trajectories

यह शोध पत्र यह प्रदर्शित करता है कि ऑप्टिमाइज़र अपडेट के बजाय लॉस ग्रेडिएंट्स का विश्लेषण करने से ग्रेडिएंट-दिशा संवेदनशीलता (gradient-direction sensitivity) और लीनियर-सेंट्रॉइड हाइपोथेसिस फीचर्स के बीच एक गहरा, पूर्व में छिपा हुआ जुड़ाव प्रकट होता है, जो यह दर्शाता है कि अटेंशन अपडेट को लो-रैंक सबस्पेस तक सीमित करने से ग्रोकिंग (grokking) में तेजी आती है जबकि प्राकृतिक फुल-रैंक अपडेट अत्यधिक रैंक-रिडंडेंट होते हैं।

मूल लेखक: Yongzhong Xu

प्रकाशित 2026-04-29
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yongzhong Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: कार को चलते हुए देखना बनाम सड़क को देखना

कल्पना कीजिए कि आप यह समझने की कोशिश कर रहे हैं कि एक सेल्फ-ड्राइविंग कार एक जटिल शहर में रास्ता बनाना कैसे सीखती है। आप जानना चाहते हैं: कौन से विशिष्ट मोड़ और लेन वास्तव में कार को रास्ता सीखने में मदद कर रहे हैं?

लंबे समय से, शोधकर्ता इसे समझने के लिए कार की वास्तविक गति (ऑप्टिमाइज़र का प्रक्षेपवक्र/ट्रैजेक्टरी) को देखते आए हैं। वे देखते हैं कि पिछले कुछ मिनटों में कार ने कौन सा रास्ता लिया, उस रास्ते के बीच में एक रेखा खींचते हैं, और कहते हैं, "आहा! कार इस विशिष्ट दिशा में आगे बढ़कर सीख रही है।"

यह पेपर तर्क देता है कि कार की गति को देखना भ्रामक है।

लेखक कहते हैं कि कार की गति एक अस्त-व्यस्त मिश्रण है:

  1. मोमेंटम (Momentum): कार अभी भी उन मोड़ों से अपनी गति बनाए हुए है जो उसने 10 सेकंड पहले लिए थे।
  2. एडेप्टिव स्केलिंग (Adaptive Scaling): कार अपनी गति को इस आधार पर समायोजित कर रही है कि सड़क कितनी फिसलन भरी महसूस हो रही है।
  3. वेट डिके (Weight Decay): कार सड़क के केंद्र में रहने की कोशिश कर रही है, भले ही उसे इसकी आवश्यकता न हो।
  4. परस्पर विरोधी लक्ष्य (Conflicting Goals): मल्टी-टास्क सेटिंग में, कार एक ही समय में किराने की दुकान, जिम और ऑफिस जाने की कोशिश कर रही है। वह रास्ता जो वह लेती है, वह एक समझौता है, न कि किसी एक गंतव्य के लिए स्पष्ट मार्ग।

पेपर का दावा है कि वास्तव में कार क्या सीख रही है यह समझने के लिए, आपको यह नहीं देखना चाहिए कि कार कहाँ गई। इसके बजाय, आपको उन सड़क संकेतों और मानचित्रों (ग्रेडिएंट्स) को देखना चाहिए जिन्हें कार ठीक उसी क्षण देख रही थी।


मुख्य खोज: "अस्त-व्यस्त रास्ता" बनाम "स्पष्ट संकेत"

शोधकर्ताओं ने इसका परीक्षण गणित की समस्याओं (जैसे जोड़ और गुणा) को सीखने वाले एक कंप्यूटर मॉडल पर किया। उन्होंने यह देखने के लिए एक "परीक्षण" का उपयोग किया कि क्या मॉडल विशिष्ट विशेषताएं (जैसे संख्याओं को जोड़ने का मानसिक नियम) बना रहा है।

1. पुराना तरीका (कार को देखना):
जब उन्होंने मॉडल द्वारा लिए गए पथ (अपडेट) का विश्लेषण किया, तो परीक्षण के परिणाम कमजोर और भ्रमित करने वाले थे।

  • परिणाम: मॉडल सीखता हुआ लग रहा था, लेकिन सीखने की "दिशा" यादृच्छिक (रैंडम) दिख रही थी। जटिल कार्यों में जहाँ मॉडल को एक साथ चार काम करने थे, वहाँ यह परीक्षण पूरी तरह विफल रहा। ऐसा लगा जैसे मॉडल कुछ भी विशिष्ट नहीं सीख रहा है।
  • उपमा: यह एक हाइकर (पगडंडी पर चलने वाले) के गंतव्य को उसके कीचड़ भरे पदचिह्नों को देखकर समझने की कोशिश करने जैसा है। पदचिह्न फिसलने, रुकने और दिशा बदलने का एक उलझा हुआ ढेर हैं, इसलिए आप यह नहीं बता सकते कि वह वास्तव में किस दिशा में जाने की कोशिश कर रहा था।

2. नया तरीका (मानचित्र को देखना):
शोधकर्ताओं ने ग्रेडिएंट्स (कच्चा गणितीय संकेत जो मॉडल को बताता है कि अस्त-व्यस्त ऑप्टिमाइज़र स्टेप्स आने से पहले उसे किस दिशा में जाना चाहिए) का विश्लेषण करना शुरू किया।

  • परिणाम: अचानक, संकेत अविश्वसनीय रूपकी तरह स्पष्ट हो गया। सीखने की "दिशा" पहले की तुलना में 30 से 100 गुना अधिक मजबूत हो गई।
  • उपमा: पदचिह्नों को देखने के बजाय, उन्होंने हाइकर द्वारा ठीक उसी सेकंड लक्षित किए गए GPS निर्देशांकों को देखा। दिशा तीक्ष्ण, स्पष्ट और गंतव्य के साथ पूरी तरह से संरेखित थी।

मुख्य निष्कर्ष: "ऑप्टिमाइज़र" (वह एल्गोरिदम जो मॉडल को अपडेट करता है) इतना शोर और इतिहास जोड़ देता है कि वह वास्तविक सीखने के संकेत को छिपा देता है। वास्तविक सीखने को देखने के लिए आपको मोमेंटम और इतिहास को हटाना होगा।


मल्टी-टास्क समस्या: "कमेटी मीटिंग"

पेपर ने एक ऐसे मॉडल को भी देखा जो एक ही समय में चार अलग-अलग गणित की समस्याओं (जोड़, घटाव, गुणा और एक जटिल वर्ग सूत्र) को सीखने की कोशिश कर रहा था।

  • पुराना दृष्टिकोण: जब उन्होंने मॉडल के संयुक्त पथ को देखा, तो वह एक आपदा जैसा लगा। मॉडल चार अलग-अलग "कमेटी" को संतुष्ट करने की कोशिश कर रहा था, और परिणामी पथ एक ऐसा समझौता था जो उनमें से किसी को भी अच्छी तरह से संतुष्ट नहीं करता था। डायग्नोस्टिक टूल ने कहा, "यह मॉडल किसी भी विशिष्ट विशेषता को नहीं सीख रहा है।"
  • नया दृष्टिकोण: जब उन्होंने प्रत्येक कमेटी के लिए अलग-अलग "मानचित्र" (जोड़ के लिए ग्रेडिएंट, फिर घटाव के लिए, आदि) को देखा, तो उन्होंने पाया कि मॉडल वास्तव में सभी चार कार्यों के लिए बहुत अच्छी तरह सीख रहा था।
  • उपमा: कल्पना कीजिए कि चार लोग मिलकर लंच ऑर्डर करने का निर्णय ले रहे हैं।
    • पुराना तरीका: आप अंतिम, अस्त-व्यस्त समझौते को देखते हैं (जैसे, "चलो पिज्जा टॉपिंग्स के साथ सलाद लेते हैं")। यह एक बुरा निर्णय लगता है जो किसी को भी संतुष्ट नहीं करता।
    • नया तरीका: आप प्रत्येक व्यक्ति को व्यक्तिगत रूप से क्या ऑर्डर करना था, यह सुनते हैं। आप महसूस करते हैं कि व्यक्ति A वास्तव में सलाद चाहता था, और व्यक्ति B वास्तव में पिज्जा चाहता था। "अस्त-व्यस्त समझौता" केवल उनके बीच बहस का परिणाम था, लेकिन उनकी व्यक्तिगत इच्छाएं स्पष्ट और मजबूत थीं।

निष्कर्ष: मल्टी-टास्क ट्रेनिंग में, "समझौता पथ" (compromise path) इस तथ्य को छिपा देता है कि मॉडल प्रत्येक कार्य के लिए अलग-अलग विशेषताएं सफलतापूर्वक सीख रहा है। देखने के लिए आपको कार्यों को अलग करना होगा।


"रैंक-3" का आश्चर्य: यह आकार के बारे में है, दिशा के बारे में नहीं

शोधकर्ताओं ने एक और प्रयोग किया। उन्होंने पूछा: "क्या हमें मॉडल को इन विशिष्ट दिशाओं में सीखने की आवश्यकता है जो हमने पाई हैं, या बस किसी भी कम-आयामी (low-dimensional) दिशा में?"

उन्होंने मॉडल को केवल एक बहुत छोटे, सरल "सबस्पेस" (उसके विशाल मस्तिष्क का एक छोटा, 3-आयामी हिस्सा) का उपयोग करके सीखने के लिए मजबूर किया।

  • परिणाम: मॉडल ने तेजी से (लगभग 2.3 गुना तेजी से) सीखा जब उसे इस छोटे से हिस्से का उपयोग करने के लिए मजबूर किया गया।
  • ट्विस्ट: इससे कोई फर्क नहीं पड़ा कि उन्होंने कौन सा हिस्सा इस्तेमाल किया। चाहे उन्होंने वह "स्मार्ट" हिस्सा इस्तेमाल किया जो उन्हें नए तरीके से मिला था, या कोई पूरी तरह से यादृच्छिक (रैंडम) हिस्सा, मॉडल ने उतनी ही तेजी से सीखा।
  • उपमा: कल्पना कीजिए कि आप एक बड़े सूटकेस को एक छोटी कार की डिक्की में फिट करने की कोशिश कर रहे हैं।
    • आप सोच सकते हैं, "मुझे कपड़ों को इस विशिष्ट तरीके से मोड़ना होगा ताकि वे फिट हो सकें।"
    • लेकिन प्रयोग ने दिखाया कि जब तक आप बस सूटकेस को कंप्रेस (दबाना) करते हैं (रैंक को कम करते हैं), तो वह फिट हो जाता है और जल्दी पहुँच जाता है। इससे कोई फर्क नहीं पड़ता कि आप शर्ट या पैंट को पहले मोड़ते हैं; स्पेस को कंप्रेस करने की क्रिया ही मायने रखती है।

निष्कर्ष: मॉडल जिन विशिष्ट "दिशाओं" में सीखता है, वे सीखने की प्रक्रिया का एक लक्षण मात्र हैं, कारण नहीं। असली जादू यह है कि मॉडल को इन गणितीय ट्रिक्स को सीखने के लिए अपने पूरे, अस्त-व्यस्त मस्तिष्क की आवश्यकता नहीं है; उसे केवल इसके एक छोटे, संकुचित संस्करण की आवश्यकता है।


सामान्य दर्शकों के लिए सारांश

  1. पदचिह्नों को देखना बंद करें: यदि आप समझना चाहते हैं कि AI कैसे सीखता है, तो उसके द्वारा लिए गए पथ (ऑप्टिमाइज़र अपडेट) को न देखें। वह पथ इतिहास और समझौतों के कारण बहुत अस्त-व्यस्त है।
  2. मानचित्र को देखें: उन कच्चे निर्देशों (ग्रेडिएंट्स) को देखें जिनका AI अभी पालन कर रहा है। यह वास्तविक "सीखने की दिशाओं" को प्रकट करता है, जो बहुत अधिक मजबूत और स्पष्ट हैं।
  3. कार्यों को अलग करें: यदि एक AI एक साथ कई चीजें कर रहा है, तो संयुक्त पथ एक विफलता जैसा दिखेगा। वास्तविक सफलता देखने के लिए आपको प्रत्येक कार्य को अलग-अलग देखना होगा।
  4. सादगी जीतती है: AI तेजी से सीखता है जब उसे सरल होने के लिए मजबूर किया जाता है। उसे सीखने के लिए जटिल, विशिष्ट दिशाओं की आवश्यकता नहीं है; उसे बस एक छोटे, सरल स्थान तक सीमित रहने की आवश्यकता है।

यह पेपर मूल रूप से हमें बताता है कि AI को "व्याख्या करने" के लिए हमारे वर्तमान उपकरण गलत चीज़ को देख रहे हैं। डेटा के एक स्वच्छ दृश्य की ओर स्विच करके, हम देख सकते हैं कि AI हमारी सोच से कहीं अधिक प्रभावी ढंग से और सरलता से सीख रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →