← नवीनतम पेपर
🤖 machine learning

How are linear representations learned? Exact solutions to the dynamics of abstraction

यह शोध पत्र अमूर्तता (abstraction) का एक गतिक सिद्धांत प्रस्तुत करता है जो रैखिक और गैर-रैखिक दोनों न्यूरल नेटवर्क में प्रशिक्षण के दौरान रैखिक अवधारणा प्रतिनिधित्व (linear concept representations) कैसे उभरते हैं, इसके सटीक समाधान व्युत्पन्न करता है, जिससे यह प्रकट होता है कि अमूर्तता डेटा ज्यामिति, नेटवर्क गहराई और इनिशियलाइजेशन स्केल द्वारा शासित होती है और एक सार्वभौमिक क्षीणन नियम (universal attenuation law) का पालन करती है जो प्री-एक्टिवेशन्स (preactivations) की तुलना में एक्टिवेशन्स (activations) में अमूर्तता को कमजोर करती है।

मूल लेखक: William W. Yang, Andrew M. Saxe, Peter E. Latham

प्रकाशित 2026-07-13
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: William W. Yang, Andrew M. Saxe, Peter E. Latham

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को दुनिया को समझना सिखाने की कोशिश कर रहे हैं। आप उसे लाल वर्ग (red squares), नीले वर्ग (blue squares), लाल वृत्त (red circles) और नीले वृत्त (blue circles) की तस्वीरें दिखाते हैं। आप चाहते हैं कि रोबोट यह सीखे कि "वर्ग-पन" (square-ness) एक एकल, सुसंगत विचार है, चाहे वह लाल हो या नीला। उसके मस्तिष्क में (एक न्यूरल नेटवर्क में), यह विचार एक विशाल, बहु-आयामी मानचित्र में एक विशिष्ट दिशा के रूप में संग्रहीत है। यदि रोबोट "अमूर्त" (abstract) है, तो "लाल दुनिया" में "वर्ग घटाव वृत्त" (square minus circle) की दिशा ठीक उसी दिशा में होनी चाहिए जिसमें "नीली दुनिया" में "वर्ग घटाव वृत्त" की दिशा है। वे समानांतर होने चाहिए।

यह शोध पत्र इस बात की गहरी पड़ताल है कि प्रशिक्षण के दौरान वह सटीक संरेखण (alignment) कैसे होता है, और क्या चीज़ इसे पूरी तरह से होने से रोकती है।

बड़ी खोज: "समृद्ध" बनाम "सुस्त" सीखने का नृत्य (The "Rich" vs. "Lazy" Learning Dance)

लेखकों ने इस संरेखण को वास्तविक समय में देखने के लिए एक न्यूरल नेटवर्क का एक सरलीकृत, गणितीय रूप से हल करने योग्य संस्करण बनाया। उन्होंने पाया कि समझ की राह एक सीधी रेखा नहीं है; यह एक आश्चर्यजनक मोड़ के साथ एक नृत्य है।

रोबोट की सीखने की प्रक्रिया को एक हाइकर (पगडंडी पर चलने वाला) के रूप में सोचें जो एक विशिष्ट कैंपसाइट (कैंपिंग स्थल) तक पहुँचने की कोशिश कर रहा है (अंतिम, पूर्ण समझ)।

  • गंतव्य (The Destination): अंतिम स्थान का कैंपसाइट पूरी तरह से इलाके (डेटा) और मानचित्र (लक्ष्य) द्वारा निर्धारित होता है। यदि डेटा अव्यवset (messy) है, तो कैंपसाइट भी अव्यवset होगा। यदि डेटा साफ है, तो कैंपसाइट भी उत्तम होगा।
  • हाइकर का सामान (The Hiker's Gear - Initialization): यहाँ दिलचस्प बात है। हाइकर अपनी यात्रा कैसे शुरू करता है, यह उसके द्वारा तय किए जाने वाले पथ को बदल देता है, भले ही गंतव्य वही रहे।
    • "समृद्ध" हाइकर (छोटा प्रारंभ - Tiny Start): यदि रोबोट बहुत-बहुत छोटे भार (weights) के साथ शुरू करता है (जैसे एक हाइकर जिसके पास बहुत हल्का बैकपैक हो), तो वह अव्यवset मध्य क्षेत्र को पार कर जाता है और बहुत जल्दी पूर्ण संरेखण के एक बिंदु पर पहुँच जाता है। वह वहां काफी लंबे समय तक रहता है, जैसे कि वह पूर्ण समझ के टाइम लूप में फंस गया हो। इसे लेखक "metastability" कहते हैं। यह इतना पूर्ण है कि यदि आप प्रशिक्षण को जल्दी रोक देते, तो आपको लगेगा कि रोबोट ने अवधारणा को हमेशा के लिए मास्टर कर लिया है।
    • "सुस्त" हाइकर (बड़ा प्रारंभ - Big Start): यदि रोबोट बड़े भार (भारी बैकपैक) के साथ शुरू करता है, तो वह उस ऊंचाई तक कभी नहीं पहुँच पाता। वह बस धीरे-धीरे अंतिम गंतव्य की ओर चढ़ता है और वहीं रुक जाता है। वह उस पूर्णता के क्षण को कभी नहीं देख पाता।

नियम: अंतिम गंतव्य डेटा द्वारा निश्चित है, लेकिन प्रशिक्षण के दौरान समझ का शिखर इस बात से नियंत्रित होता है कि आपने कितनी छोटी शुरुआत की। यदि आप पर्याप्त छोटा शुरू करते हैं, तो रोबोट शोर वाले (noisy) डेटा के बावजूद भी लगभग पूर्ण अमूर्तता (abstraction) प्राप्त कर सकता है।

गहराई का प्रभाव: गहरा जाने से समझ बढ़ती है (The Depth Effect)

पत्र ने यह भी देखा कि जब आप न्यूरॉन्स की परतों को अधिक जोड़ते हैं, जैसे एक ऊँचा टॉवर बनाना।

  • उपमा (Analogy): कल्पना करें कि एक संदेश को लोगों की एक पंक्ति में नीचे भेजा जा रहा है। यदि संदेश "लाल वर्ग" है, तो पहला व्यक्ति इसे थोड़े लहजे (accent) के साथ बोलेगा। दूसरा व्यक्ति इसे थोड़ा साफ करेगा। जब तक यह एक ऊंचे टॉवर के शीर्ष तक पहुँचता है, संदेश बिल्कुल स्पष्ट हो जाता है।
  • निष्कर्ष: लेखकों ने गणितीय रूप से सिद्ध किया कि जैसे-जैसे आप परतें बढ़ाते हैं, अंतिम प्रतिनिधित्व (representation) अधिक अमूर्त होता जाता है। यह एक सहज इंटरपोलेशन है: आप जितना गहरा जाते हैं, आप "शुद्ध" अवधारणा के उतने ही करीब पहुँचते हैं, बशर्ते कि आप जिस लक्ष्य की भविष्यवाणी करने की कोशिश कर रहे हैं वह पहले से ही अमूर्त हो।

नॉनलिनियरी ट्रैप: क्यों "एक्टिवेशन" विचार को धुंधला कर सकता है (The Nonlinearity Trap)

वास्तविक न्यूरल नेटवर्क केवल सीधी रेखाएं नहीं हैं; उनमें "नॉनलिनियरीज़" (जैसे ReLU या GELU) होती हैं जो गेट या फिल्टर की तरह कार्य करती हैं। पत्र ने परीक्षण किया कि इन गेटों के माध्यम से "अवधारणा दिशा" को पारित करने पर क्या होता है।

  • निष्कर्ष: ये गेट संरेखण को कमजोर करते हैं। वे एक बल्ब के डिमर स्विच की तरह काम करते हैं। "प्री-एक्टिवेशन" (गेट से पहले का सिग्नल) अधिक उज्ज्वल और संरेखित होता है, जबकि "एक्टिवेशन" (गेट के बाद का सिग्नल) कम होता है।
  • प्रमाण: लेखकों ने विशिष्ट नॉनलिनियरीज़ जैसे कि एरर फंक्शन (erf) और लीकी ReLU के लिए एक "क्षीणन नियम" (Attenuation Law) सिद्ध किया: ये नॉनलिनियरीज़ अपने से पहले के सिग्नल की तुलना में अमूर्तता स्कोर को कम करती हैं। वे अनुमान लगाते हैं कि यह व्यापक परिवार की नॉनलिनियरीज़ पर भी लागू होता है, लेकिन सख्त प्रमाण इन विशिष्ट मामलों पर लागू होता है। वे जादुई रूप से खराब संरेखण को ठीक नहीं करते; वे बस इसे थोड़ा और खराब कर देते हैं।

वास्तविक AI के लिए इसका क्या अर्थ है

लेखकों ने केवल गणित तक ही सीमित नहीं रहे; उन्होंने इन विचारों का परीक्षण DINOv3 (एक विजन मॉडल) और Gemma 4 (एक भाषा मॉडल) जैसे वास्तविक, विशाल मॉडलों पर किया।

  • प्रयोग: उन्होंने इन विशाल मॉडलों को लिया और अस्थायी रूप से उनके GELU एक्टिवेशन फंक्शन को आइडेंटिटी फंक्शन (identity function) से बदल दिया (अनिवार्य रूप से उस चरण के लिए नॉनलिनियरी को हटा दिया) यह देखने के लिए कि क्या होता है।
  • परिणाम: जब उन्होंने नॉनलिनियरीज़ को हटाया, तो अवधारणाएं अधिक अमूर्त हो गईं और मॉडल सामान्यीकरण (generalization - एक संदर्भ से दूसरे संदर्भ में ज्ञान का हस्तांतरण) करने में बेहतर हो गए। यह सिद्धांत की पुष्टि करता है: नॉनलिनियरीज़ वास्तव में अवधारणाओं को धुंधला कर रही थीं।

यह पत्र क्या खारिज करता है

यह जानना महत्वपूर्ण है कि यह पत्र क्या नहीं कहता है:

  • यह केवल अंत के बारे में नहीं है: पिछले सिद्धांत अक्सर प्रशिक्षण के बिल्कुल अंत को देखते थे, यह मानकर कि रोबोट अंततः इसे पूर्ण कर लेगा। यह पत्र दिखाता है कि यात्रा मायने रखती है। रोबोट पूर्णता के शिखर पर पहुँच सकता है और फिर भटक सकता है, या यदि आपने इसकी शुरुआत कैसे की है, तो यह कभी उस तक पहुँच ही नहीं पाएगा।
  • यह हमेशा पूर्ण नहीं होता: वास्तविक दुनिया में, अव्यवset (messy) डेटा के साथ, रोबोट शायद ही कभी 100% पूर्ण संरेखण तक पहुँचता है। पत्र दिखाता है कि अंतिम अमूर्तता स्तर इनपुट और लक्ष्य में मौजूद "शोर" (noise) पर आधारित एक गणितीय सूत्र है। यदि डेटा शोर वाला है, तो अमूर्तता अपूर्ण होगी, चाहे आप कितना भी लंबा प्रशिक्षण क्यों न दें।

वे कितने आश्वस्त हैं?

  • गणित: सरल, रैखिक नेटवर्क के लिए, लेखकों के पास सटीक, सिद्ध समाधान हैं। उन्होंने केवल अनुमान नहीं लगाया; उन्होंने समीकरणों को हल किया। वे जानते हैं कि अमूर्तता समय के साथ कैसे चलती है।
  • सिमुलेशन: गहरे, नॉनलीनियर नेटवर्क के लिए, उन्होंने सिमुलेशन और गणितीय सन्निकटन (approximations/infinite-width limits) का उपयोग किया। परिणाम बहुत मजबूत हैं और सिद्धांत से मेल खाते हैं, लेकिन वे इन विशिष्ट गणितीय मॉडलों से प्राप्त किए गए हैं।
  • वास्तविक दुनिया: जब उन्होंने इसे DINOv3 और Gemma 4 पर लागू किया, तो उन्होंने परिणामों को मापा। प्रयोगों ने दिखाया कि उनका सिद्धांत कायम है: नॉनलिनियरीज़ को हटाने से इन वास्तविक मॉडलों में अमूर्तता और सामान्यीकरण में सुधार हुआ।

मुख्य निष्कर्ष (The Takeaway)

अवधारणाओं को समझना एक पथ पर चलने जैसा है। गंतव्य डेटा द्वारा निर्धारित होता है, लेकिन आप जो पथ चुनते हैं वह इस बात पर निर्भर करता है कि आप कैसे शुरू करते हैं। यदि आप छोटे से शुरुआत करते हैं, तो आप स्पष्टता के एक शुद्ध क्षण तक पहुँच सकते हैं जो लंबे समय तक बना रहता है। यदि आप और गहरा जाते हैं, तो आप अधिक स्पष्ट होते जाते हैं। लेकिन रास्ते में मिलने वाले गेटों (नॉनलिनियरीज़) से सावधान रहें; वे आपकी समझ की रोशनी को कम कर देते हैं। इन गतिकी (dynamics) को समझकर, हम AI मस्तिष्क के भीतर झांकने के लिए बेहतर उपकरण बना सकते हैं और उन्हें अधिक स्मार्ट बना सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →