← नवीनतम पेपर
📊 statistics

KANs need curvature: penalties for compositional smoothness

यह शोध पत्र एक नवीन बेस-अग्नोस्टिक कर्वेचर पेनल्टी (basis-agnostic curvature penalty) को व्युत्पन्न करके कोलमोगोरोव-आर्नोल्ड नेटवर्क (KANs) की उच्च-वक्रता दोलनों (high-curvature oscillations) के कारण उत्पन्न व्याख्यात्मकता चुनौतियों को संबोधित करता है, जिसे लागू करने पर भविष्य कहने वाली सटीकता से समझौता किए बिना मॉडल सक्रियणों (model activations) को महत्वपूर्ण रूप से सुचारू बनाता है।

मूल लेखक: James Bagrow

प्रकाशित 2026-05-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: James Bagrow

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

समस्या: "कटी-फटी" (Jagged) समाधान

कल्पना कीजिए कि आप एक रोबोट को एक चिकनी, बहती हुई वक्र रेखा (curve) बनाना सिखाने की कोशिश कर रहे हैं, जैसे कि एक साइन वेव (sine wave)। आप रोबोट को KANs (कोलमोगोरोव-आर्नोल्ड नेटवर्क) नामक उपकरणों का एक विशेष सेट देते हैं। ये उपकरण बहुत अच्छे हैं क्योंकि मानक AI की तरह जो एक 'ब्लैक बॉक्स' की तरह काम करता है, KANs आपको यह देखने की अनुमति देते हैं कि वे चित्र कैसे बना रहे हैं। प्रत्येक "ब्रशस्ट्रोक" (एक्टिवेशन फंक्शन) स्पष्ट और समझने योग्य है।

हालाँकि, शोध में एक गड़बड़ी पाई गई। जब ये रोबोट डेटा को पूरी तरह से फिट करने की कोशिश करते हैं, तो वे अक्सर "झटका देने वाले" (jittery) हो जाते हैं। एक चिकनी रेखा खींचने के बजाय, वे एक ऐसी रेखा खींचते हैं जो कटी-फटी पहाड़ी श्रृंखला या टेढ़ी-मेढ़ी लकीर जैसी दिखती है। यह डेटा पॉइंट्स को तो सटीक रूप से फिट करती है, लेकिन यह उस चिकनी वक्र रेखा जैसी बिल्कुल नहीं दिखती जिसकी आपने उम्मीद की थी।

लेखक इसे "हाई-कर्वेचर ऑसिलेशन" (high-curvature oscillation) कहते हैं। सरल भाषा में: रोबमा बहुत अधिक सोच रहा है और अपने चित्र में अनावश्यक लहरें और मोड़ जोड़ रहा है।

पुराना समाधान: "आलसी" दंड (Penalty)

पहले, वैज्ञानिक इस झटके को रोकने के लिए एक मानक "दंड" (penalty) का उपयोग करने की कोशिश करते थे। इसे ऐसे समझें जैसे एक शिक्षक रोबोट को कहता है, "बहुत अधिक स्याही का उपयोग न करें।"

  • समस्या: यह दंड केवल यह जाँचता है कि कितनी स्याही का उपयोग किया गया है (परिमाण/magnitude), न कि इसका कि उसका उपयोग कैसे किया गया है।
  • परिणाम: एक रोबोट एक चिकनी रेखा खींचने के लिए बहुत कम स्याही का उपयोग कर सकता है, या एक पागलपन भरी, कटी-फटी लकीर खींचने के लिए भी बहुत कम स्याही का उपयोग कर सकता है। पुराना दंड इन दोनों के बीच अंतर नहीं कर सकता। यह एक ऐसे शिक्षक की तरह है जो निबंध में केवल शब्दों की संख्या गिनता है लेकिन यह नहीं पढ़ता कि वाक्य अर्थपूर्ण हैं या नहीं। रोबोट कटी-फटी रेखाएं खींचता रहता है क्योंकि दंड उस "कटे-फटेपन" को देख नहीं पाता।

नया समाधान: "चिकनाई" (Smoothness) दंड

लेखकों ने एक नया, अधिक स्मार्ट दंड बनाया है। केवल स्याही गिनने के बजाय, यह नया दंड रेखाओं की "बेंडिंग एनर्जी" (bending energy - मोड़ने की ऊर्जा) को मापता है।

  • उपमा: कल्पना कीजिए कि आप एक लचीले रूलर (पटरी) को मोड़ रहे हैं। यदि आप इसे धीरे से एक चिकने चाप (arc) में मोड़ते हैं, तो इसमें बहुत कम प्रयास लगता है। यदि आप इसे एक तीखे ज़िग-ज़ैग में मोड़ने की कोशिश करते हैं, तो इसमें बहुत अधिक प्रयास और ऊर्जा लगती है।
  • समाधान: नया दंड रोबोट से इस आधार पर "शुल्क" वसूलता है कि उसकी रेखाओं को मोड़ने में कितनी ऊर्जा लगती है। यदि रोबोट एक कटी-फटी ज़िग-ज़ैग रेखा खींचता है, तो शुल्क बहुत अधिक होता है। यदि वह एक चिकना वक्र खींचता है, तो शुल्क कम होता है।
  • परिणाम: रोबोट सीख जाता है कि अपना "शुल्क" कम रखने के लिए, उसे चिकनी रेखाएं खींचनी होंगी। शोध दिखाता है कि इस नए दंड के साथ, रोबोट अभी भी सटीक रूपता से चित्र बना सकता है, लेकिन अब रेखाएं चिकनी, पठनीय और वैसी ही दिखती हैं जैसा कि वास्तविक फंक्शन है।

यह क्यों महत्वपूर्ण है: "चेन रिएक्शन"

कोई पूछ सकता है: "यदि हम केवल व्यक्तिगत ब्रशस्ट्रोक को चिकना कर देते हैं, तो क्या पूरा चित्र चिकना रहता है?"

  • चिंता: एक गहरे नेटवर्क (deep network) में, एक परत का आउटपुट अगली परत के लिए इनपुट बन जाता है। यह एक चेन रिएक्शन की तरह है। यदि पहली परत थोड़ी डगमगाती है, तो अगली परत उस डगमगाहट को एक बड़ी गड़बड़ी में बदल सकती है।
  • खोज: लेखकों ने गणितीय रूप से सिद्ध किया कि यदि आप व्यक्तिगत किनारों (ब्रशस्ट्रोक) को चिकना करते हैं, तो आप स्वचालित रूप से पूरे चित्र की अव्यवस्था पर एक "सीमा" (ceiling) लगा देते हैं। छोटे हिस्सों को नियंत्रित करके, आप पूरे को नियंत्रित करते हैं।
  • बोनस: उन्होंने इसे और भी बेहतर बनाने का एक तरीका भी खोजा है जिसमें दंड को भार (weighting) दिया जाता है। कुछ ब्रशस्ट्रोक अंतिम चित्र के लिए दूसरों की तुलना में अधिक महत्वपूर्ण होते हैं। इन "महत्वपूर्ण" स्ट्रोक पर अधिक ध्यान देकर, रोबोट और भी तेज़ी से और सटीकता से सीखता है।

बड़ी जीत: स्थिरता और सरलता

इससे पहले, यदि कोई रोबोट बहुत जटिल (overparameterized) हो जाता था, तो वह अस्थिर हो जाता था और क्रैश हो जाता था। इसे ठीक करने के लिए, वैज्ञानिकों को एक जटिल, बहु-चरणीय प्रशिक्षण प्रक्रिया का उपयोग करना पड़ता था: एक सरल ग्रिड से शुरू करें, प्रशिक्षित करें, फिर एक जटिल ग्रिड पर स्विच करें, और फिर से शुरू करें। यह एक घर बनाने, फिर उसे गिराकर एक बड़ा घर बनाने जैसा था।

इस नए "स्मूथनेस पेनल्टी" के साथ, रोबोट शुरुआत से ही जटिल, उच्च-रिज़ॉल्यूशन वाले ग्रिड को संभाल सकता है। यह बिना किसी जटिल बहु-चरणीय प्रक्रिया के स्थिर रहता है।

सारांश

  • समस्या: AI मॉडल (KANs), जिन्हें समझने योग्य (interpretable) होना चाहिए, अक्सर कटी-फटी, बिखरी हुई रेखाएं बनाते हैं जिन्हें समझना कठिन होता है।
  • पुराना तरीका: इसे रेखाओं के "आकार" को सीमित करके रोकने की कोशिश की गई, जो काम नहीं आया।
  • नया तरीका: एक ऐसा दंड पेश किया गया जो "मोड़ने" या "लहर देने" के लिए शुल्क लेता है। यह AI को चिकनी, साफ रेखाएं खींचने के लिए मजबूर करता है।
  • परिणाम: AI उतना ही सटीक रहता है, लेकिन परिणाम चिकने, स्थिर और मनुष्यों के लिए समझने में बहुत आसान होते हैं। यह एक "ब्लैक बॉक्स" को एक स्पष्ट, पठनीय स्केच में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →