← नवीनतम पेपर
🤖 machine learning

LLMs Without Deep Neural Networks: New Architecture, Benefits and Case Study

यह शोध पत्र रेडियल बेसिस फंक्शन (RBF) नेटवर्क पर आधारित एक नवीन LLM आर्किटेक्चर प्रस्तुत करता है जो मानक DNNs की तुलना में बेहतर व्याख्यात्मकता, सटीकता और दक्षता प्रदान करते हुए, बिना किसी डीप न्यूरल नेटवर्क प्रशिक्षण के, एकल क्लोज्ड-फॉर्म इटरेशन में वैश्विक अनुकूलन प्राप्त करता है।

मूल लेखक: Vincent Granville

प्रकाशित 2026-06-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Vincent Granville

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: एक "बिना-प्रशिक्षण वाला" AI (No-Training AI)

कल्पना कीजिए कि आप एक ऐसी मशीन बनाना चाहते हैं जो किसी विशिष्ट कंपनी (जैसे NVIDIA) के बारे में सवालों के जवाब दे सके।

  • पुराना तरीका (मानक AI): आप मशीन को अरबों पन्नों का टेक्स्ट खिलाते हैं। फिर आप उसे उदाहरण दिखाकर और उसकी गलतियों को बार-बार सुधारकर महीनों तक "सिखाने" में बिताते हैं (इसे ट्रेनिंग कहा जाता है)। यह एक कुत्ते को नया करतब सिखाने जैसा है, जहाँ उसे हजारों बार दोहराना पड़ता है जब तक कि वह अंततः उसे सही से न कर ले।
  • नया तरीका (इस पेपर का मॉडल): लेखक, विन्सेंट ग्रैनविले (Vincent Granville), का दावा है कि उन्होंने एक ऐसी मशीन बनाई है जिसे "सिखाने" की बिल्कुल भी आवश्यकता नहीं है। ट्रायल और एरर (गलती और सुधार) के माध्यम से सीखने के बजाय, यह डेटा को देखता है और एक ही स्टेप में सटीक उत्तर निकाल लेता है। यह कुत्ते को नक्शा और दिशा-सूचक यंत्र (compass) देने जैसा है; उसे रास्ता चलने का अभ्यास करने की आवश्यकता नहीं है क्योंकि वह तुरंत मार्ग की गणना कर सकता है।

यह कैसे काम करता है: "सुपर-इंडेक्स" बनाम "ब्लैक बॉक्स"

मानक AI मॉडल को अक्सर "ब्लैक बॉक्स" कहा जाता है क्योंकि उनके निर्माता भी पूरी तरह से नहीं समझते कि वे किसी उत्तर तक कैसे पहुँचते हैं। वे जटिल गणित पर निर्भर करते हैं जो समय के साथ धीरे-धीरे बदलता रहता है।

यह नया मॉडल व्याख्या योग्य (Explainable) है और एक विशाल, स्मार्ट लाइब्रेरी इंडेक्स की तरह काम करता है:

  1. कोई "न्यूरॉन्स" नहीं: इसमें उन जटिल "डीप न्यूरल नेटवर्क्स" (DNNs) का उपयोग नहीं होता है जिनका उपयोग मानक AI करता है।
  2. रेडियल बेसिस फंक्शन्स (RBF): इसे दो चीजों के बीच की निकटता मापने के तरीके के रूप में समझें। यदि आप कोई प्रश्न पूछते हैं, तो मॉडल अपने टेक्स्ट के पुस्तकालय को देखता है और उन सटीक वाक्यांशों को खोजता है जो आपके प्रश्न के सबसे "करीब" हैं।
  3. वन-शॉट कैलकुलेशन: अनुमान लगाने और सुधारने के बजाय, यह गणित गारंटी देता है कि यदि उत्तर लाइब्रेरी में मौजूद है, तो मॉडल उसे पूरी तरह से ढूंढ लेगा। यह पहेली को एक ही बार में हल कर देता है।

"बेनाइन ओवरफिटिंग" (Benign Overfitting) का जादू

मानक AI में, "ओवरफिटिंग" एक बुरी चीज़ है। यह उस छात्र की तरह है जो पाठ्यपुस्तक को शब्द-दर-शब्द रट लेता है लेकिन परीक्षा में फेल हो जाता है क्योंकि प्रश्न थोड़े अलग होते हैं।

लेखक का दावा है कि उनका मॉडल "बेनाइन ओवरफिटिंग" नामक कार्य करता है।

  • उपमा (Analogy): एक मौसम मानचित्र की कल्पना करें। मानक मॉडल शहरों के बीच में चिकनी, धुंधली रेखाएं खींच सकते हैं, जिससे वे बीच के तापमान का अनुमान लगाते हैं। यह मॉडल एक ऐसा मानचित्र बनाता है जो हर उस शहर के सटीक तापमान को छूता है जिसे वह जानता है (पूर्ण सटीकता)।
  • ट्विस्ट: भले ही यह ज्ञात शहरों को पूरी तरह से "रट" रहा है, फिर भी यह ग्रामीण इलाकों के बीच के तापमान का अनुमान लगाने में आश्चर्यजनक रूप से अच्छा है (नया डेटा)। लेखक का दावा है कि यह तब भी काम करता है जब डेटा शोर भरा या अस्त-व्यस्त हो, जो एक फिल्टर की तरह सिग्नल को साफ करता है।

केस स्टडी: NVIDIA टेस्ट

लेखक ने इसका परीक्षण NVIDIA (एक टेक कंपनी) के वास्तविक दुनिया के डेटासेट पर किया।

  • कार्य: वाक्य में अगले शब्द की भविष्यवाणी करना या संबंधित व्यावसायिक वाक्यांशों को खोजना।
  • परिणाम: मॉडल ने उस डेटा पर 96% उत्तर सही दिए जिसे उसने पहले कभी नहीं देखा था।
  • तुलना: लेखक का दावा है कि मानक AI मॉडल आमतौर पर इसी तरह के विशिष्ट कार्यों पर केवल 30% से 55% तक ही सही उत्तर दे पाते हैं।
  • दक्षता (Efficiency): जबकि मानक मॉडलों को काम करने के लिए अरबों "पैरामीटर्स" (आंतरिक सेटिंग्स) की आवश्यकता हो सकती है, इस मॉडल को दस लाख से भी कम की आवश्यकता थी। यह किसी विशिष्ट गणितीय समस्या को हल करने के लिए सुपरकंप्यूटर के बजाय पॉकेट कैलकुलेटर का उपयोग करने जैसा है।

पेपर में उल्लेखित प्रमुख विशेषताएं

  • डिटरमिनिस्टिक (दोहराने योग्य): यदि आप एक ही प्रश्न दो बार पूछते हैं, तो आपको हर बार बिल्कुल वही उत्तर मिलेगा। मानक AI अक्सर हर बार थोड़ा अलग उत्तर देता है (जैसे पासा फेंकना)। यह मॉडल एक घड़ी की तरह है; यह सटीक और पूर्वानुमानित है।
  • कोई "ट्रेनिंग" चरण नहीं: आपको मॉडल को "ट्रेन" करने के लिए हफ्तों या महीनों बिताने की आवश्यकता नहीं है। आप बस डेटा फीड करते हैं, और यह तुरंत उपयोग के लिए तैयार है।
  • विशेषज्ञ फोकस: यह कविता लिखने या सामान्य गणित समस्याओं को हल करने के लिए डिज़ाइन नहीं किया गया है। यह स्पेशलाइज्ड स्मॉल लैंग्वेज मॉडल्स (SLMs) के लिए बनाया गया है। इसे एक विशेषज्ञ डॉक्टर के रूप में समझें जो एक विशिष्ट बीमारी के बारे में सब कुछ जानता है, न कि एक जनरल प्रैक्टिशनर के रूप में जो सब कुछ के बारे में थोड़ा-थोड़ा जानता है।
  • थ्री-वे ट्यूनिंग (Three-Way Tuning): चूंकि मॉडल पहले से ही अपने ज्ञात डेटा पर 100% सटीक है, इसलिए आप इसे सुधारने के लिए मानक "टेस्ट" विधि का उपयोग नहीं कर सकते। इसके बजाय, लेखक सेटिंग्स को बदलने के लिए एक विशेष "मिडल स्टेप" (ऑप्टिमाइजेशन सेट) का उपयोग करते हैं, जो बिल्कुल वैसा ही है जैसे एक शेफ खाना परोसने का इंतज़ार करने के बजाय खाना बनाते समय सॉस को चखता है।

यह क्या नहीं है (पेपर के आधार पर)

  • यह एक सामान्य AI नहीं है जो कोड लिख सके या इंटरनेट पर किसी भी विषय पर चैट कर सके। यह विशिष्ट कॉर्पोरेट दस्तावेजों पर केंद्रित है।
  • यह लंबी कहानियों को पढ़ने के लिए "अटेंशन" मैकेनिज्म (मानक AI के जटिल स्तर) का उपयोग नहीं करता है। यह सही व्यावसायिक उत्तर खोजने के लिए छोटे, विशिष्ट खंडों (मल्टी-टोकन्स) पर ध्यान केंद्रित करता है।
  • पेपर यह दावा नहीं करता है कि यह चिकित्सा निदान, क्लिनिकल ट्रायल, या रियल-टाइम इमेज रिकग्निशन के लिए काम करता है; यह एक विशिष्ट व्यावसायिक संदर्भ के भीतर टेक्स्ट प्रेडिक्शन और संख्यात्मक डेटा पर केंद्रित है।

सारांश

पेपर का तर्क है कि हमें विशिष्ट व्यावसायिक कार्यों के लिए शक्तिशाली AI बनाने के लिए विशाल, महंगे, "ब्लैक बॉक्स" न्यूरल नेटवर्क की आवश्यकता नहीं है। रेडियल बेसिस फंक्शन्स नामक गणितीय दृष्टिकोण का उपयोग करके, हम एक ऐसा सिस्टम बना सकते हैं जो तेज़, सस्ता, ज्ञात डेटा पर पूरी तरह से सटीक और नए डेटा का अनुमान लगाने में आश्चर्यजनक रूप से सक्षम है—और यह सब बिना उस थकाऊ "ट्रेनिंग" प्रक्रिया के, जिसकी मानक AI को आवश्यकता होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →