← नवीनतम पेपर
💬 NLP

CoFrGeNet: Continued Fraction Architectures for Language Generation

यह शोध पत्र CoFrGeNets को प्रस्तुत करता है, जो निरंतर भिन्नों (continued fractions) से प्रेरित एक नवीन आर्किटेक्चर परिवार है जो मानक ट्रांसफॉर्मर घटकों को पैरामीटर-कुशल विकल्पों से बदल देता है, जिससे काफी कम पैरामीटर्स और कम प्री-ट्रेनिंग समय के साथ बड़े पैमाने के भाषा मॉडलों पर प्रतिस्पर्धी या बेहतर प्रदर्शन प्राप्त होता है।

मूल लेखक: Amit Dhurandhar, Vijil Chenthamarakshan, Dennis Wei, Tejaswini Pedapati, Karthikeyan Natesan Ramamurthy, Rahul Nair

प्रकाशित 2026-05-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Amit Dhurandhar, Vijil Chenthamarakshan, Dennis Wei, Tejaswini Pedapati, Karthikeyan Natesan Ramamurthy, Rahul Nair

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, अविश्वसनीय रूप से बुद्धिमान रोबोट है जो कहानियाँ लिखता है, सवालों के जवाब देता है और समस्याओं को हल करता है। इस रोबोट को एक विशिष्ट ब्लूप्रिंट का उपयोग करके बनाया गया है जिसे ट्रांसफॉर्मर (Transformer) कहा जाता है। वर्षों से, यह ब्लूप्रिंट स्वर्ण मानक (gold standard) रहा है, लेकिन यह भारी है, इसे चलाना महंगा है, और इसे कार्य करने के लिए बहुत अधिक "मस्तिष्क शक्ति" (पैरामीटर्स) की आवश्यकता होती है।

यहाँ उनके द्वारा दी गई व्याख्या है, जिसे सरल शब्दों में समझाया गया है:

1. समस्या: रोबोट बहुत भारी है

वर्तमान AI मॉडल (जैसे प्रसिद्ध GPT-2 या Llama) सोचने के लिए दो मुख्य इंजनों पर निर्भर करते हैं:

  • अटेंशन इंजन (The Attention Engine): यह रोबोट को पिछले शब्दों को याद रखने में मदद करता है ताकि वह संदर्भ को समझ सके (जैसे यह याद रखना कि आपने पाँच वाक्य पहले क्या कहा था)।
  • फीड-फॉरवर्ड इंजन (The Feed-Forward Engine): यहीं पर रोबोट वास्तव में जानकारी को प्रोसेस करता है और निर्णय लेता है।

ये इंजन शक्तिशाली हैं लेकिन भारी हैं। इन्हें चलाने के लिए लाखों गियर (पैरामीटर्स) की आवश्यकता होती है, जिससे रोबोट को बनाना धीमा और महंगा हो जाता है।

2. समाधान: "दीवार" के बजाय एक "सीढ़ी"

लेखकों ने कंटीन्यूड फ्रैक्शन (Continued Fraction) नामक एक पुराने गणितीय विचार को देखा। एक ऐसे भिन्न (fraction) की कल्पना करें जो केवल रुकता नहीं है; यह एक सीढ़ी की तरह नीचे जाता रहता है:
a0+1a1+1a2+ a_0 + \frac{1}{a_1 + \frac{1}{a_2 + \dots}}

अतीत में, लोगों ने इस "सीढ़ी" विचार का उपयोग सरल गणितीय समस्याओं के लिए करने की कोशिश की थी। लेकिन यह शोध पत्र पूछता है: क्या हम इस सीढ़ी का उपयोग पूरे नए रोबोट के मस्तिष्क को बनाने के लिए कर सकते हैं?

उन्होंने CoFrGE NETs (कंटीन्यूड फ्रैक्शन जेनेरेटिव नेटवर्क) बनाए। भारी, मानक इंजनों के बजाय, उन्होंने इन गणितीय सीढ़ियों को प्रतिस्थापित किया।

  • जादू: ये सीढ़ियाँ वही काम कर सकती हैं जो भारी इंजन करते हैं, लेकिन इसमें कम गियर की आवश्यकता होती है।
  • परिणाम: उन्होंने ऐसे मॉडल बनाए जो मूल दिग्गजों की तुलना में 33% से 50% छोटे (कम पैरामीटर्स) हैं, फिर भी वे समान रूप से अच्छा, या कभी-कभी उससे भी बेहतर प्रदर्शन करते हैं।

3. "विभाजन" की बाधा (और उन्होंने इसे कैसे ठीक किया)

एक समस्या थी। इन सीढ़ियों की गणना करने में बहुत अधिक विभाजन (division) शामिल है। कंप्यूटर हार्डवेयर में, विभाजन करना एक भारी पत्थर को पहाड़ी पर धकेलने जैसा है—यह गुणा (multiplication) की तुलना में बहुत धीमा और ऊर्जा-गहन है।

यदि आपके पास 100 पायदानों वाली एक गहरी सीढ़ी है, तो हर पायदान पर एक विभाजन करना मॉडल को बहुत धीमा बना देगा।

नवाचार:
लेखकों ने महसूस किया कि वे पूरी सीढ़ी की गणना एक साथ करने के लिए एक गणितीय शॉर्टकट (कंटीन्यून्ट्स/Continuants) का उपयोग कर सकते हैं।

  • पुराना तरीका: उत्तर प्राप्त करने के लिए 100 विभाजन करें।
  • नया तरीका: पूरी गणित को एक बार में करें, और अंत में केवल एक एकल विभाजन करें।

यह समझने जैसा है कि आपको ऊपर तक पहुँचने के लिए हर पायदान पर चढ़ने की ज़रूरत नहीं है; आप एक गणना किए गए शॉर्टकट का उपयोग करके एक बड़ी छलांग लगा सकते हैं। इसने उनके मॉडलों को प्रशिक्षित करना और चलाना बहुत तेज़ बना दिया।

4. उन्होंने इसका परीक्षण कैसे किया

उन्होंने केवल इसे बनाया ही नहीं; उन्होंने दिग्गजों के खिलाफ इसकी परीक्षा भी ली:

  • परीक्षण विषय: उन्होंने GPT-2-xl (1.5 बिलियन पैरामीटर वाला मॉडल) और Llama3 (3.2 बिलियन पैरामीटर वाला मॉडल) के कुछ हिस्सों को बदला।
  • प्रशिक्षण: उन्होंने इन नए मॉडलों को इंटरनेट के विशाल टेक्स्ट (OpenWebText, GneissWeb, और विभिन्न दस्तावेजों का मिश्रण) पर सिखाया।
  • परिणाम:
    • छोटा: नए मॉडल काफी छोटे थे।
    • तेज़: वे तेज़ी से प्रशिक्षित हुए और तेज़ी से चले।
    • स्मार्ट (या बराबर): जब उन्हें पढ़ने की समझ, प्रश्न पूछने और तर्क करने वाले कार्यों पर परखा गया, तो छोटे CoFrGeNet मॉडलों ने बहुत बड़े मूल मॉडलों के प्रदर्शन के बराबर या उससे बेहतर प्रदर्शन किया।

5. "ट्रेनिंग शेड्यूल" का नुस्खा

उन्होंने यह भी खोजा कि आप रोबोट के सभी बटनों को एक साथ नहीं घुमा सकते। उन्होंने एक विशेष "ट्रेनिंग शेड्यूल" (सीखने की चरण-दर-चरण योजना) का आविष्कार किया।

  • उपमा: कल्पना कीजिए कि आप एक बच्चे को साइकिल चलाना सिखा रहे हैं। आप पहले ही दिन उसे पैडल मारने, स्टीयर करने और संतुलन बनाने के लिए नहीं छोड़ देते। आप पहले ट्रेनिंग व्हील्स (सहायक पहियों) के साथ शुरू करते हैं, फिर उसे स्टीयर करना सिखाते हैं, और फिर पैडल मारना सिखाते हैं।
  • परिणाम: पहले अपनी सीढ़ी के "सबसे गहरे" हिस्सों को अपडेट करके और फिर धीरे-धीरे अन्य हिस्सों को अनलॉक करके, मॉडल अधिक स्थिरता से सीखे और बेहतर प्रदर्शन किया।

सारांश

पेपर का दावा है कि मानक "भारी" AI मॉडल के हिस्सों को एक चतुर, गणित-आधारित "सीढ़ी" संरचना से बदलकर, हम आज के विशाल मॉडलों जितने ही अच्छे, छोटे, तेज़ और सस्ते AI मॉडल बना सकते हैं।

उन्होंने क्या दावा नहीं किया:

  • उन्होंने यह दावा नहीं किया कि यह चिकित्सा निदान या नैदानिक उपयोगों के लिए काम करता है।
  • उन्होंने यह दावा नहीं किया कि यह AI सुरक्षा समस्याओं को हल करता है (वास्तव में, उन्होंने उल्लेख किया कि ये मॉडल अन्य मॉडलों की तरह ही "भ्रमित" (hallucinate) हो सकते हैं या गलतियाँ कर सकते हैं)।
  • उन्होंने यह दावा नहीं किया कि यह तत्काल व्यावसायिक उपयोग के लिए तैयार है, बल्कि यह भविष्य के अनुसंधान और औद्योगिक वर्कफ़्लो के लिए एक आशाजनक नया आर्किटेक्चर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →