← नवीनतम पेपर
🤖 machine learning

TANGO: Token-Aggregated Nonlinear Gating Operators for Natural and Formal Language Modeling

यह शोध पत्र TANGO को प्रस्तुत करता है, जो एक नवीन भाषा मॉडल आर्किटेक्चर है जो गणितीय और शैक्षिक डेटासेट पर बेहतर प्रदर्शन प्राप्त करने के लिए मानक ट्रांसफॉर्मर सबलेयर्स को क्रॉस-टोकन गेटेड रेसिडुअल अपडेट से बदल देता है, साथ ही इसका लीनियर-कॉम्प्लेक्सिटी वेरिएंट WANGO मौजूदा लीनियर-टाइम मॉडल्स से बेहतर प्रदर्शन करता है।

मूल लेखक: Joshua Nunley

प्रकाशित 2026-08-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Joshua Nunley

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की दुनिया में, भाषा को समझने के लिए सबसे शक्तिशाली उपकरण एक संरचना पर निर्भर करते हैं जिसे 'ट्रांसफॉर्मर' कहा जाता है। कल्पना कीजिए कि एक पाठक एक लंबे दस्तावेज़ को पढ़ रहा है; किसी विशिष्ट शब्द को समझने के लिए, उसे संदर्भ को समझने हेतु उन शब्दों को देखना होगा जो उससे पहले आए थे। मानक एआई मॉडल यह काम दो अलग-अलग चरणों का उपयोग करके करते हैं। पहले, वे पिछले शब्दों से प्रासंगिक जानकारी एकत्र करने के लिए पूरे पाठ का स्कैन करते हैं, जो एक लाइब्रेरियन द्वारा किसी विषय से संबंधित हर उस किताब को तेजी से खोजने के समान है जो प्रासंगिक हो सकती है। दूसरा, वे उस एकत्रित जानकारी को लेते हैं और वाक्य में प्रत्येक स्थिति में एक अलग, स्वतंत्र फिल्टर के माध्यम से संसाधित करते हैं ताकि अर्थ को परिष्कृत किया जा सके। इस दो-चरणीय प्रक्रिया ने क्षेत्र को अच्छी तरह से सेवा दी है, लेकिन यह गणनात्मक रूप से भारी है, जिसके लिए मॉडल को हर नए शब्द को उत्पन्न करने के लिए भारी मात्रा में गणना करनी पड़ती है, विशेष रूप से जब पाठ लंबा होता जाता है। शोधकर्ताओं ने इन चरणों को संयोजित करने या उन्हें सुव्यवस्थित करने का एक तरीका खोजने की लंबे समय से कोशिश की है, इस उम्मीद में कि वे ऐसे मॉडल बना सकें जो अधिक स्मार्ट और कुशल हों, जो सूचना की विशाल मात्रा को बिना उस गणितीय भार से दबे संभाल सकें जिसकी आवश्यकता इसे संसाधित करने के लिए होती है।

इंडियाना यूनिवर्सिटी ब्लूमिंगटन के एक शोधकर्ता ने एक नया दृष्टिकोण पेश किया है जो मौलिक रूप से इस बात को नया रूप देता है कि ये मॉडल भाषा के साथ कैसे परस्पर क्रिया करते हैं। वे अपनी रचना को TANGO कहते हैं, जिसका अर्थ है 'टोकन-एग्रीगेटेड नॉनलीनर गेटिंग ऑपरेटर्स' (Token-Aggregated Nonlinear Gating Operators)। सूचना एकत्र करने और सूचना को परिष्कृत करने के चरणों को अलग रखने के बजाय, TANGO उन्हें एक एकल, एकीकृत क्रिया में मिला देता है। इस नए डिजाइन में, वाक्य का प्रत्येक शब्द नियंत्रण के स्रोत के रूप में कार्य करता है। जैसे-जैसे मॉडल पढ़ता है, प्रत्येक शब्द निर्देशों का एक विशिष्ट सेट, या "गेट्स" (gates) उत्पन्न करता है, जो यह निर्धारित करते हैं कि पाठ की विभिन्न विशेषताओं पर कितना महत्व दिया जाए। जब मॉडल एक नए शब्द पर पहुँचता है, तो वह केवल यह देखने के लिए पीछे नहीं देखता कि कौन से पिछले शब्द सबसे प्रासंगिक हैं; बल्कि वह यह देखने के लिए पीछे देखता है कि उन पिछले शब्दों ने क्या निर्देश तैयार किए हैं। फिर यह उन निर्देशों का औसत निकालता है और मॉडल की स्मृति में जोड़ने से पहले वर्तमान शब्द की विशेषताओं को स्केल करने, या समायोजित करने के लिए उनका उपयोग करता है। इसका अर्थ यह है कि एक पिछले शब्द का प्रभाव केवल इस बारे में नहीं है कि वह क्या कहता है, बल्कि इस बारे में भी है कि वह वर्तमान शब्द को खुद की व्याख्या कैसे करने के लिए कहता है।

शोधकर्ता ने सटीकता और गति के बीच विभिन्न समझौतों का परीक्षण करने के लिए इस प्रणाली के दो संस्करण विकसित किए। पहला, TANGO, वर्तमान शब्द से पहले आने वाले प्रत्येक एकल शब्द को देखता है, चाहे वह पाठ में कितनी भी दूर क्यों न हो। यह "फुल-प्रिफिक्स" (full-prefix) दृष्टिकोण मॉडल को बातचीत या दस्तावेज़ के संपूर्ण इतिहास से जानकारी प्राप्त करने की अनुमति देता है, जिसके परिणामस्वरूप संदर्भ की अत्यधिक सटीक समझ प्राप्त होती है। हालाँकि, क्योंकि इसे वर्तमान शब्द की तुलना प्रत्येक पिछले शब्द से करनी पड़ती है, इसलिए जैसे-जैसे पाठ लंबा होता जाता है, इसके द्वारा किया जाने वाला कार्य तेजी से बढ़ता है। दूसरा संस्करण, जिसे WANGO कहा जाता है, बहुत लंबे पाठों के लिए अधिक व्यावहारिक दृष्टिकोण अपनाता है। यह हाल के शब्दों पर बहुत ध्यान देता है, उन्हें पहले मॉडल की तरह ही विस्तृत, पूर्ण-इतिहास वाली देखभाल के साथ देखता है। उन पुराने शब्दों के लिए जो एक हालिया विंडो के बाहर गिर जाते हैं, WANGO उनके प्रभाव को सारांशित करने के लिए एक अलग, अधिक कुशल विधि का उपयोग करता है। यह उन निर्देशों का एक चलता-फिरता हिसाब रखता है जो उन पुराने शब्दों ने उत्पन्न किए थे, जिससे यह प्रत्येक एक के साथ संबंध को पुन: गणना किए बिना उनकी बुद्धिमत्ता को शामिल कर सकता है। यह संशोधन Wango मॉडल के कार्यभार को पाठ लंबा होने पर जटिलता में विस्फोट करने के बजाय एक सीधी रेखा में बढ़ाता है, जिससे यह लंबे अनुक्रमों के लिए बहुत तेज़ हो जाता है।

यह देखने के लिए कि ये नए डिजाइन मौजूदा तकनीक के मुकाबले कैसे टिकते हैं, शोधकर्ता ने बिल्कुल समान डेटा, समान पैरामीटर और समान प्रशिक्षण कार्यक्रम का उपयोग करके छह अलग-अलग मॉडल प्रशिक्षित किए। उन्होंने इन मॉडलों का परीक्षण तीन बहुत अलग चुनौतियों पर किया: शैक्षिक वेब टेक्स्ट का एक बड़ा संग्रह, एक प्रोग्रामिंग भाषा 'लीन' (Lean) में लिखे गए औपचारिक गणितीय प्रमाणों का एक पुस्तकालय, और डीपमाइंड (DeepMind) की गणितीय समस्याओं का एक समूह। परिणामों ने दिखाया कि TANGO मॉडल ने, अपने पूर्ण-इतिहास वाले दृश्य के साथ, तीनों परीक्षणों में उच्चतम सटीकता प्राप्त की, जिससे अनुक्रम में अगले शब्द के लिए सबसे विश्वसनीय भविष्यवाणियां हुईं। इसने अन्य सभी मॉडलों को पीछे छोड़ दिया, जिनमें वे भी शामिल थे जिन्होंने परतों के बीच पैरामीटर साझा करने के पारंपरिक तरीकों का उपयोग किया था। Wango मॉडल भी असाधारण रूप से अच्छा प्रदर्शन करता रहा, विशेष रूप से कुशल मॉडलों की श्रेणी में। उन आर्किटेक्चरों के बीच जो लंबे पाठों को बिना गणनात्मक लागत को अनियंत्रित किए संभाल सकते थे, Wango ने सबसे सटीक परिणाम दिए। इसने उस मॉडल को भी हरा दिया जो समान मात्रा में गणना का उपयोग करता था लेकिन पुरानी, मानक तकनीकों पर निर्भर था।

यह अध्ययन इस बात पर प्रकाश डालता है कि इन प्रणालियों को कैसे बनाया जा सकता है। इन एग्रीगेटेड गेट्स के माध्यम से शब्दों को अन्य शब्दों के प्रसंस्करण को नियंत्रित करने की अनुमति देकर, शोधकर्ता ने एक ऐसा तरीका खोजा जिससे वे मॉडल बना सकें जो शक्तिशाली हों और, Wango के मामले में, कुशल भी हों। TANGO मॉडल ने प्रदर्शित किया कि सूचना एकत्र करने और परिष्कृत करने के लिए एक एकल, एकीकृत चरण पारंपरिक दो-चरणीय प्रक्रिया से बेहतर प्रदर्शन कर सकता है, भले ही मॉडल को अधिक गणितीय कार्य करने के लिए मजबूर किया गया हो। इस बीच, Wango मॉडल ने सिद्ध किया कि इस उच्च स्तर के प्रदर्शन के लिए गति का त्याग करना आवश्यक नहीं है; सूचना को बुद्धिमानी से सारांशित करके, इसने उच्च सटीकता बनाए रखते हुए गणनात्मक लागत को प्रबंधनीय रखा। शोधकर्ता ने सावधानीपूर्वक उल्लेख किया कि ये निष्कर्ष अनुक्रम में अगले शब्द की भविष्यवाणी करने की उनकी क्षमता पर आधारित हैं, जो भाषा की समझ का एक मानक पैमाना है, और यह दावा नहीं किया कि ये मॉडल आवश्यक रूप से गणितीय समस्याओं को हल कर सकते हैं या प्रमाणों को पूरी तरह से लिख सकते हैं। हालाँकि, परिणाम बताते हैं कि सूचना को गेट करने का यह नया तरीका जटिल भाषा और लंबे संदर्भों को अधिक सटीकता और दक्षता के साथ समझने के लिए एक आशाजनक मार्ग प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →