← नवीनतम पेपर
🤖 machine learning

FG2^2-GDN: Enhancing Long-Context Gated Delta Networks with Doubly Fine-Grained Control

यह शोध पत्र FG2^2-GDN को प्रस्तुत करता है, जो एक नवीन आर्किटेक्चर है जो स्केलर लर्निंग रेट्स को चैनल-वार एडेप्टिव वेक्टर्स से बदलकर और की-वैल्यू स्केलिंग को डिकपल करके गेटेड डेल्टा नेटवर्क्स को उन्नत करता है, जिससे कंप्यूटेशनल दक्षता बनाए रखते हुए एसोसिएटिव रिकॉल और लॉन्ग-कॉन्टेक्स्ट अंडरस्टैंडिंग में महत्वपूर्ण सुधार होता है।

मूल लेखक: Pingwei Sun, Yuxuan Hu, Jianchao Tan, Xue Wang, Jiaqi Zhang, Yifan Lu, Yerui Sun, Yuchen Xie, Xunliang Cai

प्रकाशित 2026-04-22
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pingwei Sun, Yuxuan Hu, Jianchao Tan, Xue Wang, Jiaqi Zhang, Yifan Lu, Yerui Sun, Yuchen Xie, Xunliang Cai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत लंबी किताब पढ़ने की कोशिश कर रहे हैं, लेकिन आपके मस्तिष्क में "वर्किंग मेमोरी" (कार्यकारी स्मृति) की एक सीमित मात्रा है। हर बार जब आप एक नया वाक्य पढ़ते हैं, तो आपको दो चीजें तय करनी होती हैं:

  1. क्या याद रखना है: क्या मुझे इस नए तथ्य को स्टोर करना चाहिए?
  2. क्या भूल जाना है: क्या मुझे किसी पुराने तथ्य को हटाने के लिए जगह बनानी चाहिए?

लंबे समय तक, AI मॉडल (जैसे चैटबॉट्स को चलाने वाले मॉडल) ने सॉफ्टमैक्स अटेंशन (Softmax Attention) नामक एक विधि का उपयोग किया। इसे ऐसे समझें जैसे एक लाइब्रेरियन जो आपसे कोई सवाल पूछने पर हर बार शेल्फ पर रखी हर एक किताब को देखता है। यह अविश्वसनीय रूप से सटीक है, लेकिन यदि लाइब्रेरी में दस लाख किताबें हैं, तो लाइब्रेरियन थक जाएगा और धीमा हो जाएगा। यही कारण है कि AI के लिए बहुत लंबे संदर्भ (context) को एक बार में संभालना मुश्किल होता है।

इसे ठीक करने के लिए, शोधकर्ताओं ने लीनियर अटेंशन (Linear Attention) का आविष्कार किया। यह एक स्मार्ट नोटबुक की तरह है जो खुद को अपडेट करती रहती है जैसे-जैसे आप पढ़ते हैं। पूरी लाइब्रेरी को देखने के बजाय, यह बस वर्तमान पेज को अपडेट करती है। यह सुपर फास्ट है, लेकिन इसके शुरुआती संस्करण थोड़े "मूर्ख" थे—वे या तो सब कुछ हमेशा के लिए याद रखते थे (भ्रमित हो जाते थे) या चीजों को बहुत जल्दी भूल जाते थे।

विकास: "एक ही आकार सबके लिए" से "बारीक ट्यूनिंग" तक

यह पेपर FG2-GDN नामक एक नया मॉडल पेश करता है। यह समझने के लिए कि यह क्यों खास है, आइए देखते हैं कि "नोटबुक" का विकास कैसे हुआ है:

  1. पुरानी नोटबुक (Gated DeltaNet): एक ऐसी नोटबुक की कल्पना करें जहाँ पूरे पेज के लिए आपका एक ही "भूलने" (Forget) का बटन और एक ही "लिखने" (Write) का बटन है। यदि आप "लिखें" दबाते हैं, तो पेज की हर जानकारी एक ही ताकत के साथ अपडेट हो जाती है। यदि आप "भूलें" दबाते हैं, तो सब कुछ एक ही दर से धुंधला हो जाता है। यह एक गंदे कमरे को साफ करने के लिए पूरे घर की लाइट बंद करने जैसा है, बजाय इसके कि केवल गंदे कोने को साफ किया जाए।
  2. बेहतर नोटबुक (KDA): शोधकर्ताओं ने महसूस किया कि पेज के अलग-अलग हिस्सों को अलग-अलग "भूलने" की दर की आवश्यकता होती है। उन्होंने एक "चैनल-वाइज" (channel-wise) भूलने वाला बटन जोड़ा। अब, AI "प्लॉट के विवरणों" को ताज़ा रख सकता है जबकि "बैकग्राउंड शोर" को फीका पड़ने दे सकता है। यह एक बड़ा सुधार था।
  3. सुपर नोटबुक (FG2-GDN - यह पेपर): लेखकों ने देखा कि जबकि भूलने की प्रक्रिया अब बारीक (fine-tuned) थी, लेकिन लिखने की प्रक्रिया अभी भी अनाड़ी थी। AI अभी भी हर चीज़ के लिए एक ही "लिखने" वाले बटन का उपयोग करता था।
    • समस्या: कभी-कभी आप एक छोटा, सटीक नोट (जैसे कोई विशिष्ट नाम) लिखना चाहते हैं, और कभी-कभी आप एक बड़ा, गहरा विचार लिखना चाहते हैं। एक ही "लिखने की ताकत" का उपयोग करना दोनों के लिए अक्षम है।
    • समाधान: FG2-GDN AI को लिखने की ताकत का एक वेक्टर (vector of writing strengths) देता है। एक "लिखने" वाले बटन के बजाय, इसके पास जानकारी की हर एक विशेषता के लिए एक अलग "लिखने" वाला बटन है।
    • उपमा: कल्पना कीजिए कि आप एक चित्र बना रहे हैं।
      • पुराना तरीका: आपके पास एक ही आकार का ब्रश है। आप आकाश के लिए भी उसी भारी स्ट्रोक का उपयोग करते हैं और एक छोटे फूल की पंखुड़ी के लिए भी उसी भारी स्ट्रोक का उपयोग करते हैं। इससे फूल खराब हो जाता है।
      • FG2-GDN का तरीका: आपके पास एक जादुई ब्रश है जो हर एक पिक्सेल के लिए अपने आकार और दबाव को तुरंत बदल सकता है। आप आकाश को चौड़े, कोमल स्ट्रोक के साथ पेंट कर सकते हैं और फूल की पंखुड़ी को एक छोटे, सटीक बिंदु के साथ, और वह भी एक ही समय में।

"FG2" क्या है?

इसका नाम Fine-Grained Gated Delta Network with 2 levels of control (2 स्तरों के नियंत्रण के साथ सूक्ष्म गेटेड डेल्टा नेटवर्क) का संक्षिप्त रूप है।

  • स्तर 1 (पहले से मौजूद था): सूक्ष्म भूलना (यह तय करना कि क्या मिटाना है)।
  • स्तर 2 (यहाँ नया है): सूक्ष्म लिखना (यह तय करना कि कितनी मजबूती से नई जानकारी जोड़नी है)।

उन्होंने एक वेरिएंट भी बनाया जिसे FG2-GDN+ कहा जाता है, जो नियंत्रण का तीसरा स्तर जोड़ता है: यह "मिटाने" (Erasing) की ताकत को "लिखने" (Writing) की ताकत से पूरी तरह अलग कर देता है। यह एक ऐसे हाथ की तरह है जो बोर्ड को धीरे से साफ करता है और दूसरा हाथ जो नए नोट्स लिखता है, जिससे AI पुराने, अप्रासंगिक डेटा को आक्रामक रूप से हटाने और नई, महत्वपूर्ण जानकारी को बहुत कोमलता से जोड़ने में सक्षम होता है।

यह क्यों मायने रखता है?

शोधकर्ताओं ने इसे दो प्रकार के कार्यों पर परखा:

  1. रीडिंग कॉम्प्रिहेनशन (भाषा मॉडलिंग): क्या AI अच्छे वाक्य लिख सकता है?
    • परिणाम: हाँ, यह अन्य मॉडलों की तरह ही अच्छा लिखता है, लेकिन अधिक सटीकता के साथ।
  2. लॉन्ग-कॉन्टेक्स्ट रिट्रीवल (घास के ढेर में सुई ढूँढना): क्या AI 100 पन्नों के दस्तावेज़ में छिपे एक विशिष्ट तथ्य को खोज सकता है?
    • परिणाम: भारी सुधार। क्योंकि AI अब सबसे महत्वपूर्ण तथ्यों को उच्च सटीकता के साथ "लिख" सकता है और शोर को उच्च सटीकता के साथ "मिटा" सकता है, इसलिए वह भ्रमित नहीं होता। वह घास के ढेर के बीच सुई को बेहतर तरीके से याद रखता है।

सबसे अच्छी बात: यह तेज़ है!

आमतौर पर, जब आप किसी मॉडल को स्मार्ट बनाते हैं, तो वह धीमा हो जाता है। लेकिन क्योंकि FG2-GDN एक चतुर गणितीय ट्रिक (rank-1 संरचना को बनाए रखना) पर बना है, इसलिए यह ज्यादा धीमा नहीं होता है।

  • उपमा: यह एक स्पोर्ट्स कार के इंजन को अतिरिक्त वजन जोड़े बिना अधिक सटीक बनाने जैसा है। यह अभी भी उतना ही तेज़ चलता है, लेकिन यह मोड़ों पर बहुत बेहतर तरीके से हैंडल करता है।

सारांश

FG2-GDN AI के लिए अपनी मेमोरी को प्रबंधित करने का एक स्मार्ट तरीका है। AI को यह क्षमता देकर कि वह जानकारी के प्रत्येक हिस्से को कितनी मजबूती से लिखता है (न कि केवल यह कि वह क्या भूलता है), यह लंबे दस्तावेज़ों को पढ़ने और विशिष्ट विवरण खोजने में बहुत बेहतर हो जाता है, और वह तेज़ और कुशल भी रहता है। यह मेमोरी को प्रबंधित करने के लिए एक हथौड़े और सर्जन के स्केलपेल (scalpel) के बीच का अंतर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →