← नवीनतम पेपर
🤖 machine learning

Kalman Linear Attention: Parallel Bayesian Filtering For Efficient Language Modelling and State Tracking

यह शोध पत्र कलमन लीनियर अटेंशन (KLA) को प्रस्तुत करता है, जो एक समानांतर करने योग्य (parallelizable) सीक्वेंस मिक्सिंग लेयर है, जो स्पष्ट अनिश्चितता के साथ नॉन-लीनियर, स्कैन-पैरल स्टेट अपडेट प्राप्त करने के लिए इंफॉर्मेशन-फॉर्म कलमन फ़िल्टर का उपयोग करके सटीक बेयसियन फ़िल्टरिंग को पुनर्गठित करता है, जिससे मौजूदा लीनियर-कॉम्प्लेक्सिटी मॉडल्स जैसे कि मम्बा (Mamba) और GLA की तुलना में इसकी अभिव्यक्ति (expressivity) और स्टेट-ट्रैकिंग क्षमताओं को बढ़ाते हुए कम्प्यूटेशनल दक्षता को बनाए रखा गया है।

मूल लेखक: Vaisakh Shaj, Cameron Barker, Aidan Scannell, Andras Szecsenyi, Elliot J. Crowley, Amos Storkey

प्रकाशित 2026-06-11
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Vaisakh Shaj, Cameron Barker, Aidan Scannell, Andras Szecsenyi, Elliot J. Crowley, Amos Storkey

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "कलमन लीनियर अटेंशन" (Kalman Linear Attention) पेपर का सरल भाषा और रचनात्मक उपमाओं के साथ हिंदी अनुवाद दिया गया है।

बड़ी तस्वीर: AI के "सोचने" का एक नया तरीका

कल्पना कीजिए कि आप एक बहुत लंबी किताब पढ़ने की कोशिश कर रहे हैं।

  • पुराना AI (Transformers): एक वाक्य को समझने के लिए, AI अब तक की किताब के हर एक शब्द को देखता है ताकि यह तय किया जा सके कि अगला शब्द क्या होना चाहिए। यह एक ऐसे लाइब्रेरियन की तरह है जो एक किताब खोजने के लिए पूरी लाइब्रेरी बाहर निकाल लाता है। यह बहुत सटीक है लेकिन जैसे-जैसे किताब लंबी होती जाती है, यह अविश्वसनीय रूप से धीमा और महंगा होता जाता है।
  • वर्तमान कुशल AI (Mamba, GLA): ये एक ऐसे लाइब्रेरियन की तरह हैं जो एक छोटी, निश्चित आकार की नोटबुक रखते हैं। वे केवल सबसे महत्वपूर्ण चीजों को लिखते हैं और बाकी को भूल जाते हैं। वे तेज़ हैं, लेकिन क्योंकि वे बस पुराने नोट्स में नए नोट्स "जोड़ते" हैं, इसलिए वे कभी-कभी सूक्ष्म संबंधों को मिस कर देते हैं या यदि कहानी बहुत जटिल हो जाए तो भ्रमित हो जाते हैं।

यह पेपर एक नया लाइब्रेरियन पेश करता है: कलमन लीनियर अटेंशन (KLA)।

KLA एक ऐसा लाइब्रेरियन है जो एक नोटबुक रखता है, लेकिन केवल तथ्य लिखने के बजाय, वे इस बात का भी हिसाब रखते हैं कि वे हर तथ्य के बारे में कितने आश्वस्त (sure) हैं। वे खुद से पूछते हैं: "मुझे यह याद है, लेकिन मैं इसे लेकर कितना आश्वस्त हूँ? क्या यह नई जानकारी एक गेम-चेंजर है, या सिर्फ एक छोटा सा विवरण?"

मुख्य विचार: "विश्वास" वाली नोटबुक

लेखकों ने महसूस किया कि वर्तमान कुशल AI मॉडल अपनी याददाश्त को एक साधारण गणितीय समीकरण (संख्याओं को जोड़ना) की तरह मानते हैं। लेकिन वास्तविक सोच में अनिश्चितता (uncertainty) शामिल होती है।

  1. "विश्वास की स्थिति" (The Belief State): KLA केवल एक तथ्य को स्टोर नहीं करता; यह एक तथ्य और एक विश्वास स्कोर (जैसे मौसम का पूर्वानुमान जो कहता है "80% बारिश की संभावना") दोनों को स्टोर करता है।
  2. "द्वारपाल" (The Gatekeeper): जब नई जानकारी आती है, तो KLA उसे केवल जोड़ता नहीं है। यह अपने विश्वास की जांच करता है।
    • यदि AI अपनी वर्तमान याददाश्त पर बहुत आश्वस्त है, तो वह नई, शोर वाली (noisy) जानकारी को अनदेखा कर देता है।
    • यदि AI अनिश्चित है, तो वह नई जानकारी पर गहरा ध्यान देता है और अपनी याददाश्त को अपडेट करता है।
  3. जादुई ट्रिक (समानांतरता/Parallelism): आमतौर पर, विश्वास की जांच करना और चरण-दर-चरण याददाश्त को अपडेट करना धीमा होता है (जैसे स्टैम्प पाने के लिए कतार में खड़े लोगों की लाइन)। इस पेपर की बड़ी सफलता यह दिखाना है कि इस "विश्वास की जांच" को एक साथ किया जा सकता है, जैसे कि एक कन्वेयर बेल्ट, जिससे यह वर्तमान सबसे तेज़ मॉडलों जितना ही तेज़ हो जाता है।

रचनात्मक उपमाएँ

1. "शंकालु जासूस" बनाम "नोट लेने वाला"

  • वर्तमान मॉडल (नोट लेने वाला): एक ऐसे जासूस की कल्पना करें जो एक गवाह की हर बात अपनी नोटबुक में लिख लेता है। यदि गवाह कहता है "कार लाल थी," तो जासूस लिखता है "लाल।" यदि वे बाद में कहते हैं "दरअसल, शायद वह मैरून थी," तो जासूस बस उसके बगल में "मैरून" लिख देता है। नोटबुक अस्त-व्यस्त हो जाती है, और जासूस इस बात को लेकर भ्रमित हो सकता है कि वास्तव में क्या हुआ था।
  • KLA (शंकालु जासूस): इस जासूस के पास एक "विश्वास मीटर" (confidence meter) है।
    • गवाह: "कार लाल थी।"
    • जासूस: "ठीक है, मुझे 90% यकीन है कि यह लाल है। मैं इसे लिख लेता हूँ।"
    • गवाह: "रुको, मुझे लगता कि मैंने एक नीली कार भी देखी थी।"
    • जासूस: "हम्म, 'लाल' पर मेरा विश्वास अधिक है, लेकिन यह नया सुराग संदिग्ध है। मैं 'लाल' में अपने विश्वास को थोड़ा कम कर दूँगा और नीली कार को भी नोट कर लूँगा, लेकिन मैं अभी लाल कार को मिटाऊंगा नहीं।"
    • परिणाम: जासूस बिना अभिभूत हुए अपराध स्थल की एक बहुत स्पष्ट और सटीक तस्वीर बनाए रखता है।

2. "ट्रैफिक लाइट" प्रणाली

AI की याददाश्त को एक हाईवे के रूप में सोचें।

  • लीनियर मॉडल: हर कार (नया शब्द) बस ट्रैफ़िक के प्रवाह में मिल जाती है। यह एक सुचारू, सीधी रेखा है।
  • KLA: हर कार के पास एक ट्रैफिक लाइट है।
    • यदि हाईवे खाली है (कम विश्वास), तो लाइट हरी है; नई कार आसानी से मिल जाती है।
    • यदि हाईवे भारी ट्रैफ़िक से जाम है (उच्च विश्वास), तो लाइट लाल हो जाती है; नई कार को इंतजार करना पड़ता है या बहुत सावधानी से जुड़ना पड़ता है।
    • नवाचार: पेपर ने यह गणना करने का तरीका खोजा कि 1,000 मील लंबे हाईवे के लिए इन सभी ट्रैफिक लाइट्स को एक साथ कैसे निकाला जाए, न कि हर मील मार्कर पर रुककर लाइट चेक की जाए।

उन्होंने वास्तव में क्या सिद्ध किया?

यह पेपर यह दावा नहीं करता कि यह बीमारियों का इलाज करेगा या शेयर बाजार की भविष्यवाणी करेगा। यह भाषा मॉडलिंग (language modeling) (AI को पढ़ने और लिखने में स्मार्ट बनाना) पर केंद्रित है। यहाँ उन्होंने क्या प्रदर्शित किया:

  1. यह तेज़ और स्मार्ट है: KLA वर्तमान सबसे तेज़ मॉडलों (जैसे Mamba) जितना ही तेज़ है लेकिन कठिन तर्क पहेलियों (logic puzzles) को हल कर सकता है।
  2. "परम्यूटेशन" टेस्ट: उन्होंने AI को "A5" नामक एक कार्य दिया, जो एक जटिल पहेली की तरह है जहाँ आपको वस्तुओं को एक विशिष्ट क्रम में व्यवस्थित करना होता है।
    • वर्तमान तेज़ मॉडल (Mamba, मानक Transformers) इस पहेली में विफल रहे, जब तक कि AI को बहुत बड़ा और गहरा न बनाया जाए।
    • KLA ने इसे हल किया एक छोटे, उथले (shallow) मॉडल के साथ। यह साबित करता है कि KLA अपने प्रतिस्पर्धियों की तुलना में जटिल, बदलते राज्यों (states) को बेहतर ढंग से ट्रैक कर सकता है।
  3. यह "लंबे संदर्भ" (Long Contexts) को संभालता है: जब AI को 2,000 शब्द पहले की कहानी याद रखनी होती है, तो KLA अन्य तेज़ मॉडलों की तुलना में सही विवरण खोजने में बेहतर प्रदर्शन करता है।
  4. यह स्केल पर काम करता है: उन्होंने अरबों शब्दों के डेटा के साथ एक मॉडल को प्रशिक्षित किया। यह क्रैश नहीं हुआ। यह स्थिर रूप से काम करता है, जो यह साबित करता है कि इस "अनिश्चितता-आधारित" दृष्टिकोण का उपयोग बड़े, वास्तविक दुनिया के AI सिस्टम के लिए किया जा सकता है।

"सीक्रेट सॉस": OU प्रोसेस

पेपर में एक तकनीकी शब्द "ऑर्नस्टीन-उहलेनबेक (Ornstein-Uhlenbeck - OU) प्रक्रिया" का उल्लेख है।

  • उपमा: एक ऐसी रबर बैंड की कल्पना करें जो एक गेंद से जुड़ी है। यदि आप गेंद को दूर खींचते हैं, तो रबर बैंड उसे वापस केंद्र की ओर खींचता है।
  • AI में: यह रबर बैंड AI के "विश्वास" को पागल होने (अनंत तक जाने या शून्य तक गिरने) से रोकता है। यह AI की याददाश्त को स्थिर रखता है, जिससे इसे बिना टूटे कई परतों (layers) तक गहरा बनाया जा सकता है। इस "रबर बैंड" के बिना, मॉडल बड़ा होने पर अस्थिर हो जाएगा।

सारांश

कलमन लीनियर अटेंशन (Kalman Linear Attention) एक नए प्रकार का AI मेमोरी है जो एक आत्मविश्वासी, शंकालु जासूस की तरह काम करता है। यह केवल याद नहीं रखता; यह इस बात का भी हिसाब रखता है कि वह जो जानता है उस पर उसे कितना विश्वास है। यह इसे शोर को फ़िल्टर करने और वर्तमान तेज़ AI मॉडलों की तुलना में बहुत बेहतर तरीके से महत्वपूर्ण विवरणों पर ध्यान केंद्रित करने की अनुमति देता है, और वह भी उतनी ही तेज़ी से। लेखकों ने सिद्ध किया है कि यह कठिन तर्क पहेलियों पर काम करता है और इसे भारी मात्रा में डेटा पर प्रशिक्षित किया जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →