← नवीनतम पेपर
🤖 machine learning

Stochastic Attention: Connectome-Inspired Randomized Routing for Expressive Linear-Time Attention

फ्रूट फ्लाई के कनेक्टोम से प्रेरित होकर, यह शोध पत्र स्टोकेस्टिक अटेंशन (Stochastic Attention) का प्रस्ताव करता है, जो एक रैंडमाइज्ड रूटिंग तंत्र है जो स्लाइडिंग-विंडो अटेंशन को बेहतर बनाने के लिए लॉगैरिद्मिक डेप्थ में ग्लोबल रिसेप्टिव फील्ड्स प्राप्त करता है और लीनियर-टाइम कॉम्प्लेक्सिटी बनाए रखता है, जो प्री-ट्रेनिंग और ट्रेनिंग-फ्री इन्फरेंस परिदृश्यों दोनों में उत्कृष्ट प्रदर्शन प्रदर्शित करता है।

मूल लेखक: Zehao Jin, Yanan Sui

प्रकाशित 2026-05-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zehao Jin, Yanan Sui

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: AI के लिए एक "रैंडम शफल" (Random Shuffle) ट्रिक

कल्पना कीजिए कि आप एक बहुत लंबी किताब पढ़ने की कोशिश कर रहे हैं, लेकिन आपको एक बार में केवल 10 शब्दों की एक छोटी खिड़की (window) देखने की अनुमति है। कई वर्तमान AI मॉडल ऊर्जा बचाने के लिए इसी तरह काम करते हैं; वे स्लाइडिंग विंडो अटेंशन (Sliding Window Attention - SWA) का उपयोग करते हैं। वे पास-पास वाले शब्दों को देखते हैं, जो स्थानीय वाक्यों को समझने के लिए तो बेहतरीन है, लेकिन यह याद रखने के मामले में बहुत खराब है कि 50 पन्ने पहले क्या हुआ था।

इस शोध पत्र के लेखकों ने इस समस्या को हल करने के लिए एक फल मक्खी (fruit fly) के मस्तिष्क का अध्ययन किया। भले ही एक फल मक्खी का मस्तिष्क बहुत छोटा होता है और इसके न्यूरॉन्स ज्यादातर केवल अपने निकटतम पड़ोसियों से जुड़े होते हैं, फिर भी यह अविश्वसनीय रूप से तेजी से जानकारी को प्रोसेस कर सकता है। कैसे? क्योंकि इसमें कुछ "गुप्त शॉर्टकट" (secret shortcuts) हैं जो मस्तिष्क के दूरस्थ हिस्सों को यादृच्छिक (randomly) रूप से जोड़ते हैं।

यह शोध पत्र एक नई विधि प्रस्तावित करता है जिसे स्टोकेस्टिक अटेंशन (Stochastic Attention - SA) कहा जाता है। यह उस लंबी किताब को लेने, उसके पन्नों को यादृच्छिक रूप से शफल (shuffle) करने, आपके 10-शब्दों के विंडो को पढ़ने और फिर पन्नों को वापस उनके सही क्रम में रखने जैसा है।

यह कैसे काम करता है: "शफल और रीड" (Shuffle and Read) सादृश्य

1. "लोकल विंडो" की समस्या
एक मानक AI मॉडल को एक ऐसे व्यक्ति के रूप में सोचें जो आंखों पर पट्टी बांधकर किताब पढ़ रहा है, जिससे वह केवल वर्तमान शब्द और उससे पहले के 10 शब्दों को ही देख सकता है।

  • समस्या: यदि उस व्यक्ति को पेज 1 के किसी शब्द को पेज 100 के किसी शब्द से जोड़ने की आवश्यकता है, तो वह ऐसा नहीं कर सकता। उसे पूरी किताब को पेज-दर-पेज पढ़ना होगा, जिसमें बहुत समय लगता है।

2. फल मक्खी (Fruit Fly) से प्रेरणा
फल मक्खी का मस्तिष्क दक्षता का एक उत्कृष्ट नमूना है। इसमें लगभग 1,30,000 न्यूरॉन्स होते हैं। अधिकांश केवल अपने निकटतम पड़ोसियों से जुड़े होते हैं (लोकल क्लस्टरिंग)। लेकिन, कुछ यादृच्छिक कनेक्शन (random connections) पूरे मस्तिष्क में लंबी दूरी तय करते हैं (long-range shortcuts)।

  • परिणाम: भले ही मस्तिष्क ज्यादातर स्थानीय (local) हो, एक सिग्नल केवल कुछ ही "हॉप्स" (लग्स/कदमों) में एक छोर से दूसरे छोर तक जा सकता है (लगभग 4 कदम)। यह एक "स्मॉल वर्ल्ड" नेटवर्क है।

3. समाधान: स्टोकेस्टिक अटेंशन (Stochastic Attention - SA)
लेखकों ने महसूस किया कि वे एक जटिल नया मस्तिष्क बनाए बिना फल मक्खी के इन शॉर्टकट्स की नकल कर सकते हैं। वे इसे तीन-चरणीय ट्रिक के साथ करते हैं:

  • चरण 1: शफल (Shuffle)। AI के अपने शब्दों के "विंडो" को देखने से पहले, यह पूरे वाक्य के क्रम को यादृच्छिक रूप से बिखेर (scramble) देता है।
  • चरण 2: रीड (Read)। AI अपने 10 शब्दों के छोटे विंडो को देखता है। चूंकि वाक्य को शफल किया गया था, इसलिए वे 10 शब्द मूल कहानी के शुरुआत, मध्य और अंत से आ सकते हैं। अब AI दूर के हिस्सों को ऐसे "देख" रहा है जैसे कि वे पड़ोसी हों।
  • चरण 3: अनशफल (Unshuffle)। AI द्वारा जानकारी को प्रोसेस करने के बाद, वह शब्दों को उनके मूल क्रम में वापस रख देता है ताकि वाक्य का अर्थ बना रहे।

जादू: AI के विभिन्न लेयर्स (layers) के माध्यम से इस शफल-और-रीड ट्रिक को बार-बार करके, मॉडल टेक्स्ट के हर हिस्से तक बहुत तेज़ी से "पहुंच" सकता है। यह वैसा ही है जैसे यदि आप एक विशाल स्टेडियम में हर किसी से मिलना चाहते हैं; पंक्ति दर पंक्ति चलने (धीमा) के बजाय, आप हर कुछ सेकंड में अलग-अलग सेक्शन में रैंडमली टेलीपोर्ट करते हैं। आप कुछ ही मिनटों में पूरा स्टेडियम कवर कर लेते हैं।

"दोनों दुनियाओं का सर्वश्रेष्ठ" संयोजन (The "Best of Both Worlds" Combo)

शोध पत्र यह भी सुझाव देता है कि केवल सब कुछ शफल करना पर्याप्त नहीं है। आपको शब्दों के स्थानीय प्रवाह (व्याकरण, वाक्य संरचना) को भी समझना होगा। इसलिए, उन्होंने एक गेटेड SA + SWA सिस्टम बनाया है।

इसे एक दो-लेन वाले हाईवे के रूप में सोचें:

  • लेन 1 (SWA): मानक लेन जहाँ कारें (शब्द) अपने स्थानीय पड़ोस में रहती हैं। यह व्याकरण और स्थानीय अर्थ को सटीक रखता है।
  • लेन 2 (SA): "टेलीपोर्ट" लेन जहाँ कारें महत्वपूर्ण संदर्भ (context) प्राप्त करने के लिए हाईवे के दूरस्थ हिस्सों में रैंडमली कूद जाती हैं।
  • द गेट (The Gate): एक स्मार्ट ट्रैफिक कंट्रोलर (एक सीखा हुआ गेट) यह तय करता है कि प्रत्येक शब्द के लिए स्थानीय लेन बनाम टेलीपोर्ट लेन से कितनी जानकारी ली जानी चाहिए।

प्रयोगों ने क्या दिखाया

शोधकर्ताओं ने इसे दो तरीकों से परखा:

  1. शून्य से एक नया AI बनाना: उन्होंने इस पद्धति का उपयोग करके एक नया लैंग्वेज मॉडल प्रशिक्षित किया। परिणाम? जिस मॉडल ने "शफल + लोकल" कॉम्बो का उपयोग किया, वह सबसे स्मार्ट था। इसने स्थानीय वाक्यों को अच्छी तरह समझा और फुल-अटेंशन मॉडल की तुलना में लंबी दूरी के संदर्भ को बेहतर ढंग से याद रखा।
  2. मौजूदा AI (Qwen3) को अपग्रेड करना: उन्होंने एक शक्तिशाली, प्री-ट्रेंड AI (Qwen3) को लिया और बिना दोबारा ट्रेनिंग दिए, बस इसके अटेंशन मैकेनिज्म को इस नए "शफल" तरीके से बदल दिया।
    • परिणाम: अपग्रेड किया गया AI लंबे टेक्स्ट को देखते समय मूल मॉडल की तुलना में बहुत बेहतर प्रदर्शन करता था। इसने एक फुल-अटेंशन मॉडल (जो एक साथ सब कुछ देखता है) की "बुद्धिमत्ता" को वापस पा लिया, लेकिन यह बहुत तेज़ी से चला और कम मेमोरी का उपयोग किया।

यह क्यों महत्वपूर्ण है

शोध पत्र का दावा है कि यह एक "ड्रॉप-इन" अपग्रेड है। इसके लिए AI के मस्तिष्क की संरचना को बदलने या लाखों नए पैरामीटर्स जोड़ने की आवश्यकता नहीं है। यह बस एक सरल रैंडम शफल स्टेप जोड़ता है।

  • गति (Speed): यह तेज़ "लोकल विंडो" विधि की गति को बनाए रखता है।
  • बुद्धिमत्ता (Smarts): यह धीमे "सब कुछ देखने वाले" (look at everything) विधि की बुद्धिमत्ता प्राप्त करता है।
  • दक्षता (Efficiency): यह प्रकृति के सबसे कुशल नेटवर्क: फल मक्खी के मस्तिष्क की नकल करके इसे प्राप्त करता है।

संक्षेप में, यह शोध पत्र सिद्ध करता है कि सब कुछ जोड़ने के लिए आपको एक विशाल, महंगी नेटवर्क बनाने की आवश्यकता नहीं है। कभी-कभी, आपको बस चीजों को थोड़ा हिलाने (shake up) की आवश्यकता होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →