← नवीनतम पेपर
💬 NLP

Bayesian Attention Mechanism: A Probabilistic Framework for Positional Encoding and Context Length Extrapolation

यह शोध पत्र बेयसियन अटेंशन मैकेनिज्म (BAM) प्रस्तुत करता है, जो एक संभाव्य ढांचा है जो मौजूदा पोजीशनल एनकोडिंग विधियों को एकीकृत करता है और अत्याधुनिक लॉन्ग-कॉन्टेक्स्ट जनरलाइजेशन प्राप्त करने के लिए एक जनरलाइज्ड गॉसियन प्रायोर (Generalized Gaussian prior) का प्रस्ताव करता है, जिससे न्यूनतम पैरामीटर ओवरहेड के साथ प्रशिक्षण संदर्भ लंबाई के 500 गुना पर सटीक सूचना पुनर्प्राप्ति सक्षम होती है।

मूल लेखक: Arthur S. Bianchessi, Yasmin C. Aguirre, Rodrigo C. Barros, Lucas S. Kupssinskü

प्रकाशित 2026-05-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Arthur S. Bianchessi, Yasmin C. Aguirre, Rodrigo C. Barros, Lucas S. Kupssinskü

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ट्रांसफार्मर लैंग्वेज मॉडल (जो आधुनिक AI चैटबॉट्स के पीछे का मस्तिष्क है) की कल्पना एक अत्यंत बुद्धिमान लाइब्रेरियन (पुस्तकालयाध्यक्ष) के रूप में करें जो एक विशाल पुस्तक पढ़ रहा है। यह लाइब्रेरियन शब्दों के अर्थ को समझने में तो उत्कृष्ट है, लेकिन उनके पास एक अजीब समस्या है: उन्हें क्रम का कोई बोध नहीं है। यदि आप उन्हें "The cat sat on the mat" जैसा एक वाक्य देते हैं, तो वे यह नहीं बता सकते कि "cat" "sat" से पहले आया था या बाद में, क्योंकि उनके लिए शब्द एक समान ही दिखते हैं चाहे वे कहीं भी हों।

इसे ठीक करने के लिए, हम आमतौर पर लाइब्रेरियन को एक पोजीशनल एनकोडिंग (PE) देते हैं। इसे एक छोटे, अदृश्य नेम टैग या रंगीन स्टिकर की तरह समझें जो हर शब्द पर लगा होता है और कहता है, "मैं पहला शब्द हूँ," "मैं दूसरा शब्द हूँ," आदि। यह लाइब्रेरियन को कहानी के प्रवाह को समझने में मदद करता है।

हालाँकि, इन "स्टिकर सिस्टमों" में एक दोष है: वे छोटी कहानियों के लिए तो बहुत अच्छे से काम करते हैं, लेकिन जब किताब बहुत लंबी हो जाती है (जैसे कि 1,00,000 पन्नों का उपन्यास), तो वे विफल हो जाते हैं। लाइब्रेरियन किताब के शुरुआती हिस्से को अनदेखा करने लगते हैं क्योंकि स्टिकर बहुत भ्रमित करने वाले या धुंधले हो जाते हैं।

नया विचार: "बेयसियन अटेंशन मैकेनिज्म" (BAM)

लेखक इस पेपर में इन स्टिकर्स के बारे में सोचने का एक नया तरीका प्रस्तावित करते हैं, जिसे वे BAM कहते हैं। केवल एक शब्द पर एक निश्चित स्टिकर चिपकाने के बजाय, BAM शब्द की स्थिति को एक संभाव्यता अनुमान (probability guess) के रूप में मानता है।

यहाँ उपमा (analogy) दी गई है:
कल्पना करें कि लाइब्रेरियन एक लंबे दस्तावेज़ में कहीं छिपी हुई एक विशिष्ट जानकारी (एक "पासकी") को खोजने की कोशिश कर रहा है।

  • पुराना तरीका (जैसे ALiBi): लाइब्रेरियन यह मान लेता है कि उत्तर सबसे अधिक संभावना वर्तमान शब्द के ठीक बगल में है, और जैसे-जैसे आप दूर जाते हैं, उत्तर मिलने की संभावना कम होती जाती है। यह आपके घर में खोई हुई चाबी खोजने जैसा है; आप पहले अपनी जेबें देखते हैं, फिर मेज देखते हैं, और फिर आप गैरेज में ढूंढना बंद कर देते हैं क्योंकि वह "बहुत दूर" है।
  • BAM तरीका: लाइब्रेरियन एक "पूर्व धारणा" (प्रायिकता मानचित्र/probability map) का उपयोग करता है कि उत्तर कहाँ हो सकता है। यह मानचित्र स्थिर नहीं है; यह एक लचीला नियम है जिसे ट्यून किया जा सकता है।

गुप्त मंत्र: "जनरलाइज्ड गौसियन" मैप

पेपर में प्रायिकता मानचित्र का एक विशिष्ट प्रकार पेश किया गया है जिसे जनरलाइज्ड गौसियन प्रायर (Generalized Gaussian Prior) कहा जाता है। इस मानचित्र को एक ऐसे भूभाग (terrain) के रूप में समझें जिसमें पहाड़ और घाटियाँ हैं जो यह दर्शाती हैं कि लाइब्रेरियन किसी निश्चित शब्द को देखने की कितनी संभावना रखता है।

  1. "लोकल" पहाड़ी: मानचित्र में वर्तमान शब्द के ठीक बगल में एक खड़ी पहाड़ी हो सकती है। यह लाइब्रेरियन को तत्काल संदर्भ (जैसे व्याकरण और वाक्य संरचना) को समझने में मदद करता है।
  2. "लॉन्ग-डिस्टेंस" पूंछ (Tail): यहाँ जादू है। लेखकों ने पाया कि एक विशिष्ट नॉब (जिसे β\beta कहा जाता है) को बदलकर, वे मानचित्र के आकार को बदल सकते हैं।
    • यदि वे नॉब को एक तरफ घुमाते हैं, तो लाइब्रेरियन किताब के दूर के हिस्सों को अनदेखा कर देता है (पुराने तरीकों की तरह)।
    • यदि वे नॉब को दूसरी तरफ घुमाते हैं (विशेष रूप से, इसे एक ऋणात्मक संख्या पर सेट करते हैं), तो लाइब्रेरियन तत्काल पड़ोसियों को देखना बंद कर देता है और उन शब्दों पर तीव्रता से ध्यान केंद्रित करने लगता है जो बहुत दूर हैं।

उन्होंने वास्तव में क्या हासिल किया?

यह पेपर यह दावा नहीं करता कि यह बीमारियों का इलाज करेगा या आपके लिए उपन्यास लिखेगा। उन्होंने बहुत विशिष्ट, नियंत्रित कार्यों पर इनका परीक्षण किया:

  • "नीडल इन अ हेस्टैक" (भूसे में सुई) टेस्ट: उन्होंने हजारों शब्दों वाले टेक्स्ट के भीतर गहराई में एक विशिष्ट 5-अंकों की संख्या ("पासकी") को छिपा दिया।
    • परिणाम: जबकि अन्य तरीके (जैसे RoPE या ALiBi) तब हार मान लेते थे और रैंडम अनुमान लगाने लगते थे जब टेक्स्ट बहुत लंबा हो जाता था, BAM मॉडल उस संख्या को पूरी तरह से खोज सकता था, तब भी जब टेक्स्ट उस लंबाई से 500 गुना अधिक था जिस पर मॉडल को प्रशिक्षित किया गया था।
  • "परप्लेक्सिटी" (Perplexity) टेस्ट: यह मॉडल कितनी अच्छी तरह से वाक्य में अगले शब्द की भविष्यवाणी करता है, इसे मापता है।
    • परिणाम: BAM मौजूदा सर्वोत्तम तरीकों की तरह ही शब्दों की भविष्यवाणी करने में सक्षम था, जिसका अर्थ है कि इसने अपनी लंबी दूरी की सुपरपावर प्राप्त करने के लिए सामान्य भाषा कौशल का त्याग नहीं किया।

"अदृश्य" लागत

उनकी खोज का सबसे शानदार हिस्सा यह है कि इसे जोड़ना कितना सस्ता है।

  • उन्होंने एक ऐसे मॉडल में 1,000 से भी कम नए पैरामीटर्स (स्मृति के छोटे अंश) जोड़े, जिसमें पहले से ही 12 करोड़ (120 मिलियन) पैरामीटर्स थे।
  • यह एक समुद्र तट में रेत का एक अकेला कण जोड़ने जैसा है और अचानक पूरा समुद्र तट क्षितिज देख सकता है।
  • इसने मॉडल को धीमा नहीं किया या इसके कंप्यूटर पावर का अधिक उपयोग नहीं किया।

सरल अंग्रेजी में सारांश

लेखकों ने AI के लिए एक नया "पोजीशन स्टिकर" सिस्टम बनाया है। यह मानने के बजाय कि उत्तर हमेशा पास में ही होता है, उन्होंने AI को एक लचीला नियम दिया जो इसे तत्काल परिवेश को अनदेखा करने और अतीत में गहराई से दबी जानकारी पर ध्यान केंद्रित करने की अनुमति देता है।

उन्होंने गणितीय रूप से सिद्ध किया कि यह काम करता है और प्रयोगों में दिखाया कि उनका AI 5,00,000 शब्दों के ढेर में सुई ढूंढ सकता है, जबकि अन्य AI कुछ हज़ार शब्दों के बाद ही रास्ता भटक जाते हैं। उन्होंने इसका परीक्षण वास्तविक दुनिया के चिकित्सा या कानूनी दस्तावेजों पर नहीं किया, लेकिन उन्होंने दिखाया कि लंबी दूरी की जानकारी खोजने का तंत्र (mechanism) अब बहुत अधिक मजबूत और विश्वसनीय है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →