← नवीनतम पेपर
🤖 machine learning

Flexformer: Flexible Linear Transformer with Learnable Attention Kernel

फ्लेक्सफॉर्मर (Flexformer) एक लचीला लीनियर ट्रांसफॉर्मर है जो प्रशिक्षण योग्य स्पेक्ट्रल आवृत्तियों के माध्यम से पूरी तरह से डेटा-संचालित तरीके से अटेंशन कर्नेल सीखकर लंबी अनुक्रमों (sequences) के लिए अभिव्यंजना और स्केलेबिलिटी को बढ़ाता है, जो दक्षता और हस्तांतरणीयता बनाए रखते हुए लगातार बेसलाइनों से बेहतर प्रदर्शन करता है।

मूल लेखक: Haoran Zhang, Feng Zhou

प्रकाशित 2026-06-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haoran Zhang, Feng Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप हज़ारों मेहमानों के साथ एक विशाल पार्टी आयोजित करने की कोशिश कर रहे हैं। AI की दुनिया में, ये मेहमान "टोकन्स" (टेक्स्ट या डेटा के टुकड़े) हैं, और लक्ष्य यह पता लगाना है कि पूरी कहानी समझने के लिए किसे किससे बात करने की ज़रूरत है।

समस्या: "हैंडशेक" (हाथ मिलाने का) बॉटलनेक

पारंपरिक AI मॉडल (जिन्हें ट्रांसफॉर्मर कहा जाता है) सॉफ्टमैक्स अटेंशन (Softmax Attention) का उपयोग करते हैं। इसे ऐसे समझें कि यह एक नियम है जहाँ पार्टी के हर एक मेहमान को दूसरे हर मेहमान से हाथ मिलाना पड़ता है ताकि यह देखा जा सके कि कौन प्रासंगिक है।

  • अच्छी बात: यह बहुत सटीक है। हर कोई समूह की पूरी समझ प्राप्त कर लेता है।
  • बुरी बात: यदि आपके पास 1,000 मेहमान हैं, तो वह 1,000,000 हैंडशेक हैं। यदि आपके पास 10,000 मेहमान हैं, तो वह 100,000,000 हैंडशेक हैं। काम क्वाड्रेटिकली (quadraticly) बढ़ता है। यह एक पूरे शहर के लिए पार्टी आयोजित करने जैसा है; कंप्यूटर बहुत जल्दी मेमोरी और समय की कमी के कारण रुक जाता है।

पुराना समाधान: "कठोर स्क्रिप्ट" (Rigid Script)

इसे ठीक करने के लिए, शोधकर्ताओं ने लीनियर अटेंशन (Linear Attention) का उपयोग किया। इसमें हर किसी से हाथ मिलाने के बजाय, वे एक शॉर्टकट का उपयोग करते हैं। वे हर किसी को एक "टैग" (एक फीचर मैप) देते हैं और केवल टैग्स की तुलना करते हैं।

  • चुनौती: अधिकांश शॉर्टकट एक निश्चित स्क्रिप्ट का उपयोग करते हैं। वे मान लेते हैं कि लोगों को टैग करने का केवल एक ही सही तरीका है (आमतौर पर एक विशिष्ट गणितीय सूत्र जिसे "सॉफ्टमैक्स कर्नेल" कहा जाता है)।
  • दोष: सिर्फ इसलिए कि एक स्क्रिप्ट पार्टी के एक प्रकार के लिए काम करती है, इसका मतलब यह नहीं है कि वह सभी प्रकार की पार्टियों के लिए काम करेगी। कभी-कभी, "निश्चित टैग" महत्वपूर्ण कनेक्शन को मिस कर देता है, जिससे AI कम स्मार्ट हो जाता है।

नया समाधान: फ्लेक्सफॉर्मर (Flexformer)

इस पेपर के लेखक फ्लेक्सफॉर्मर का प्रस्ताव करते हैं। फ्लेक्सफॉर्मर को एक स्मार्ट, कस्टमाइज़ेबल टैगिंग सिस्टम के रूप में समझें जो पार्टी के दौरान ही सबसे अच्छे टैग्स को सीखता है।

यह इस प्रकार काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "रेडियो ट्यूनर" की उपमा

कल्पना कीजिए कि जिस तरह से AI लोगों को जोड़ता है, वह रेडियो ट्यून करने जैसा है।

  • पुराना लीनियर अटेंशन: रेडियो एक विशिष्ट फ्रीक्वेंसी पर अटका हुआ है। यह केवल एक ही स्टेशन सुन सकता है।
  • फ्लेक्सफॉर्मर: रेडियो में एक ट्यूनेबल डायल (घुमाने वाला बटन) है। एक निश्चित फ्रीक्वेंसी पर अटके रहने के बजाय, फ्लेक्सफॉर्मर "फ्रीक्वेंसीज" (वे गणितीय सेटिंग्स जो यह तय करती हैं कि लोग कैसे जुड़ते हैं) को सीखने योग्य नॉब्स (learnable knobs) के रूप में मानता है।
  • यह कैसे सीखता है: AI इन नॉब्स को ऊपर-नीचे घुमाता है, डेटा को सुनता है, और यह पता लगाता है कि सबसे महत्वपूर्ण संबंधों को पकड़ने के लिए कौन सा "स्टेशन" सबसे अच्छा है। यह केवल अनुमान नहीं लगाता; यह सटीक रूप से सीखता है कि जो डेटा वह पढ़ रहा है, उसके लिए सबसे अच्छा क्या काम करता है।

2. "लचीला रबर बैंड" (Flexible Rubber Band)

पेपर इस सिस्टम के दो संस्करण बनाता है:

  • स्टेशनरी वर्जन (Flexformer_s): कल्पना कीजिए कि एक रबर बैंड है जो हर जगह एक ही तरह से खिंचता है चाहे आप उसे कहीं भी खींचें। यह लचीला है, लेकिन खिंचने के नियम सुसंगत (consistent) हैं।
  • नॉन-स्टेशनरी वर्जन (Flexformer_n): यह एक सुपर-फ्लेक्सिबल, आकार बदलने वाले रबर बैंड जैसा है। यह खिंच सकता है, मुड़ सकता है और बिल्कुल उसी स्थान पर अपने नियम बदल सकता है जहाँ आप मौजूद हैं। पेपर का दावा है कि यह संस्करण और भी शक्तिशाली है क्योंकि यह उन जटिल पैटर्न के अनुकूल हो सकता है जिन्हें "सुसंगत" संस्करण मिस कर सकता है।

यह एक बड़ी बात क्यों है?

यह पेपर तीन मुख्य बातें सिद्ध करता है:

  1. यह तेज़ और हल्का है: पुराने लीनियर तरीकों की तरह ही, फ्लेक्सफॉर्मर "हैंडशेक" की संख्या को कम रखता है। यह लीनियर रूप से स्केल करता है (1,000 मेहमान = 1,000 हैंडशेक, न कि 1,000,000)। इसका मतलब है कि यह बहुत लंबे दस्तावेज़ों (जैसे पूरी किताबें या लंबे वीडियो ट्रांसक्रिप्ट) को बिना कंप्यूटर क्रैश किए संभाल सकता है।
  2. यह अधिक स्मार्ट है: क्योंकि यह अपने स्वयं के "टैग्स" सीखता है न कि एक निश्चित स्क्रिप्ट का उपयोग करता है, यह पुराने लीनियर तरीकों की तुलना में डेटा को बेहतर समझता है। परीक्षणों में (जैसे रीडिंग कॉम्प्रिहेन्शन और वाक्य में अगला शब्द प्रेडिक्ट करने में), फ्लेक्सफॉर्मर ने सभी अन्य तेज़ तरीकों को पछाड़ दिया और यहाँ तक कि धीमे, भारी "गोल्ड स्टैंडर्ड" मॉडल्स के बराबर या उनसे बेहतर प्रदर्शन किया।
  3. यह पुराने तरीके की "नकल" कर सकता है: यदि आपके पास पहले से ही एक धीमा, परफेक्ट AI मॉडल है और आप उसे तेज़ बनाना चाहते हैं, तो आप फ्लेक्सफॉर्मर को "डिस्टिल" (सिखाने) के माध्यम से उस धीमे मॉडल के व्यवहार की नकल करना सिखा सकते हैं। फ्लेक्सफॉर्मर उस धीमे, परफेक्ट मॉडल की तरह बिल्कुल व्यवहार करना सीख सकता है लेकिन बिजली जैसी तेज़ गति से चल सकता है। इसके अलावा, यदि आप इसे एक विषय (जैसे समाचार लेख) पर सिखाते हैं, तो यह उस ज्ञान को दूसरे विषय (जैसे वैज्ञानिक पेपर) में अन्य तेज़ मॉडलों की तुलना में बेहतर तरीके से ट्रांसफर कर सकता है।

सारांश

फ्लेक्सफॉर्मर लंबे टेक्स्ट को पढ़ने का एक नया तरीका है। AI को विचारों को जोड़ने के लिए एक कठोर, पूर्व-लिखित नियम पुस्तिका का उपयोग करने के लिए मजबूर करने के बजाय, यह AI को एडजस्टेबल डायल्स (समायोज्य बटन) का एक सेट देता है। AI इन डायल्स को घुमाना सीखता है ताकि वह विचारों को जोड़ने का सबसे अच्छा तरीका खोज सके, जिसके परिणामस्वरूप एक ऐसा सिस्टम मिलता है जो लंबे दस्तावेज़ों के लिए पर्याप्त तेज़ है लेकिन जटिल विवरणों को समझने के लिए पर्याप्त स्मार्ट भी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →