← नवीनतम पेपर
💬 NLP

The Condensate Theorem: Transformers are O(n), Not O(n2)O(n^2)

यह शोध पत्र "कंडेंसेट थ्योरम" (Condensate Theorem) प्रस्तुत करता है, जो यह सिद्ध करता है कि ट्रांसफार्मर अटेंशन एक सीखा हुआ टोपोलॉजिकल गुण है जिसे फुल अटेंशन के साथ 100% लॉसलेस पैरिटी प्राप्त करने के लिए गतिशील रूप से एक स्पार्स मैनिफोल्ड पर प्रोजेक्ट किया जा सकता है, जिससे भारी हार्डवेयर स्पीडअप सक्षम होता है और जटिलता O(n2)O(n^2) से घटकर O(n)O(n) हो जाती है।

मूल लेखक: Jorge L. Ruiz Williams

प्रकाशित 2026-02-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Jorge L. Ruiz Williams

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

"स्पॉटलाइट" का रहस्य: AI को बिना कमज़ोर किए तेज़ कैसे बनाएं

कल्पना कीजिए कि आप 1,00,000 लोगों वाले एक विशाल, शोर-शराबे वाले संगीत समारोह में हैं। आप अपने सबसे अच्छे दोस्त के साथ बातचीत करने की कोशिश कर रहे हैं।

एक "मानक" (standard) AI मॉडल में (जैसे कि ChatGPT को चलाने वाले मॉडल), गणित इस तरह काम करता है जैसे आपको यह सुनिश्चित करने के लिए कि आप एक भी फुसफुसाहट मिस न कर दें, उस भीड़ में मौजूद हर एक व्यक्ति को एक ही समय में, एक ही वॉल्यूम पर सुनने की आवश्यकता हो। जैसे-जैसे भीड़ 1,000 से बढ़कर 1,000,000 होती जाती है, हर किसी को सुनने के लिए आवश्यक प्रयास इतना विशाल हो जाता है कि सिस्टम अंततः क्रैश हो जाता है या असंभव रूप से धीमा हो जाता है। वैज्ञानिक इसे O(n2)O(n^2) जटिलता (complexity) कहते हैं—जहाँ काम भीड़ के साथ तेजी से बढ़ता है।

कंडेंसेट थ्योरम (The Condensate Theorem) कहता है: "ठहरिए। हमें वास्तव में हर किसी को सुनने की ज़रूरत नहीं है। हमें केवल उन लोगों को सुनने की ज़रूरत है जो वास्तव में हमसे बात कर रहे हैं।"


मुख्य विचार: "स्मार्ट स्पॉटलाइट"

शोधकर्ता, जॉर्ज एल. रुइज़ विलियम्स ने पाया कि प्रशिक्षित AI मॉडल पहले से ही बहुत स्मार्ट तरीके से "आलसी" होते हैं। भले ही गणित AI को एक विशाल किताब के हर एक शब्द को देखने की अनुमति देता है, लेकिन AI ने प्रशिक्षण के माध्यम से केवल कुछ चुनिकी महत्वपूर्ण जगहों पर अपना "ध्यान" (attention) केंद्रित करना सीख लिया है।

वे इसे कंडेंसेट सेट (Condensate Set) कहते हैं। इसे एक अंधेरे स्टेडियम में स्पॉटलाइट की तरह समझें। भले ही स्टेडियम बहुत बड़ा है, लेकिन स्पॉटलाइट केवल तीन विशिष्ट क्षेत्रों पर पड़ती है:

  1. द एंकर (The Anchor - "होम बेस"): बातचीत का सबसे पहला शब्द। यह एक स्थिर हाथ या "ग्लोबल बायस" की तरह कार्य करता है जिसका उपयोग AI अपनी स्थिति बनाए रखने के लिए करता है।
  2. द विंडो (The Window - "हालिया स्मृति"): पिछली कुछ बातें जो अभी-अभी कही गई थीं। यदि आप वाक्य के बीच में हैं, तो आपका ध्यान मुख्य रूप से उन शब्दों पर होता है जो आपने अभी-अभी बोले हैं।
  3. द डायनेमिक टॉप-के (The Dynamic Top-k - "प्रासंगिक सुराग"): यह जादुई हिस्सा है। यदि आप "पेरिस" के बारे में बात कर रहे हैं, तो AI का स्पॉटलाइट तुरंत "फ्रांस" या "एफिल टॉवर" जैसे शब्दों पर कूद जाता है, भले ही वे 50 पन्ने पहले क्यों न कहे गए हों।

यह बड़ी बात क्यों है: "संख्यात्मक सटीकता" (Numerical Exactness)

आमतौर पर, जब इंजीनियर AI को तेज़ बनाने की कोशिश करते हैं, तो वे "शॉर्टकट" का उपयोग करते हैं। यह एक किताब का सारांश पढ़ने के बजाय खुद किताब पढ़ने जैसा है। यह तेज़ है, लेकिन आप बारीकियों को खो देते हैं।

यह शोध पत्र कुछ बहुत अधिक क्रांतिकारी दावा करता है। कंप्यूटर जिस तरह से गणित को संभालते हैं (विशेष रूप से IEEE 754 फ्लोटिंग-पॉइंट नामक एक नियम), उसके कारण AI जिन शब्दों को अनदेखा करता है, वे इतने नगण्य हैं कि वे गणितीय रूप से "अदृश्य" हैं।

उपमा: कल्पना कीजिए कि आप एक तराजू पर एक विशाल क्रूज शिप (समुद्री जहाज) का वजन कर रहे हैं। यदि उस पर एक छोटी सी तितली उतरती है, तो तराजू नहीं हिलेगा। तितली "वहाँ" है, लेकिन जहाज की तुलना में उसका वजन इतना कम है कि वह डिस्प्ले पर दिखने वाले नंबर को नहीं बदलता।

शोधकर्ता ने पाया कि AI की स्मृति में "अनदेखे" शब्द बिल्कुल वैसे ही हैं जैसे वह तितली। उन्हें अनदेखा करके, आप केवल एक समान उत्तर नहीं पाते; बल्कि आप अंतिम दशमलव बिंदु तक बिल्कुल सटीक उत्तर प्राप्त करते हैं।


परिणाम: "घोंघे" से "सुपरकार" तक

इस "टोपोलॉजिकल अटेंशन" (स्मार्ट स्पॉटलाइट) का उपयोग करके, प्रदर्शन में सुधार चौंकाने वाला है:

  • गति में वृद्धि (The Speedup): विशाल स्तर पर (10 लाख शब्द), AI 1,200 गुना से अधिक तेज़ हो जाता है।
  • मेमोरी की बचत (The Memory Savings): यह "मेमोरी फुटप्रिंट" (KV कैश) को 99.9% तक कम कर देता है। यह अपने नोट्स रखने के लिए एक विशाल गोदाम की आवश्यकता होने बनाम एक सिंगल स्टिकी नोट की आवश्यकता के बीच का अंतर है।
  • "नीडल इन अ हेस्टैक" टेस्ट (The "Needle in a Haystack" Test): यहाँ तक कि जब जानकारी का एक छोटा सा टुकड़ा टेक्स्ट के पहाड़ में गहराई से दबा होता है, तब भी "डायनेमिक स्पॉटलाइट" उसे धीमी और महंगी विधि की तरह ही पूरी तरह से खोज लेता है।

एक वाक्य में सारांश

AI को एक साथ पूरे ब्रह्मांड को सुनने के लिए मजबूर करने के बजाय, यह थ्योरम AI को केवल महत्वपूर्ण चीजों पर ध्यान केंद्रित करने के लिए एक हाई-स्पीड, सटीक स्पॉटलाइट का उपयोग करने की अनुमति देता है, जिससे यह बुद्धिमत्ता का एक भी कतरा खोए बिना हजारों गुना तेज़ हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →