← नवीनतम पेपर
🤖 machine learning

Tensor Cache: Eviction-conditioned Associative Memory for Transformers

यह शोध पत्र टेंसर कैश (Tensor Cache) का परिचय देता है, जो एक दो-स्तरीय साहचर्य स्मृति (two-level associative memory) प्रणाली है जो स्लाइडिंग-विंडो अटेंशन को एक निश्चित-आकार के आउटर-प्रोडक्ट फास्ट-वेट मेमोरी के साथ जोड़ती है ताकि निष्कासित टोकनों को बनाए रखने और संकुचित करने में मदद मिल सके, जिससे लंबे-संदर्भ वाले ट्रांसफॉर्मर्स के लिए मेमोरी-क्वालिटी फ्रंटियर में सुधार होता है और एक सामान्य प्रशिक्षण शॉर्टकट को सुधारा जा सके जो स्प्यूरियस क्रॉस-टोकन इंटरैक्शन पेश करता है।

मूल लेखक: Kabir Swain, Sijie Han, Daniel Karl I. Weidele, Mauro Martino, Antonio Torralba

प्रकाशित 2026-05-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kabir Swain, Sijie Han, Daniel Karl I. Weidele, Mauro Martino, Antonio Torralba

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने एक मित्र को एक बहुत लंबी कहानी सुना रहे हैं और उसे याद रखने की कोशिश कर रहे हैं। ऐसा करने के लिए, आपका मस्तिष्क (AI) आपके द्वारा कहे गए सबसे हालिया शब्दों का एक "रफ नोट" (scratchpad) रखता है ताकि आप उन पर वापस जाकर संदर्भ ले सकें। आज के मानक AI मॉडल इसी तरह काम करते हैं।

हालाँकि, एक समस्या है:

  1. पूर्ण स्मृति की समस्या (The Full Memory Problem): यदि आप अपने रफ नोट में आपके द्वारा कहे गए हर एक शब्द को रखते हैं, तो वह अंततः इतना बड़ा हो जाएगा कि उसे संभालना मुश्किल हो जाएगा। आपका मस्तिष्क अभिभूत हो जाएगा, और प्रक्रिया धीमी हो जाएगी।
  2. "स्लाइडिंग विंडो" की समस्या (The "Sliding Window" Problem): इस आकार की समस्या को ठीक करने के लिए, कुछ मॉडल "स्लाइडिंग विंडो" का उपयोग करते हैं। वे केवल पिछले, मान लीजिए, 1,000 शब्दों को ही रखते हैं। जैसे ही कोई शब्द इस विंडो से बाहर फिसलता है, उसे हमेशा के लिए फेंक दिया जाता है। यदि आपके वर्तमान प्रश्न का उत्तर 5,000 शब्द पहले दिया गया था, तो मॉडल को इसके बारे में कोई जानकारी नहीं होगी। यह ऐसा है जैसे कुछ मिनटों से पुराने किसी भी विषय के लिए आपको स्मृति लोप (amnesia) हो गया हो।

टेंसर कैश (Tensor Cache) एक नया आविष्कार है जो इसे एक दो-भाग वाली स्मृति प्रणाली देकर हल करता है, जैसे कि एक डेस्क और एक फाइलिंग कैबिनेट

दो-भाग वाली प्रणाली

1. डेस्क (लेवल 1 कैश):
यह "स्लाइडिंग विंडो" है। मॉडल अपने डेस्क पर सबसे हालिया शब्दों (टोकन) को रखता है। यह उन्हें तुरंत और पूरी तरह से देख सकता है। यह तत्काल अतीत के लिए है।

2. फाइलिंग कैबिनेट (लेवल 2 कैश):
यही जादुई हिस्सा है। जब कोई शब्द डेस्क से फिसलकर बाहर जाता है और सामान्यतः उसे कचरे में फेंक दिया जाता है, तो टेंसर कैश उस शब्द को फेंकता नहीं है। इसके बजाय, यह उस शब्द को लेता है और एक निश्चित आकार के फाइलिंग कैबिनेट में एक सारांश नोट (summary note) लिख देता है।

  • यह कैसे काम करता है: यह पूरे शब्द को सहेजता नहीं है। यह एक "संपीड़ित फिंगरप्रिंट" (शब्द के की (key) और वैल्यू (value) का गणितीय संयोजन) को सहेजता है।
  • पुनर्प्राप्ति (The Retrieval): जब मॉडल बाद में कोई प्रश्न पूछता है, तो वह पहले डेस्क को देखता है। यदि उत्तर वहां नहीं है, तो वह फाइलिंग कैबिनेट से पूछता है: "क्या आपके पास इस विषय के बारे में कोई नोट है?" कैबिनेट एक विशेष गणितीय ट्रिक का उपयोग करके अपने सभी सारांश नोट्स को तेज़ी से स्कैन करता है और कहता है: "हाँ, मेरे पास बहुत पहले का उस विषय के बारे में एक संकेत है।"

"स्मार्ट" फाइलिंग ट्रिक

पेपर इस बात पर प्रकाश डालता है कि मॉडल इस कैबिनेट को भरने के लिए कैसे सीखता है। आमतौर पर, जब आप एक बार में पूरे टेक्स्ट का सारांश लिखने की कोशिश करते हैं, तो आप अनजाने में विवरणों को मिला सकते हैं (जैसे यह सोचना कि दो अलग-अलग लोगों ने एक ही बात कही क्योंकि आपने उनके शब्दों का औसत निकाल लिया)।

लेखकों ने एक विशिष्ट गणितीय शॉर्टकट विकसित किया जो इस तरह के मिश्रण को रोकता है। उन्होंने इन नोट्स को कैबिनेट में एक-एक करके लिखने का एक तरीका विकसित किया (प्रशिक्षण के दौरान भी), ताकि मॉडल कभी भी यह लेकर भ्रमित न हो कि कौन सा नोट किस शब्द का है। यह सुनिश्चित करता है कि जब मॉडल पीछे मुड़कर देखता है, तो "फिंगरप्रिंट" सटीक होता है।

यह बेहतर क्यों है?

पेपर ने अन्य विधियों के विरुद्ध इसका परीक्षण किया और पाया कि:

  • मेमोरी दक्षता (Memory Efficiency): यह पूर्ण इतिहास को रखने की तुलना में बहुत कम कंप्यूटर मेमोरी का उपयोग करता है। यह छोटा और तेज़ बना रहता है, भले ही कहानी बहुत लंबी हो जाए।
  • बेहतर रिकॉल (Better Recall): "स्लाइडिंग विंडो" वाले मॉडलों के विपरीत जो विंडो के बाहर की हर चीज़ को भूल जाते हैं, टेंसर कैश बहुत गहरे अतीत की चीजों को भी याद रख सकता है। परीक्षणों में, यह सैकड़ों शब्दों पहले की विशिष्ट विवरणों को लगभग पूर्ण सटीकता के साथ याद रख सका, जबकि अन्य "छोटी स्मृति" वाले मॉडल विफल रहे।
  • गति (Speed): यह पूर्ण इतिहास को रखने की तुलना में तेज़ है, और यह अन्य "संपीड़ित स्मृति" (compressed memory) विधियों की तुलना में आम तौर पर तेज़ है।

निचोड़ (The Bottom Line)

टेंसर कैश को एक स्मार्ट लाइब्रेरियन के रूप में सोचें।

  • पुराना तरीका: लाइब्रेरियन अलमारियों पर हर एक किताब रखता है (बहुत भारी) या केवल अंतिम कुछ किताबें रखता है और बाकी को जला देता है (आप कहानी खो देते हैं)।
  • टेंसर कैश का तरीका: लाइब्रेरियन आसान पहुंच के लिए डेस्क पर अंतिम कुछ किताबें रखता है। जब एक किताब डेस्क से हटाई जाती है, तो लाइब्रेरियन उसके बारे में एक सटीक, संपीड़ित इंडेक्स कार्ड लिखता है और उसे एक छोटे, निश्चित आकार के बॉक्स में रख देता है। जब आप कोई प्रश्न पूछते हैं, तो लाइब्रेरियन डेस्क की जांच करता है, और यदि उत्तर वहां नहीं है, तो वे उत्तर खोजने के लिए बॉक्स में मौजूद इंडेक्स कार्डों को तेज़ी से स्कैन करते हैं।

यह AI को एक "बाउंडेड" (सीमित) मेमोरी आकार रखने की अनुमति देता है जो हमेशा के लिए बढ़ता नहीं है, फिर भी यह एक बहुत लंबी बातचीत के महत्वपूर्ण हिस्सों को याद रखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →