← नवीनतम पेपर
💬 NLP

Context Memorization for Efficient Long Context Generation

यह शोध पत्र "अटेंशन-स्टेट मेमोरी" (attention-state memory) का प्रस्ताव करता है, जो पारंपरिक प्रीफिक्स-ऑगमेंटेड इन्फरेंस के प्रभाव के कम होने और रैखिक स्केलिंग की सीमाओं को दूर करने के लिए प्रीकंप्यूटेड अटेंशन स्टेट्स के एक हल्के लुकअप टेबल में प्रीफिक्स जानकारी को बाहरी बनाने की एक ट्रेनिंग-फ्री विधि है, जिससे लॉन्ग-कॉन्टेक्स्ट जनरेशन में सटीकता में सुधार और लेटेंसी में कमी आती है।

मूल लेखक: Yasuyuki Okoshi, Hao Mark Chen, Guanxi Lu, Hongxiang Fan, Masato Motomura, Daichi Fujiki

प्रकाशित 2026-05-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yasuyuki Okoshi, Hao Mark Chen, Guanxi Lu, Hongxiang Fan, Masato Motomura, Daichi Fujiki

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शानदार शेफ (AI) हैं जिसे एक बहुत ही लंबे, विस्तृत रेसिपी कार्ड (जिसे "प्रिफिक्स" कहा जाता है) के आधार पर एक विशिष्ट व्यंजन बनाना है। आपको हर बार ग्राहक का ऑर्डर मिलने पर उस कार्ड को पूरा पढ़ना पड़ता है।

समस्या: भारी रेसिपी कार्ड

वर्तमान में, जब कोई ग्राहक कहता है, "मेरे लिए एक बर्गर बनाओ," तो शेफ को:

  1. पूरा रेसिपी कार्ड शुरू से अंत तक पढ़ना पड़ता है हर एक बार।
  2. सब्जियां काटते समय हर विवरण को याद रखना पड़ता है।

जैसे-जैसे रेसिपी कार्ड लंबा होता जाता है (हजारों शब्द), दो बुरी चीजें होती हैं:

  • "भूलने का प्रभाव" (The "Forgetfulness" Effect): कार्ड के अंत तक पहुँचते-पहुँचते, शेफ पहले के कुछ निर्देशों को भूल चुका होता है। कार्ड जितना लंबा होगा, शुरुआत उतनी ही धुंधली होती जाएगी।
  • "धीमी पढ़ाई का प्रभाव" (The "Slow Reading" Effect): 100 पन्नों का कार्ड पढ़ने में 1-पन्ने के कार्ड की तुलना में बहुत अधिक समय लगता है। यदि शेफ को हर ऑर्डर के लिए पूरा कार्ड पढ़ना पड़ता है, तो किचन का काम रुक जाएगा और ग्राहकों को बहुत लंबा इंतज़ार करना पड़ेगा।

वैज्ञानिकों द्वारा आजमाए गए अन्य समाधानों में कमियां हैं:

  • कार्ड को कंप्रेस करना (Compressing the card): वे रेसिपी को सिकोड़ने की कोशिश करते हैं, लेकिन फिर भी आपको हर बार संकुचित संस्करण को पढ़ना पड़ता है, और आप महत्वपूर्ण विवरण खो सकते हैं।
  • कार्ड को याद करना (Memorizing the card): वे शेफ को रेसिपी याद करने के लिए मजबूर करने की कोशिश करते हैं (ट्रेनिंग)। यह धीमा और महंगा है, और यदि रेसिपी बदल जाती है, तो शेफ को फिर से सब कुछ सीखना पड़ता है।

समाधान: "चीट शीट" (अटेंशन-स्टेट मेमोरी)

इस शोध पत्र के लेखक "अटेंशन-स्टेट मेमोरी" नामक एक नई विधि प्रस्तावित करते हैं। शेफ को पूरी रेसिपी पढ़ने या उसे रटने के बजाय, वे एक स्मार्ट, पहले से बनी हुई "चीट शीट" देते हैं।

यह इस प्रकार काम करता है, एक सरल उपमा (analogy) के माध्यम से:

1. "चीट शीट" का निर्माण (ऑफलाइन चरण)

किचन खुलने से पहले, शेफ एक लंबी रेसिपी कार्ड और कुछ सैंपल ऑर्डर लेता है। वे केवल कार्ड पढ़ते नहीं हैं; वे यह समझते हैं कि: "यदि कोई ग्राहक बर्गर मांगता है, तो रेसिपी का सबसे महत्वपूर्ण हिस्सा 'सॉस' वाला भाग है। यदि वे सलाद मांगते हैं, तो वह 'ड्रेसिंग' वाला भाग है।"

वे इन विशिष्ट "उत्तरों" को एक छोटी इंडेक्स कार्ड (मेमोरी) पर लिखते हैं।

  • महत्वपूर्ण: वे यह सब बिना शेफ के दिमाग को बदले (बिना ट्रेनिंग के) करते हैं। वे बस रेसिपी और सवालों को देखते हैं, उत्तरों की गणना करते हैं, और उन्हें लिख लेते हैं।
  • जादुई ट्रिक: वे एक गणितीय शॉर्टकट (जिसे "ऑनलाइन-सॉफ्टमैक्स आइडेंटिटी" कहा जाता है) का उपयोग करते हैं जो उन्हें इन उत्तरों को पूरी तरह से संयोजित करने की अनुमति देता है। यह रेसिपी के सबसे महत्वपूर्ण हिस्सों की फोटो खींचकर उन्हें एक कार्ड पर चिपकाने जैसा है, ताकि शेफ को अब मूल किताब देखने की आवश्यकता न रहे।

2. किचन सर्विस (ऑनलाइन इन्फरेंस)

अब, जब कोई ग्राहक ऑर्डर देता है:

  1. शेफ ऑर्डर देखता है ("मुझे एक बर्गर चाहिए")।
  2. 100 पन्नों की रेसिपी पढ़ने के बजाय, शेफ चीट शीट पर एक नज़र डालता है।
  3. वह शीट पर सबसे करीबी मैच ढूंढता है (जैसे, "बर्गर निर्देश") और तुरंत आवश्यक विवरण याद कर लेता है।
  4. वे तुरंत खाना बनाना शुरू कर देते हैं।

यह बेहतर क्यों है

  • कोई और पढ़ना नहीं: शेफ को अब दोबारा लंबी रेसिपी कार्ड पढ़ने की जरूरत नहीं है। वे बस चीट शीट पर उत्तर देख लेते हैं।
  • गति (Speed): डिक्शनरी में शब्द ढूँढना पूरी किताब पढ़ने की तुलना में बहुत तेज़ है। भले ही चीट शीट बढ़ती जाए, सही प्रविष्टि (entry) ढूँढना अविश्वसनीय रूप से तेज़ रहता है (यह लॉगरिदमिक रूप से स्केल करता है, जिसका अर्थ है कि सूची कितनी भी बड़ी हो जाए, यह तेज़ ही रहता है)।
  • कोई भूलना नहीं: क्योंकि शेफ को खाना बनाते समय पूरी किताब पढ़ने से विचलित नहीं होना पड़ता, इसलिए "चीट शीट" के निर्देश ताज़ा और मजबूत रहते हैं। रेसिपी का प्रभाव फीका नहीं पड़ता।
  • कोई दोबारा पढ़ाई नहीं: यदि रेसिपी बदलती है, तो आप बस चीट शीट को अपडेट कर देते हैं। आपको शेफ को हफ्तों तक फिर से पढ़ाने की आवश्यकता नहीं है।

इस शोध पत्र ने क्या पाया

शोधकर्ताओं ने एक स्मार्ट AI मॉडल (LLaMA 3.1-8B) पर दो प्रकार के कार्यों का परीक्षण किया:

  1. उदाहरणों से सीखना (In-Context Learning): AI को प्रश्नों और उत्तरों के कई उदाहरण देना।
    • परिणाम: जब उदाहरणों की सूची लंबी थी (1,000 से 8,000 उदाहरण), तब "चीट शीट" विधि मानक विधि की तुलना में अधिक सटीक थी। यह 1.36 गुना तेज़ भी थी।
  2. नियम पुस्तिका का उपयोग करना (RAG): AI को सवालों के जवाब देने के लिए एक विशाल नियम पुस्तिका (जैसे NBA ट्रेड नियम) देना।
    • परिणाम: "चीट शीट" विधि ने केवल 20% मेमोरी स्पेस का उपयोग करते हुए मानक विधि को पछाड़ दिया।

निष्कर्ष

यह शोध पत्र एक विशाल, धीमी गति से पढ़ने वाले निर्देश मैनुअल को एक छोटे, त्वरित लुकअप टेबल में बदलने का तरीका पेश करता है। यह AI मॉडल्स को बिना थके, बिना दोबारा प्रशिक्षित किए और बिना किचन की गति धीमी किए, लंबे निर्देशों को पूरी तरह से याद रखने में सक्षम बनाता है। यह 1,000 पन्नों की पाठ्यपुस्तक को एक एकल, सटीक इंडेक्स कार्ड से बदलने जैसा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →