← नवीनतम पेपर
💬 NLP

REAL: REtrieval-reAsoning and Logic-constructed Attention Behaviors for Long-Context KV Cache Compression

यह शोध पत्र REAL को प्रस्तुत करता है, जो एक नवीन KV कैश इविक्शन विधि है जो सफल और विफल तर्क पैटर्न (reasoning patterns) दोनों का विश्लेषण करने के लिए एक अटेंशन बिहेवियर मैट्रिक्स का लाभ उठाती है, जिससे मौजूदा बेसलाइनों की तुलना में काफी कम मेमोरी ओवरहेड के साथ अत्याधुनिक लॉन्ग-कॉन्टेक्स्ट प्रदर्शन प्राप्त होता है।

मूल लेखक: Mengjie Li, Yuan Feng, Xike Xie, William J. Song

प्रकाशित 2026-07-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mengjie Li, Yuan Feng, Xike Xie, William J. Song

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छिपे हुए खजाने के बारे में एक विशिष्ट वाक्य खोजने के लिए एक विशाल, 30,000 पन्नों का उपन्यास पढ़ने की कोशिश कर रहे हैं। आपका मस्तिष्क (AI) महत्वपूर्ण हिस्सों को याद रखने के लिए स्टिकी नोट्स (मेमोरी) की एक सीमित संख्या रखता है। यदि आप हर एक शब्द लिखने की कोशिश करते हैं, तो आपका मस्तिष्क फट जाएगा। इसलिए, आपको जगह बनाने के लिए कुछ नोट्स फेंकने होंगे।

लंबे समय तक, वैज्ञानिकों ने सोचा कि इसका सबसे अच्छा तरीका "जीतने वाले" क्षणों को देखना था—वे समय जब AI सही उत्तर दे रहा था। उन्होंने तय किया कि कौन से स्टिकी नोट्स सफलता के लिए उपयोग किए गए थे और उन्हें रखना ही बेहतर है। लेकिन यहाँ एक मोड़ है: यह शोध प्रबंध तर्क देता है कि केवल विजेकों को देखना एक बड़ी गलती है।

"कन्फ्यूजन मैट्रिक्स" की गलतियाँ

लेखक, मेंगजी ली और उनकी टीम ने महसूस किया कि जब एक AI गलत उत्तर देता है, तो वह केवल एक यादृच्छिक विफलता नहीं होती है। यह एक विशिष्ट प्रकार की विफलता है। उन्होंने एक खेल सेट किया जहाँ उन्होंने टेक्स्ट के ढेर (haystack) में एक "सुई" (एक महत्वपूर्ण तथ्य) को छिपा दिया और देखा कि कैसे AI के मस्तिष्क (विशेष रूप से इसके अटेंशन हेड्स) ने प्रतिक्रिया दी।

उन्होंने पाया कि मस्तिष्क चार अलग-अलग तरीकों से व्यवहार करता है, जैसे कि चार अलग-अलग प्रकार के जासूस:

  1. सुपर डिटेक्टिव (रिट्रीवल-रीज़निंग): यह सुई को ढूंढ लेता है और बिंदुओं को पूरी तरह से जोड़ देता है। यह नायक है।
  2. बायस्ड डिटेक्टिव (बायस/पक्षपाती): यह एक ऐसे सुराग को देखता है जो उत्तर जैसा दिखता है लेकिन वह नहीं है। यह भटकाने वाले संकेतों (red herrings) के जाल में फंस जाता है।
  3. डिस्ट्रैक्टेड डिटेक्टिव (डिस्ट्रैक्शन/भटका हुआ): यह सुई को देखता है तो है, लेकिन बोर होकर दूसरी ओर देखने लगता है, जिससे वह महत्वपूर्ण जानकारी को पूरी तरह से मिस कर देता है।
  4. बैकग्राउंड नॉइज़ (वाइडस्प्रेड/व्यापक शोर): यह बिना किसी विशिष्ट चीज़ पर ध्यान केंद्रित किए बस सब कुछ अस्पष्ट रूप से देख लेता है।

यह शोध प्रबंध स्पष्ट रूप से इस विचार को खारिज करता है कि हमें इन सभी जासूसों के साथ एक जैसा व्यवहार करना चाहिए या केवल सुपर डिटेक्टिव की बात सुननी चाहिए। पिछले तरीके उन कोचों की तरह थे जो केवल उन खिलाड़ियों का अध्ययन करते थे जो गोल करते थे, इस बात को अनदेखा करते हुए कि कुछ खिलाड़ी सक्रिय रूप से टीम को गिरा रहे थे (बायस) या ध्यान भटक रहा था (डिस्ट्रैक्शन)। लेखक दिखाते हैं कि यदि आप "बुरे जासूसों" को आपके स्टिकी नोट्स पर कब्जा करने से नहीं रोकते हैं, तो आपका मस्तिष्क अभी भी भ्रमित हो जाएगा।

नई रणनीति: REAL

टीम ने REAL (REtrieval-reAsoning and Logic-constructed Attention Behaviors) नामक एक नया सिस्टम बनाया। REAL को एक सुपर-स्मार्ट कोच के रूप में सोचें जो हर गेम देखता है, न कि केवल जीत को।

REAL एक विशेष स्कोरकार्ड (जिसे INFerence score कहा जाता है) का उपयोग यह तय करने के लिए करता है कि कौन से स्टिकी नोट्स रखने हैं। यह पूछता है:

  • "क्या यह जासूस वास्तव में सच्चाई खोज रहा है?" (उच्च स्कोर = रखें!)
  • "क्या यह जासूस नकली सुरागों से धोखा खा रहा है?" (उच्च बायस = इसे फेंक दें!)
  • "क्या यह जासूस ख्यालों में खोया हुआ है?" (उच्च डिस्ट्रैक्शन = इसे फेंक दें!)

सुपर डिटेक्टिव्स को अधिक मेमोरी स्पेस देकर और बायस्ड और डिस्ट्रैक्टेड डिटेक्टिव्स के लिए स्थान को कम करके, REAL एक विशाल उपन्यास को एक छोटे से बैकपैक में बिना खजाना खोए समाने में सक्षम है।

परिणाम: छोटा बैकपैक, बड़ा दिमाग

टीम ने इस परीक्षण को दुनिया के कुछ सबसे स्मार्ट AI दिमागों, जैसे कि Llama-3-8B और Mistral-7B पर परखा। उन्होंने LongBench v2 नामक एक प्रसिद्ध परीक्षण का उपयोग किया, जो लंबी कहानियों को पढ़ने के लिए एक विशाल परीक्षा की तरह है।

यहाँ उन्होंने क्या पाया (और ये उनके परीक्षणों के सटीक नंबर हैं):

  • स्पेस सेवर (जगह बचाने वाला): LongBench v2 टेस्ट पर, REAL ने पिछले चैंपियन (HeadKV-R2) के समान उच्च सटीकता प्राप्त की, लेकिन इसने 32 गुना कम जगह का उपयोग किया।
    • पुराने चैंपियन को एक शानदार स्कोर पाने के लिए 8,192 स्टिकी नोट्स (टोकन) की आवश्यकता थी।
    • REAL ने केवल 128 नोट्स के साथ वही स्कोर प्राप्त किया।
    • इससे भी बेहतर, REAL ने चैंपियन के प्रदर्शन के साथ 4,096 नोट्स के साथ बराबरी की, जबकि चैंपियन को 8,192 की आवश्यकता थी (2x की कमी)।
  • गति: टीम ने पहला शब्द शुरू करने में लगने वाले समय (Time-to-first-token) को मापा। REAL लगभग उतना ही तेज़ था जितना कि सभी नोट्स रखना (Full-KV) और यह अन्य संपीड़न (compression) विधियों से वास्तव में तेज़ था।
  • "इनवर्टेड" (उल्टा) परीक्षण: अपने तर्क को सिद्ध करने के लिए, उन्होंने विपरीत रणनीति आजमाई: उन्होंने सबसे अधिक मेमोरी "बुरे जासूसों" (जिनका स्कोर सबसे कम था) को दी। परिणाम क्या रहा? AI का प्रदर्शन गिर गया। यह बेतुकी बातें (hallucinations) करने लगा, जैसे कि यह सोचना कि ब्लैक लैपटॉप की कीमत **1,200है,जबकिटेक्स्टमेंकहागयाथाकिसिल्वरलैपटॉपकीकीमत1,200** है, जबकि टेक्स्ट में कहा गया था कि **सिल्वर लैपटॉप** की कीमत 1,200 है और ब्लैक लैपटॉप की $800 है, क्योंकि वह गलत सुरागों को देख रहा था। इसने साबित कर दिया कि यह जानना कि किन हेड्स पर भरोसा करना है, अत्यंत महत्वपूर्ण है।

जो उन्होंने नहीं कहा

शोध पत्र इस बात को लेकर बहुत सावधान है कि उन्होंने क्या सिद्ध नहीं किया। उन्होंने इस पर अंग्रेजी बेंचमार्क पर परीक्षण किया। वे स्वीकार करते हैं कि उन्हें अभी तक यह नहीं पता है कि क्या यह पूरी तरह से अलग संरचना वाले भाषाओं (जैसे चीनी या अरबी) के लिए काम करता है या क्या यह हर प्रकार के भाषाई कार्य के लिए काम करता है। वे यह भी नोट करते हैं कि हालांकि गणित काम करता है, लेकिन उन्होंने इसे दुनिया की हर संभव भाषा पर टेस्ट नहीं किया है।

मुख्य निष्कर्ष

मुख्य निष्कर्ष यह है कि विफलता को अनदेखा करना खतरनाक है। न केवल यह विश्लेषण करके कि AI कब सही होता है, बल्कि यह भी कि वह गलत कैसे होता है (बायस्ड या डिस्ट्रैक्टेड होकर), REAL मेमोरी को कंप्रेस करने का एक स्मार्ट तरीका बनाता है। यह केवल जगह बचाने के बारे में नहीं है; यह सही जगह बचाने के बारे में है। लेखकों ने दर्जनों डेटासेट में इस माप को परखा और पाया कि यह "फेलियर-अवेयर" (विफलता के प्रति जागरूक) दृष्टिकोण लगातार पुराने "सफलता-केवल" तरीकों को मात देता है, जिससे लंबी बातचीत और विशाल दस्तावेज़ों को संभालना AI के लिए बहुत आसान हो जाता है बिना मेमोरी खत्म हुए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →