Practical Online KV Cache Compaction for LLM Agents: An Empirical Study
यह अनुभवजन्य अध्ययन प्रदर्शित करता है कि LLM एजेंटों के लिए व्यावहारिक ऑनलाइन KV कैश संपीड़न (compaction), भविष्य के एजेंट प्रश्नों की उपलब्धता तक संपीड़न को विलंबित करके और स्थिर संदर्भ धारणाओं पर निर्भर रहने के बजाय मजबूत प्रॉक्सी स्रोतों के साथ टोकन निष्कासन (token eviction) का उपयोग करके, महत्वपूर्ण मेमोरी कमी और थ्रूपुट लाभ प्राप्त कर सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, बहु-चरणीय रहस्य को सुलझाने की कोशिश कर रहे हैं। आपके पास एक प्रतिभाशाली जासूस (एक AI) है जो सवाल पूछ सकता है, सुरागों की जांच कर सकता है और गवाहों से बात कर सकता है। लेकिन इसमें एक पेंच है: जासूस के मस्तिष्क की स्मृति (मेमोरी) की एक सख्त सीमा है। हर बार जब वह एक कदम उठाता है, एक नोट लिखता है, या किसी गवाह की कहानी सुनता है, तो वह जानकारी जमा होती जाती है। यदि मामला बहुत लंबे समय तक चलता है, तो जासूस का दिमाग पुराने नोट्स से इतना भर जाता है कि वह स्पष्ट रूप से सोच नहीं पाता, या वह नए नोट्स लिखने के लिए जगह ही नहीं बचा पाता। यह "LLM Agents" की दुनिया है—स्मार्ट कंप्यूटर प्रोग्राम जो टूल्स और इंटरनेट से बात करके जटिल कार्यों को हल करते हैं। "KV cache" उस बढ़ते हुए नोट्स के ढेर का तकनीकी नाम है जो जासूस के दिमाग में जमा हो रहा है। इस ढेर को मेमोरी में फिट होने के लिए पर्याप्त छोटा रखना, बिना उन सुरागों को खोए जिनकी जरूरत मामले को सुलझाने के लिए है, वही बड़ी चुनौती है जिसे यह पेपर संबोधित करता है।
UC सांता बारबरा और LinkedIn के शोधकर्ताओं ने "KV cache compaction" नामक एक चतुर तरकीब का परीक्षण करने का निर्णय लिया। इसे एक लंबी, उबाऊ पुलिस रिपोर्ट को एक सिंगल स्टिकी नोट में सारांशित (summarize) करने जैसा समझें। पिछली बातचीत के हर एक शब्द को रखने के बजाय, AI उसे एक छोटे संस्करण में संकुचित (compress) करने की कोशिश करता है जो अभी भी सबसे महत्वपूर्ण अर्थ को थामे रखता है। लेकिन यहाँ एक मोड़ है: एक सामान्य कहानी में, आप सारांश बनाने से पहले अंत जानते हैं। लेकिन एक AI एजेंट के जीवन में, कहानी जैसे-जैसे घटित हो रही है, वैसे-वैसे लिखी जा रही है। AI को यह नहीं पता कि वह आगे क्या सवाल पूछेगा, इसलिए उसे भविष्य में क्या चाहिए होगा, यह जानने से पहले ही अतीत का सारांश बनाना होगा। यह पेपर पूछता है: आप एक कहानी के अध्याय का सारांश कैसे बना सकते हैं जब आपने अगला अध्याय अभी पढ़ा ही नहीं है?
टीम ने इस सारांश बनाने के दो मुख्य तरीकों का परीक्षण किया। पहला तरीका, जिसे Token Eviction (TE) कहा जाता है, एक सख्त संपादक की तरह है जो वर्तमान पृष्ठ को पढ़ता है और निर्णय लेता है, "ये 80% शब्द उबाऊ हैं; चलो इन्हें फेंक देते हैं और केवल शीर्ष 20% को रखते हैं।" दूसरा तरीका, Attention Matching (AM), एक फैंसी कलाकार की तरह है जो न केवल सबसे अच्छे शब्दों को चुनता है, बल्कि एक नया, छोटा संस्करण बनाने की भी कोशिश करता है जो बाद में पढ़े जाने पर मूल लंबे संस्करण जैसा ही महसूस हो।
सारांश निकालने के सर्वोत्तम तरीके को निर्धारित करने के लिए, शोधकर्ताओं को यह तय करना था कि इसे कब करना है और इसके लिए किसका उपयोग करना है। उन्होंने तीन अलग-अलग "गाइड" रणनीतियों का परीक्षण किया:
- "अभी का" गाइड (The "Right Now" Guide): अभी बोले गए शब्दों का उपयोग करके तुरंत सारांशित करें।
- "दोहराव" वाला गाइड (The "Repeat" Guide): AI को पिछले हिस्से को फिर से पढ़ने का नाटक करने के लिए कहें और उसी का उपयोग यह तय करने के लिए करें कि क्या महत्वपूर्ण है।
- "भविष्य का" गाइड (The "Future" Guide): थोड़ा इंतजार करें। AI को कहानी के अगले कुछ कदम लिखने दें, फिर उन नए सवालों का उपयोग करके पुराने कदमों से यह तय करें कि क्या रखना है।
परिणाम आश्चर्यजनक और व्यावहारिक थे। सबसे पहले, उन्होंने पाया कि तुरंत सारांशित करना ( "Right Now" गाइड का उपयोग करके) अक्सर AI को कम बुद्धिमान बना देता है। यह एक रहस्यमयी उपन्यास के पहले अध्याय को यह जाने बिना सारांशित करने जैसा है कि खलनायक कौन है; आप शायद एक ऐसे सुराग को फेंक सकते हैं जो बाद में अत्यंत महत्वपूर्ण साबित हो। हालांकि, यदि वे केवल एक मोड़ (turn) प्रतीक्षा करते—AI को अपना अगला सवाल पूछने देते—तो सारांश बनाना बहुत अधिक स्मार्ट हो जाता। "Future" गाइड का उपयोग करके, AI वास्तव में देख सकता था कि किस जानकारी की आवश्यकता थी और वह केवल उसी को रख सकता था।
उन्होंने यह भी पाया कि सरल तरीका, Token Evвction (TE), अक्सर फैंसी और जटिल Attention Matching (AM) की तुलना में अधिक विश्वसनीय था। भले ही "गाइड" एकदम सटीक न हो, फिर भी "सबसे अच्छे 20% को रखें" वाला सरल दृष्टिकोण बेहतर प्रदर्शन करता है। यह सच है कि गणित के साथ बहुत अधिक चतुर बनने की कोशिश करना (जैसा कि AM करता है) हमेशा मदद नहीं करता जब आप भविष्य के बारे में अनुमान लगा रहे हों।
सबसे रोमांचक हिस्सा यह है कि इसका गति और लागत के लिए क्या महत्व है। जब उन्होंने इसे बड़े, अधिक शक्तिशाली AI मॉडलों पर परखा, तो परिणाम गेम-चेंजर साबित हुए। अपनी मेमोरी को मूल आकार के केवल 20% तक संकुचित करके (प्रत्येक 5 टोकन में से 1 को रखकर), उन्होंने न केवल जगह बचाई; बल्कि उन्होंने एक मॉडल पर AI को 4.2 गुना तेज़ और दूसरे पर 1.7 गुना तेज़ बना दिया। कैसे? क्योंकि AI का "दिमाग" बहुत छोटा था, कंप्यूटर बिना क्रैश हुए एक ही समय में चार गुना अधिक जासूसी केस चला सकता था।
दिलचस्प रूप से, पेपर में यह भी देखा गया कि जब AI की मेमोरी संकुचित की गई, तो जासूस कभी-कभी थोड़ा "बेचैन" (anxious) हो जाता था। वह एक ही पहेली को सुलझाने के लिए अधिक सवाल पूछता और अधिक कदम उठाता था, शायद उन तथ्यों की दोबारा जांच करने की कोशिश में जिन्हें उसे लगता है कि उसने खो दिया है। यह सुझाव देता है कि जबकि AI अभी भी सही उत्तर प्राप्त करता है, उसका व्यवहार सख्त मेमोरी के अनुकूल होने के लिए थोड़ा बदल जाता है।
संक्षेप में, यह पेपर सुझाव देता है कि यदि आप बजट या कंप्यूटर की मेमोरी को तोड़े बिना स्मार्ट, लंबे समय तक चलने वाले AI एजेंट चलाना चाहते हैं, तो सारांश निकालने में जल्दबाजी न करें। इसके बजाय, AI को कुछ और कदम उठाने दें, यह देखने के लिए कि वह आगे क्या करने वाला है, भविष्य में झाँकें, और फिर अतीत को संकुचित करें। और आश्चर्यजनक रूप से, आपको इसके लिए किसी सुपर-कॉम्प्लेक्स एल्गोरिदम की आवश्यकता नहीं है; सबसे महत्वपूर्ण शब्दों का एक सरल, स्मार्ट चयन उतना ही अच्छा, या उससे भी बेहतर काम करता है। यह दृष्टिकोण इस कार्य को सभी के लिए बहुत सस्ता और तेज़ बना सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।