← नवीनतम पेपर
🤖 machine learning

MVR-cache: Optimizing Semantic Caching via Multi-Vector Retrieval and Learned Prompt Segmentation

MVR-cache एक नवीन सिमेंटिक कैशिंग सिस्टम है जो एक सीखने योग्य प्रॉम्प्ट सेगमेंटेशन मॉडल और मल्टी-वेक्टर रिट्रीवल का लाभ उठाकर कैश हिट रेट को 37% तक महत्वपूर्ण रूप से बढ़ाता है और सख्त शुद्धता गारंटी बनाए रखता है, जिससे LLM की लागत और विलंबता (लेटेंसी) कम होती है।

मूल लेखक: Ali Noshad, Zishan Zheng, Yinjun Wu

प्रकाशित 2026-05-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ali Noshad, Zishan Zheng, Yinjun Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, लेकिन बहुत महंगा व्यक्तिगत सहायक (एक लार्ज लैंग्वेज मॉडल, या LLM) है जो आपके सवालों के जवाब देता है। हर बार जब आप उनसे कुछ पूछते हैं, तो इसमें पैसा और समय दोनों खर्च होते हैं।

पैसे बचाने और काम को तेज़ करने के लिए, आप एक नोटबुक (कैश) रखते हैं जिसमें आपके द्वारा पहले पूछे गए सवाल और उनके दिए गए जवाब दर्ज होते हैं। यदि आप बिल्कुल वही सवाल पूछते हैं जो नोटबुक में पहले से मौजूद है, तो आप बस उसका जवाब कॉपी कर लेते हैं। लेकिन क्या होगा अगर आप एक ऐसा सवाल पूछें जो थोड़ा अलग है, बस उसे कहने का तरीका नया है?

समस्या: "बहुत साधारण" नोटबुक

नोटबुक की जाँच करने के मौजूदा तरीके थोड़े ऐसे हैं जैसे भीड़ में किसी व्यक्ति को खोजने के लिए उसकी एक धुंधली फोटो का उपयोग करना।

  • यह अभी कैसे काम करता है: सिस्टम आपके पूरे सवाल को एक ही "सारांश" (वेक्टर) में सिकोड़ देता है। फिर यह उस सारांश की तुलना नोटबुक में मौजूद सारांशों से करता है।
  • दोष: यह दूर से किसी के पूरे पहनावे की फोटो देखकर उसे पहचानने की कोशिश करने जैसा है। आप देख सकते हैं कि "नीली शर्ट" और "जींस" है और सोच सकते हैं, "यही मेरा दोस्त है!" लेकिन वास्तव में, आपके दोस्त ने एक अलग नीली शर्ट और जींस पहनी है और वह कोई अजनबी है।
  • परिणाम: सिस्टम भ्रमित हो जाता है। या तो यह नोटबुक से गलत जवाब उठा लेता है (एक "कैश मिस" या गलत उत्तर), या फिर यह नोटबुक का उपयोग करने से डरता है, जिससे आपको फिर से महंगे सहायक से जवाब पाने के लिए भुगतान करना पड़ता है।

समाधान: MVR-cache ("विस्तृत पहेली" दृष्टिकोण)

यह शोध पत्र MVR-cache पेश करता है, जो नोटबुक की जाँच करने का एक स्मार्ट तरीका है। सवाल को एक एकल धुंधली फोटो में सिकोड़ने के बजाय, MVR-cache सवाल को सार्थक पहेली के टुकड़ों (सेगमेंट) में तोड़ देता है और प्रत्येक टुकड़े को व्यक्तिगत रूप से देखता है।

इसे इस तरह समझें:

  • पुराना तरीका: "यहाँ एक पूरे वाक्य की फोटो है। क्या यह मेरे नोटबुक में मौजूद किसी वाक्य जैसा दिखता है?"
  • MVR-cache का तरीका: "आइए इस वाक्य को हिस्सों में काटें: [विषय/Subject], [क्रिया/Action], और [कर्म/Object]। आइए देखते हैं कि क्या विषय नोटबुक में मौजूद किसी विषय से मेल खाता है, और क्या क्रिया क्रिया से मेल खाती है, और इसी तरह।"

यह कैसे काम करता है (जादुई सामग्रियाँ)

1. "स्मार्ट कटर" (लर्नड प्रॉम्प्ट सेगमेंटेशन)
सिस्टम एक छोटे, तेज़ AI मॉडल ( "स्मार्ट कटर") का उपयोग यह तय करने के लिए करता है कि सवाल को ठीक कहाँ से काटा जाए।

  • उपमा: एक शेफ की कल्पना करें जो जटिल व्यंजन के घटकों को पूरी तरह से अलग करने के लिए जानता है कि कहाँ कट लगाना है। यदि आप पूछते हैं, "फिल्म का सारांश दें, अभिनेताओं की सूची दें, और रेटिंग बताएं," तो स्मार्ट कटर जानता है कि "मूवी" के बाद, "एक्टर्स" के बाद, और "रेटिंग" से पहले कट कहाँ लगाना है।
  • यह केवल रैंडम तरीके से नहीं काटता; यह समय के साथ सीखता है कि कौन से कट सही उत्तर खोजने के लिए सबसे अधिक तर्कसंगत हैं।

2. "टुकड़ा-दर-टुकड़ा" मिलान (मल्टी-वेक्टर रिट्रीवल)
एक बार जब सवाल को टुकड़ों में काट दिया जाता है, तो सिस्टम प्रत्येक टुकड़े की तुलना नोटबुक में मौजूद टुकड़ों से करता है।

  • उपमा: दो पूरी पेंटिंग्स की तुलना करने के बजाय, आप पेंटिंग A के आसमान की तुलना पेंटिंग B के आसमान से करते हैं, पेंटिंग A के पेड़ों की तुलना पेंटिंग B के पेड़ों से करते हैं, और पेंटिंग A के लोगों की तुलना पेंटिंग B के लोगों से करते हैं।
  • भले ही वाक्य अलग-अलग क्रम में हों, यदि टुकड़े अच्छी तरह मेल खाते हैं, तो सिस्टम जान जाता है कि वे एक ही सवाल हैं। इसे MaxSim स्कोर (अधिकतम समानता) कहा जाता है।

3. "सुरक्षा जाल" (सटीकता की गारंटी)
लेखक चिंतित थे: "यदि हम काटने के मामले में बहुत अधिक जटिल हो जाते हैं, तो क्या होगा यदि हम गलत उत्तर उठा लें?"

  • उन्होंने एक गणितीय सुरक्षा जाल बनाया। उन्होंने सिद्ध किया कि यदि आप "स्मार्ट कटर" को सही ढंग से प्रशिक्षित करते हैं, तो यह कभी भी गति के लिए सटीकता का बलिदान नहीं देगा। यह गारंटी देता है कि यदि यह किसी पुराने उत्तर का उपयोग करता है, तो वह उत्तर निश्चित रूप से आपके नए सवाल के लिए सही है।

परिणाम: तेज़ और स्मार्ट

शोधकर्ताओं ने कई प्रकार के सवालों (खोज क्वेरी, वर्गीकरण कार्य और जटिल तर्क) पर इसका परीक्षण किया।

  • जीत: MVR-cache ने मौजूदा सर्वोत्तम तरीकों की तुलना में नोटबुक में सही उत्तर 37% अधिक बार खोजे।
  • लागत: यह अभी भी बहुत तेज़ था। सवाल को "काटने" में लगने वाला समय महंगे सहायक से पूछने के समय की तुलना में नगण्य था।
  • मुख्य बात: सवालों को एक एकल ढेर के बजाय मेल खाने वाले टुकड़ों के संग्रह के रूप में मानकर, MVR-cache बिना कभी गलत उत्तर दिए पैसे और समय बचाता है।

संक्षेप में

वर्तमान सिस्टम सवालों का मिलान करने के लिए "बड़ी तस्वीर" को देखने की कोशिश करते हैं और अक्सर गलत होते हैं। MVR-cache ज़ूम इन करता है, सवाल को स्मार्ट, सार्थक टुकड़ों में काटता है, और उन टुकड़ों को एक-एक करके मिलाता है। यह समूह की एक धुंधली फोटो के बजाय हर व्यक्ति के लिए एक हाई-डेफिनिशन आईडी कार्ड चेक की तरह है, जो यह सुनिश्चित करता है कि आप हमेशा सही व्यक्ति (और सही उत्तर) को तुरंत ढूंढ लें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →