← नवीनतम पेपर
🤖 machine learning

Models Take Notes at Prefill: KV Cache Can Be Editable and Composable

यह शोध पत्र प्रकट करता है कि प्रीफिल के दौरान, मॉडल स्वयं के वेक्टर्स पर निर्भर रहने के बजाय मुख्य रूप से डाउनस्ट्रीम KV कैश नोट्स में फील्ड-कंडीशन्ड निष्कर्षों को संग्रहीत करते हैं, जो एक नवीन दृष्टिकोण को सक्षम बनाता है जहाँ चेन-ऑफ-थॉट के माध्यम से कैश को कुशलतापूर्वक संपादित किया जा सकता है और पूर्ण पुनर्गणना (recomputation) की तुलना में काफी कम विलंबता के साथ लगभग पूर्ण सटीकता प्राप्त करने के लिए विभिन्न संदर्भों में संयोजित किया जा सकता है।

मूल लेखक: Bojie Li

प्रकाशित 2026-06-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bojie Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Models Take Notes at Prefill: KV Cache Can Be Editable and Composable" शोध पत्र का एक स्पष्टीकरण दिया गया है, जो अवधारणाओं को स्पष्ट करने के लिए रोजमर्रा के उपमाओं (analogies) का उपयोग करता है।

मुख्य विचार: मॉडल की "नोटबुक"

कल्पना कीजिए कि एक बड़ा लैंग्वेज मॉडल (जैसे कि एक बहुत ही बुद्धिमान रोबोट सहायक) किसी प्रश्न का उत्तर देने के लिए एक लंबे दस्तावेज़ को पढ़ रहा है। आमतौर पर, जब रोबोट एक वाक्य पढ़ता है, तो वह उस पर "विचार" करता है और फिर आगे बढ़ जाता है। यदि बाद में वाक्य बदल जाता है, तो रोबोट को नए संदर्भ को समझने के लिए पूरे दस्तावेज़ को शुरू से फिर से पढ़ना पड़ता है। यह धीमा और महंगा है।

इस शोध ने एक आश्चर्यजनक बात का पता लगाया है: रोबोट केवल दस्तावेज़ पढ़ता ही नहीं है; वह पढ़ते समय एक अलग "नोटबुक" (KV Cache) पर नोट्स भी लेता है।

महत्वपूर्ण बात यह है कि रोबोट केवल कच्चे शब्दों को नहीं लिखता, बल्कि अपने निष्कर्षों को इस नोटबुक में लिखता है। एक बार जब वह यह समझ जाता है कि, "ओह, ऑर्डर की स्थिति 'shipped' है, इसलिए मुझे रिफंड को अस्वीकार कर देना चाहिए," तो वह उस निष्कर्ष को नोटबुक में लिख देता है। बाद में, जब उसे निर्णय लेने की आवश्यकता होती है, तो वह मूल वाक्य को पीछे मुड़कर नहीं देखता; वह बस अपने स्वयं के नोट्स पढ़ता है।

समस्या: "पुराने नोट" का जाल (The "Stale Note" Trap)

शोधकर्ताओं ने तब एक सरल सुधार आज़माया जब जानकारी का एक हिस्सा बदल गया (उदाहरण के लिए, ऑर्डर की स्थिति "shipped" से बदलकर "pending" हो गई)। उन्होंने सोचा: "यदि मैं टेक्स्ट में विशिष्ट शब्द को बदल दूँ, तो रोबolo बदलाव को देख लेगा और अपने उत्तर को अपडेट कर देगा।"

वे गलत थे।

चूंकि रोबोट ने पहले ही पुरानी जानकारी के आधार पर अपनी नोटबुक में अपना निष्कर्ष ("रिफंड को अस्वीकार करें") लिख लिया था, इसलिए केवल मूल शब्द को बदलना काम नहीं आया। रोबोट ने बदलाव को अनदेखा कर दिया और अपने पुराने नोट को ही पढ़ता रहा। यह वैसा ही था जैसे किसी कागज़ पर 2+2=42+2=4 को 2+2=52+2=5 में बदलने की कोशिश करना, लेकिन छात्र ने पहले ही अपनी नोटबुक में "उत्तर 4 है" लिख लिया था और वह बस उसे ही कॉपी कर रहा था। छात्र बदलाव को तब तक नहीं देख पाएगा जब तक आप उसे पूरा पेज फिर से पढ़ने के लिए मजबूर न करें।

समाधान 1: "त्रुटि सुधार" (एक स्टिकी नोट)

चूंकि रोबोट अपने नोट्स पर निर्भर करता है, शोधकर्ताओं ने बिना पूरी किताब को फिर से पढ़े गलती को सुधारने का एक तरीका खोजा।

पुराने नोट को सर्जरी की तरह मिटाने और फिर से लिखने (जो विफल रहता है) के बजाय, उन्होंने बस दस्तावेज़ के अंत में एक नया, स्पष्ट नोट संलग्न (append) कर दिया।

  • उपमा: कल्पना कीजिए कि रोबोट एक अनुबंध (contract) पढ़ रहा है। आप पेज नंबरों को खराब किए बिना अनुबंध के बीच में किसी क्लॉज को आसानी से काट या बदल नहीं सकते। इसके बजाय, आप दस्तावेज़ के बिल्कुल अंत में एक चमकीला पीला "ERRATUM" (त्रुटि सुधार) नोट चिपका देते हैं जिसमें लिखा होता है: "पिछले नोट को अनदेखा करें। स्थिति अब 'Pending' है। उत्तर 'Approve' है।"
  • परिणाम: रोबोट इस नए, स्पष्ट नोट को देखता है, अपने निर्णय को अपडेट करता है, और पुराने नोट को अनदेखा कर देता है। यह अविश्वसनीय रूप से तेज़ है और लगभग पूरी तरह से काम करता है।

समाधान 2: "कौशल संयोजन" (Lego Brick)

दूसरा निष्कर्ष काम को पुन: उपयोग करने के बारे में है।

कल्प लीजिए कि आपके पास किसी विशिष्ट कार्य (जैसे "फ्लाइट कैसे बुक करें") के लिए एक लंबा, जटिल निर्देश मैनुअल है। आमतौर पर, जब भी आप रोबोट को फ्लाइट बुक करने के लिए कहते हैं, तो उसे वह पूरा मैनुअल शुरू से पढ़ना पड़ता है।

शोधकर्ताओं ने पाया कि चूंकि रोबोट अपनी नोटबुक में अपने निष्कर्ष लिखता है, आप उस मैनुल के लिए नोट्स को एक बार पहले से लिख सकते हैं, उन्हें सहेज सकते हैं, और फिर उन्हें एक नई बातचीत में "पेस्ट" कर सकते हैं।

  • उपमा: हर बार कुर्सी बनाने के लिए निर्देश मैनुअल पढ़ने के बजाय, आपके पास एक पहले से असेंबल किया गया "चेयर किट" (नोट्स) है। आप बस किट को उठाते हैं और उसे अपने कार्यक्षेत्र में डाल देते हैं।
  • जादू: आप इस किट को बातचीत के अलग स्थान पर ले जा सकते हैं (reposition) और यह अभी भी पूरी तरह से काम करता है। रोबoret को मैनुअल को फिर से पढ़ने की आवश्यकता नहीं है; वह बस पहले से लिखे गए नोट्स को उठाता है और आगे बढ़ता है। यह प्रक्रिया को 14 गुना तेज़ बनाता है।

यह क्यों महत्वपूर्ण है?

  1. यह संपादन योग्य (Editable) है: यदि कोई उपयोगकर्ता विवरण बदलता है (जैसे उनका नाम या ऑर्डर की स्थिति), तो आपको पूरी बातचीत फिर से शुरू करने की आवश्यकता नहीं है। आप बस अंत में एक "सुधार नोट" जोड़ते हैं, और रोबोट तुरंत अपने व्यवहार को अपडेट कर देता है।
  2. यह संयोजन योग्य (Composable) है: आप "कौशल" (जैसे फ्लाइट बुक करने की रेसिपी या रिटर्न संभालने के लिए गाइड) का एक पुस्तकालय बना सकते हैं। आप इन कौशलों को पहले से कंप्यूट कर सकते हैं और उन्हें किसी भी बातचीत में तुरंत पेस्ट कर सकते हैं, जिससे समय और कंप्यूटर पावर की भारी बचत होती है।
  3. यह हर जगह काम करता है: शोधकर्ताओं ने कई अलग-अलग प्रकार के AI मॉडल (छोटे से लेकर बड़े तक, और यहाँ तक कि इमेज देखने वाले मॉडल) पर इसका परीक्षण किया, और यह सभी के लिए काम कर गया।

एक वाक्य में सारांश

यह शोध पत्र बताता है कि AI मॉडल पढ़ते समय एक छिपी हुई नोटबुक में अपने निष्कर्ष लिखते हैं; यह जानकर, हम एक "सुधार नोट" जोड़कर गलतियों को ठीक कर सकते हैं और AI को सब कुछ फिर से पढ़ने के लिए मजबूर करने के बजाय, पहले से लिखे गए "स्किल नोट्स" को पेस्ट करके कार्यों को तेज़ कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →