← नवीनतम पेपर
💬 NLP

Sentinel: Decoding Context Utilization via Attention Probing for Efficient LLM Context Compression

सेंटिनल (Sentinel) एक हल्का, प्रशिक्षण-मुक्त संदर्भ संपीड़न (context compression) ढांचा है जो केवल एक सिंगल फॉरवर्ड पास का उपयोग करके 5×\times तक संपीड़न के साथ कुशल, उच्च-प्रदर्शन वाले रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) को प्राप्त करने के लिए फ्रोजन (frozen) LLMs से इन्फरेंस-टाइम अटेंशन पैटर्न को डिकोड करता है।

मूल लेखक: Yong Zhang, Heng Li, Yanwen Huang, Ning Cheng, Yang Guo, Yun Zhu, Yanmeng Wang, Shaojun Wang, Jing Xiao

प्रकाशित 2026-06-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yong Zhang, Heng Li, Yanwen Huang, Ning Cheng, Yang Guo, Yun Zhu, Yanmeng Wang, Shaojun Wang, Jing Xiao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शानदार जासूस (एक Large Language Model) हैं जो एक रहस्य सुलझाने की कोशिश कर रहे हैं। इसे करने के लिए, आपको सबूतों का एक विशाल, धूल भरा डिब्बा (जिसे retrieved context कहा जाता है) थमाया जाता है। इस डिब्बे में हजारों पन्ने हैं: कुछ बहुत महत्वपूर्ण सुराग हैं, कुछ अप्रासंगिक गपशप हैं, और कुछ बस बेकार का शोर (noise) हैं।

यदि आप जवाब देने से पहले हर एक पन्ना पढ़ने की कोशिश करते हैं, तो आप अभिभूत हो जाते हैं, धीमे हो जाते हैं, और कभी-कभी बहुत अधिक कचरे के कारण असली सुराग भी आपसे छूट जाते हैं। यही वह समस्या है जिसे Sentinel हल करता है।

यहाँ बताया गया है कि Sentinel कैसे काम करता है, जिसे सरल अवधारणाओं में विभाजित किया गया है:

1. पुराना तरीका बनाम Sentinel का तरीका

  • पुराना तरीका (Heuristics): पिछले तरीकों ने यह अनुमान लगाने की कोशिश की कि कौन से पन्ने महत्वपूर्ण हैं, जैसे कि सरल नियमों को देखकर, जैसे कि "क्या इस पन्ने में प्रश्न वाले शब्द मौजूद हैं?" या "क्या यह वाक्य बहुत लंबा है?" यह एक लाइब्रेरियन की तरह है जो केवल कवर देखकर अंदाज़ा लगाता है कि आपको कौन सी किताब चाहिए, बिना वास्तव में कहानी पढ़े।
  • Sentinel का तरीका (Decoding Behavior): Sentinel अंदाज़ा नहीं लगाता। इसके बजाय, यह जासूस (AI) से पूछता है कि जवाब लिखना शुरू करने से पहले वह सबूतों के पूरे डिब्बे पर एक त्वरित, मौन नज़र डाले। यह देखता है कि जासूस की आँखें कैसे चलती हैं (एक तकनीकी शब्द जिसे attention कहा जाता है) यह देखने के लिए कि जासूस वास्तव में किन पन्नों पर ध्यान दे रहा है।

2. "जमी हुई" (Frozen) जासूस और "प्रोब" (Probe)

यह शोध पत्र एक चतुर तकनीक का उपयोग करता है। वे एक बहुत ही बुद्धिमान, लेकिन "जमी हुई" (frozen) जासूस (एक प्री-ट्रेन्ड AI मॉडल जिसे वे दोबारा ट्रेन या बदलते नहीं हैं) को लेते हैं।

  • द प्रोब (The Probe): वे जासूस के मस्तिष्क से एक छोटा, हल्का सेंसर (एक probe) जोड़ते हैं।
  • परीक्षण: वे जासूस को एक प्रश्न और सबूतों का डिब्बा देते हैं। सेंसर उस सटीक क्षण में जासूस की मस्तिष्क गतिविधि को देखता है जब वह उत्तर के बारे में सोच रहा होता है।
  • अंतर्दृष्टि: सेंसर देखता है कि जासूस का मस्तिष्क विशेष रूप से सही सुरागों को देखते समय चमक उठता है, भले ही जासूस ने अभी तक एक शब्द भी न बोला हो। सेंसर यह सीखना शुरू कर देता है कि, "आह, जासूस इस वाक्य पर ध्यान केंद्रित कर रहा है, इसलिए वह वाक्य महत्वपूर्ण है!"

3. "एक नज़र" वाली महाशक्ति (The "One-Glance" Superpower)

अधिकांश संपीड़न (compression) विधियाँ एक धीमे संपादक की तरह होती हैं जो पूरी किताब पढ़ती है, सारांश लिखती है, फिर से पढ़ती है, और फिर संपादन करती है। इसमें बहुत समय लगता है।
Sentinel अलग है। यह सब कुछ एक ही सिंगल, नॉन-ऑटोरिग्रेसिव फॉरवर्ड पास में करता है।

  • उपमा: कल्पना कीजिए कि आप एक भीड़ भरे कमरे को देखते हैं और तुरंत जान जाते हैं कि किससे बात करनी है, बिना हर किसी के पास एक-एक करके जाने और उनसे सवाल पूछे बिना। Sentinel पूरे संदर्भ को एक बार में देखता है, तुरंत उपयोगी वाक्यों की पहचान करता है, और बाकी सबको हटा देता है।

4. "रिट्रीवल-डिपेंडेंट" उदाहरणों के साथ प्रशिक्षण

सेंसर यह कैसे सीखता है कि "महत्वपूर्ण" क्या दिखता है?

  • शोधकर्ताओं ने सेंसर को एक विशिष्ट प्रकार की पहेली का उपयोग करके प्रशिक्षित किया: ऐसे प्रश्न जहाँ जासूस सबूतों के बिना विफल हो जाता है, लेकिन सबूत मिलने पर सफल हो जाता है।
  • यह सेंसर को उन वाक्यों को अनदेखा करने के लिए सिखाता है जिन्हें जासूस अपनी याददाश्त से अनुमान लगा सकता था, और केवल उन वाक्यों पर ध्यान केंद्रित करने के लिए कहता है जो उस विशिष्ट समस्या को हल करने के लिए वास्तव में आवश्यक हैं।

5. परिणाम: छोटा दिमाग, बड़ी समझ

सबसे आश्चर्यजनक खोज यह है कि आपको यह करने के लिए एक विशाल, महंगे दिमाग की आवश्यकता नहीं है।

  • 0.5B बनाम 7B: शोधकर्ताओं ने "सेंसर" के रूप में कार्य करने के लिए एक बहुत ही छोटा, कॉम्पैक्ट AI मॉडल (0.5 बिलियन पैरामीटर्स) इस्तेमाल किया, जो एक बहुत बड़े, शक्तिशाली AI (7 बिलियन पैरामीटर्स) के लिए था।
  • परिणाम: इस छोटे से सेंसर ने सबूतों के डिब्बे को 5 गुना तक कंप्रेस करने (केवल 20% टेक्स्ट रखना) में सफलता पाई, जबकि इसने बड़े जासूस को उतनी ही अच्छी तरह से रहस्य सुलझाने में सक्षम बनाया जितना कि यदि उसने पूरा दस्तावेज़ पढ़ा होता। वास्तव में, इसने अन्य तरीकों से भी बेहतर प्रदर्शन किया जिन्होंने संपीड़न के लिए विशाल, महंगे मॉडलों का उपयोग किया था।

6. विभिन्न भाषाएँ बोलना

भले ही सेंसर को केवल अंग्रेजी पहेलियों पर प्रशिक्षित किया गया था, फिर भी इसने सुराग खोजने के तर्क को इतनी अच्छी तरह से समझ लिया कि यह चीनी पहेलियों पर भी पूरी तरह से काम करने लगा। इसने केवल अंग्रेजी शब्दों को नहीं, बल्कि सुराग खोजने के "व्यवहार" को सीखा।

सारांश

Sentinel एक स्मार्ट फ़िल्टर की तरह है जो यह देखने के लिए कि एक AI किसी प्रश्न के बारे में कैसे "सोचता" है, यह तय करता है कि एक लंबे दस्तावेज़ के कौन से हिस्से वास्तव में उपयोगी हैं। यह शोर को हटा देता है, संकेत (signal) को रखता है, और यह सब एक सेकंड के अंश में एक छोटे, सस्ते सहायक मॉडल का उपयोग करके करता है, जिससे सटीकता खोए बिना समय और कंप्यूटर शक्ति की बचत होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →