← नवीनतम पेपर
💬 NLP

Less is More: Lightweight Prompt Compression for Question Answering Applications on Edge Devices

यह शोध पत्र CORE को प्रस्तुत करता है, जो एक हल्का, दो-चरणीय प्रॉम्प्ट संपीड़न (compression) तरीका है जो सहायक छोटे भाषा मॉडलों की आवश्यकता को समाप्त करता है ताकि संसाधन-सीमित एज उपकरणों पर रिट्रीवल-ऑगमेंटेड क्वेश्चन आंसरिंग के लिए सटीकता में उल्लेखनीय सुधार, मेमोरी उपयोग में कमी और इन्फरेंस की गति बढ़ाई जा सके।

मूल लेखक: Zihuai Xu, Ruofei Hou, Yang Xu, Hongli Xu, Yunming Liao, Ying Zhu

प्रकाशित 2026-06-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zihuai Xu, Ruofei Hou, Yang Xu, Hongli Xu, Yunming Liao, Ying Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्य सुलझाने की कोशिश कर रहे हैं। आपके पास पुराने समाचार पत्रों, डायरियों और पत्रों का एक विशाल ढेर (जिसे रिट्रीव्ड कॉन्टेक्स्ट कहा जाता है) है जिसमें आपके प्रश्न का उत्तर हो सकता है। हालाँकि, इस ढेर का 95% हिस्सा मौसम की रिपोर्ट, विज्ञापनों और गपशप के बारे में है जिसका आपके केस से कोई लेना-देना नहीं है।

यदि आप इस पूरे ढेर को एक बहुत ही बुद्धिमान लेकिन व्यस्त सहायक (एक लार्ज लैंग्वेज मॉडल या LLM) को पढ़ने के लिए देते हैं, तो दो बुरी चीजें होती हैं:

  1. सहायक अभिभूत (overwhelmed) हो जाता है: उसे सारा कचरा पढ़ने में बहुत समय लगता है, और वह शोर के कारण भ्रमित हो सकता है, जिससे असली सुराग छूट सकता है।
  2. सहायक के पास जगह खत्म हो जाती है: आपके फोन या एज डिवाइस (जैसे एक स्मार्ट कार या रोबोट) में एक साथ उस पूरे ढेर को रखने के लिए पर्याप्त मेमोरी नहीं होती है।

वर्तमान समाधानों के साथ समस्या

अभी, इस ढेर को साफ करने के लिए, लोग एक "मिनी-जासूस" (एक स्मॉल लैंग्वेज मॉडल या SLM) को काम पर लगाते हैं जो कागजों को पढ़ता है और मुख्य सहायक को बताता है कि उसे क्या रखना चाहिए।

  • चुनौती: यह मिनी-जासूस भारी होता है। इसके लिए बहुत अधिक मेमोरी और बैटरी पावर की आवश्यकता होती है। स्मार्टफोन पर इस मिनी-जासूस को चलाने की कोशिश करना अपने बैकपैक में एक भारी रेफ्रिजरेटर ले जाने जैसा है; यह बहुत धीमा है और बैटरी को तुरंत खत्म कर देता है।

समाधान: CORE (कॉन्टेक्स्ट रिफाइनमेंट वाया एंटिटी-अवेयर फिल्टरिंग)

इस शोध पत्र के लेखक CORE नामक एक नई विधि प्रस्तावित करते हैं। एक भारी मिनी-जासूस को काम पर रखने के बजाय, CORE एक चतुर, हल्का दो-चरणीय (two-step) प्रक्रिया का उपयोग करता है जो एक आवर्धक लेंस (magnifying glass) के साथ एक कुशल लाइब्रेरियन की तरह काम करता है।

चरण 1: "कौन, क्या, कहाँ" फ़िल्टर (कैंडिडेट फिल्टरिंग)

हर शब्द को पढ़ने के बजाय, CORE पहले प्रश्न को देखता है ताकि यह अनुमान लगाया जा सके कि आपको किस प्रकार के उत्तर की आवश्यकता है।

  • उपमा: यदि आप पूछते हैं, "कप्तान कौन था?", तो CORE जानता है कि आप एक व्यक्ति (Person) की तलाश कर रहे हैं। यदि आप पूछते हैं, "यह कब हुआ?", तो वह जानता है कि आप एक तारीख (Date) की तलाश कर रहे हैं।
  • कार्रवाई: यह तेजी से टेक्स्ट को स्कैन करता है ताकि उन विशिष्ट "प्रकारों" के शब्दों (जैसे नाम या तारीखें) वाले वाक्यों को खोजा जा सके। यह उन वाक्यों को भी ढूंढता है जो आपके प्रश्न के बहुत समान लगते हैं।
  • परिणाम: यह दो छोटी सूचियाँ बनाता है:
    1. उत्तर सेट (The Answer Set): वे वाक्य जिनमें उत्तर हो सकता है।
    2. सुराग सेट (The Clue Set): वे वाक्य जो उत्तर को सही साबित करने के लिए संदर्भ या साक्ष्य प्रदान करते हैं।
  • यह क्यों शानदार है: यह चरण बहुत छोटे, हल्के उपकरणों (जैसे एक साधारण आवर्धक लेंस) का उपयोग करता है जो जेब में आसानी से आ जाते हैं, पुराने तरीकों के भारी रेफ्रिजरेटर के विपरीत।

चरण 2: "क्रॉस-चेक" (एविडेंस रिफाइनिंग)

अब, CORE के पास दो सूचियाँ हैं, लेकिन वे अभी भी बहुत लंबी हो सकती हैं या उनमें कुछ गलत संकेत हो सकते हैं। इसे बिना किसी भारी कंप्यूटर के इन्हें और अधिक साफ करने की आवश्यकता है।

  • सुरागों को परिष्कृत करना (Refining the Clues): कल्पना करें कि सुराग पहेली के टुकड़े हैं। CORE उन्हें इस तरह व्यवस्थित करता है ताकि वे एक ही जानकारी को दोहराएं नहीं। यदि दो सुराग एक ही बात कहते हैं, तो यह सबसे अच्छे वाले को रखता है और डुप्लिकेट को हटा देता है। यह यह जांच करके करता है कि क्या कोई नया सुराग कहानी में कुछ नया जोड़ रहा है।
  • उत्तरों की छंटनी (Pruning the Answers): CORE जांचता है कि क्या "उत्तर" वाले वाक्य "सुराग" वाले वाक्यों द्वारा समर्थित हैं। यदि कोई उत्तर वाक्य उन सुरागों से बहुत दूर है जो उसका समर्थन करते हैं, या यदि वह केवल संदर्भ के बिना किसी नाम का रैंडम उल्लेख है, तो CORE उसे बाहर निकाल देता है। यह केवल उन्हीं उत्तरों को रखता है जो अपने प्रमाण के "बगल में खड़े" हैं।

परिणाम: तेज़, हल्का और सटीक

लेखकों ने वास्तविक एज डिवाइसेस पर CORE का परीक्षण किया, जैसे कि एक NVIDIA Jetson (रोबोट/कारों के लिए एक शक्तिशाली कंप्यूटर) और एक Huawei स्मार्टफोन

  • गति: CORE अविश्वसनीय रूप से तेज़ है। जहाँ अन्य तरीकों को एक दस्तावेज़ को साफ करने में एक मिनट से अधिक का समय लगता था, वहीं CORE ने इसे सेकंडों में कर दिया।
  • मेमोरी: यह बहुत कम मेमोरी का उपयोग करता है। यदि अन्य तरीकों को एक पूरी हार्ड ड्राइव जितनी जगह की आवश्यकता थी, तो CORE एक USB स्टिक में फिट हो जाता है।
  • बैटरी: स्मार्टफोन पर, CORE ने मौजूदा सर्वोत्तम विधि की तुलना में 95% ऊर्जा बचाई। यह एक गैस से चलने वाले ट्रक से इलेक्ट्रिक स्कूटर पर स्विच करने जैसा है।
  • सटीकता: इतने सारे टेक्स्ट को हटाने के बावजूद, AI वास्तव में प्रश्नों के उत्तर देने में बेहतर हो गया। शोर को हटाकर, AI ने सिग्नल (मुख्य जानकारी) पर ध्यान केंद्रित किया। परीक्षणों में, इसने अन्य संपीड़न (compression) विधियों की तुलना में सटीकता में 30% से अधिक सुधार किया।

सारांश

CORE दस्तावेजों को उनके सबसे महत्वपूर्ण हिस्सों तक सिकोड़ने का एक स्मार्ट, हल्का तरीका है ताकि उन्हें फोन जैसे छोटे उपकरणों पर फिट किया जा सके। यह काम करने के लिए किसी भारी "मिनी-AI" का उपयोग नहीं करता है; इसके बजाय, यह कचरे को फ़िल्टर करने के लिए एंटिटीज (नाम, तारीख, स्थान) और संबंधों के बारे में स्मार्ट नियमों का उपयोग करता है। यह इस प्रक्रिया को एज डिवाइसेस पर AI सहायकों को तेज़, अधिक सटीक और आपकी बैटरी को कम खर्च करने वाला बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →