← नवीनतम पेपर
🤖 AI

SmartRAG: Native Graph-Based RAG for Mobile Device

SmartRAG एक पूर्णतः ऑन-डिवाइस फ्रेमवर्क है जो बुद्धिमत्ता को एक निरंतर सीखने योग्य एंटिटी रिकग्नाइज़र और एक तीन-स्तरीय नॉलेज ग्राफ पर केंद्रित समन्वित मॉड्यूल में विभाजित करके कमोडिटी स्मार्टफोन पर प्रतिस्पर्धी मल्टी-हॉप रीजनिंग प्रदर्शन प्राप्त करता है, जिससे बिना किसी बड़े मॉडल संपीड़न की आवश्यकता के कुशल, निजी और ऑफलाइन LLM सहायता सक्षम होती है।

मूल लेखक: Zhihan Jiang, Meng Li, Shenghao Liu, Keran Li, Ruiben Zhou, Wei Wang, Xianjun Deng, Shuai Wang, Haipeng Dai

प्रकाशित 2026-07-21
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhihan Jiang, Meng Li, Shenghao Liu, Keran Li, Ruiben Zhou, Wei Wang, Xianjun Deng, Shuai Wang, Haipeng Dai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके फोन के अंदर एक सुपर-स्मार्ट रोबोट दोस्त रहता है, जो "लार्ज लैंग्वेज मॉडल" (LLM) द्वारा संचालित है। यह चैट कर सकता है, कहानियाँ लिख सकता है और लगभग किसी भी चीज़ का उत्तर दे सकता है। लेकिन एक शर्त है: वास्तव में मददगार होने के लिए, इस रोबole को आपके जीवन को याद रखने की आवश्यकता है—आपकी तस्वीरें, आपके नोट्स, आपकी निजी बातचीत—बिना उस डेटा को किसी विशाल क्लाउड सर्वर पर भेजे जहाँ वह खो जाए या चोरी हो जाए। यह ऑन-डिवाइस एआई (on-device AI) की दुनिया है: गोपनीयता और गति के लिए मस्तिष्क और स्मृति को यहीं आपकी जेब में रखना।

हालाँकि, एक फोन में फिट होने वाला मस्तिष्क बनाना एक बैकपैक में लाइब्रेरी पैक करने जैसा है। सबसे बड़ी चुनौती मेमोरी (स्मृति) है। एक मानक रोबोट मस्तिष्क सब कुछ अपने स्वयं के "पैरामीट्रिक मेमोरी" (इसके आंतरिक वेट्स) के भीतर याद रखने की कोशिश करता है, जो फोन के लिए बहुत भारी है और जब आप कुछ नया सीखते हैं तो इसे आसानी से अपडेट नहीं किया जा सकता। इसे ठीक करने के लिए, वैज्ञानिक RAG (रिट्रीवल-ऑगमेंटेड जनरेशन) का उपयोग करते हैं। RAG को रोबोट को एक नोटबुक देने के रूप में सोचें। जब कोई प्रश्न पूछा जाता है, तो वह केवल अनुमान नहीं लगाता; वह तथ्यों को खोजने के लिए अपनी नोटबुक के पन्ने पलटता है, फिर उत्तर लिखता है। समस्या यह है कि अधिकांश नोटबुक ढीले पन्नों के ढेर जैसी होती हैं। यदि आप एक जटिल प्रश्न पूछते हैं जिसमें तीन अलग-अलग पन्नों से तीन अलग-अलग तथ्यों को जोड़ने की आवश्यकता होती है, तो ढीले पन्नों के ढेर को नेविगेट करना कठिन होता है। यह पेपर पूछता है: हम एक फोन के लिए एक स्मार्ट, व्यवस्थित नोटबुक कैसे बना सकते हैं जो बिना सुपरकंप्यूटर की आवश्यकता के जटिल पहेलियों को संभाल सके?


समस्या: "बड़ा मस्तिष्क" बनाम "छोटा फोन"

कुछ समय के लिए, एआई को स्मार्ट बनाने का समाधान सरल लगता था: बस मस्तिष्क को बड़ा बना दो। लेकिन इस पेपर के लेखक, SmartRAG, तर्क देते हैं कि मोबाइल उपकरणों के लिए यह गलत दृष्टिकोण है। आप एक विशाल क्लाउड मस्तिष्क को फोन में फिट होने के लिए छोटा नहीं कर सकते; यह बहुत भारी है, बहुत अधिक बैटरी का उपयोग करता है, और सोचने में बहुत समय लेता है।

वे एक अलग विचार सुझाते हैं: एक विशाल मस्तिष्क बनाने के बजाय जो सब कुछ करने की कोशिश करता है, आइए विशेषज्ञ, हल्के वजन वाले श्रमिकों की एक टीम बनाएं। वे इसे SmartRAG कहते हैं। यह एक सिस्टम है जिसे पूरी तरह से आपके स्मार्टफोन पर चलने के लिए डिज़ाइन किया गया है, जो आपके व्यक्तिगत डेटा को टेक्स्ट के बिखरे हुए ढेर के बजाय एक संरचित "नॉलेज ग्राफ" (कनेक्टेड तथ्यों के जाल के रूप में सोचें) में व्यवस्थित करता है।

टीम: चार विशिष्ट कार्यकर्ता

SmartRAG एक स्मार्ट असिस्टेंट होने के काम को चार अलग-अलग भूमिकाओं में विभाजित करता है, जिनमें से प्रत्येक को एक अलग मॉड्यूल द्वारा संभाला जाता है:

  1. परसेप्शन (जासूस - The Detective): यह टीम का वह सदस्य है जो आपके टेक्स्ट और नोट्स को पढ़ता है। यह महत्वपूर्ण नामों और तथ्यों को पहचानने के लिए एक विशेष टूल EvoNER का उपयोग करता है। मजेदार बात क्या है? EvoNER "निरंतर सीखने योग्य" (continually learnable) है। कल्पना कीजिए कि एक जासूस जो बिना स्कूल वापस जाए हर दिन नए प्रकार के सुराग सीखता है। यदि आप किसी नए प्रकार की इकाई (जैसे कोई नया स्लैंग शब्द या कोई विशिष्ट शौक) का उल्लेख करते हैं, तो EvoNER बिना पूरे विशाल मस्तिष्क को फिर से प्रशिक्षित किए, अपनी "लेबल इन्वेंट्री" को अपडेट करते हुए, उसे पहचानने के लिए सीख सकता है।
  2. मेमोरी (लाइब्रेरियन - The Librarian): एक बार जब जासूस को तथ्य मिल जाता है, तो लाइब्रेरियन उसे सहेज लेता है। लेकिन तथ्य को केवल एक दराज में फाइल करने के बजाय, लाइब्रेरियन एक तीन-स्तरीय नॉलेज ग्राफ, MRGraph बनाता है।
    • लेयर 1 तथ्यों को उनके सटीक पैराग्राफ से जोड़ता है (ताकि आपको पता चले कि जानकारी कहाँ से आई है)।
    • लेयर 2 समान तथ्यों को समूहों (clusters) में वर्गीकृत करता है (जैसे कि एक "विषय" फोल्डर)।
    • लेयर 3 त्वरित पठन के लिए कच्चे टेक्स्ट (raw text) को तैयार रखता है।
      यह संरचना सुनिश्चित करती है कि जब आप कोई प्रश्न पूछते हैं, तो सिस्टम जानता है कि तथ्य कैसे जुड़ते हैं, जिससे सूचना के हर टुकड़े का "प्रूवनेंस" (स्रोत) सुरक्षित रहता है।
  3. फोकस (नेविगेटर - The Navigator): जब आप एक प्रश्न पूछते हैं, तो नेविगेटर केवल कीवर्ड्स की तलाश नहीं करता है। यह एक हाइब्रिड पाइपलाइन का उपयोग करता है। यह कनेक्शनों के जाल (ग्राफ) को देखता है, शब्दों का मिलान (लेक्सिकल सर्च) करता है, और अर्थ को समझता है (सिमेंटिक सर्च)। यदि आप एक बहु-चरणीय प्रश्न पूछते हैं जैसे "उस फिल्म के निर्देशक जिस फिल्म को मैं पसंद करता हूँ, उसके द्वारा प्रसिद्ध पुस्तक किसने लिखी?", तो नेविगेटर ग्राफ के माध्यम से पथ को ट्रैक कर सकता है, केवल अनुमान लगाने के बजाय, एक तथ्य से दूसरे तथ्य पर कूद सकता है।
  4. थिंकिंग (मस्तिष्क - The Brain): यह एकमात्र हिस्सा है जो भारी-भरत लार्ज लैंग्वेज मॉडल (LLM) का उपयोग करता है। लेकिन यहाँ चाल यह है: LLM को केवल "उच्च-मूल्य" वाले कार्यों के लिए बुलाया जाता है। यह हर एक पन्ना नहीं पढ़ता है। यह केवल खोज की योजना बनाने, नए प्रकार के तथ्यों को लेबल करने, या अंतिम उत्तर लिखने के लिए हस्तक्षेप करता है। LLM को नियंत्रण में रखकर, सिस्टम भारी मात्रा में बैटरी और मेमोरी बचाता है।

यह वास्तविक जीवन में कैसे काम करता है

शोधकर्ताओं ने इस सिस्टम का परीक्षण वास्तविक स्मार्टफोन (विशेष रूप से स्नैपड्रैगन प्रोसेसर वाले वनप्लस डिवाइस) पर किया। उन्होंने एक बहुत ही छोटे, कुशल LLM संस्करण का उपयोग किया (केवल 1.7 बिलियन पैरामीटर्स, जो क्लाउड में उपयोग किए जाने वाले विशाल मॉडलों की तुलना में बहुत छोटा है)।

उन्होंने SmartRAG की अन्य तरीकों के साथ तुलना की:

  • LLM-only: बस एक छोटा मस्तिष्क जो सब कुछ याद रखने की कोशिश करता है।
  • Naïve RAG: एक छोटा मस्तिष्क जिसके पास खोजने के लिए कागजों का एक बिखरा हुआ ढेर है।
  • Cloud-sized models: विशाल मस्तिष्क (32 बिलियन पैरामीटर्स तक) जो फोन पर नहीं चल सकते।

परिणाम:
जटिल प्रश्नों पर जिनमें कई साक्ष्यों को जोड़ने की आवश्यकता थी (multi-hop reasoning), Smart-RAG के 1.7B मस्तिष्क ने प्रतिस्पर्धी प्रदर्शन किया और कुछ मामलों में विशाल क्लाउड मॉडलों से बेहतर प्रदर्शन किया।

  • MultiHopQA बेंचमार्क पर, SmartRAG ने 50.17% का शुद्धता स्कोर प्राप्त किया, जो 1.7B "LLM-only" संस्करण (जिसने 22.00% स्कोर किया) से काफी बेहतर था और 32B मॉडल (जिसने 31.54% स्कोर किया) से भी आगे निकल गया।
  • हालाँकि, TriviaQA (प्रत्यक्ष तथ्य आधारित प्रश्नों के लिए एक बेंचमार्क) पर, 32B मॉडल का लाभ बना रहा, जिसने SmartRAG के 50.00% की तुलना में 51.45% स्कोर किया।
  • कुल मिलाकर, SmartRAG ने NQ, HotpotQA, और MultiHopQA जैसे ज्ञान-गहन कार्यों पर बड़े मॉडलों के बराबर या उनसे बेहतर प्रदर्शन किया, जबकि पूरी तरह से फोन पर चलकर गोपनीयता बनाए रखी। प्रतिक्रिया समय व्यावहारिक था, हालांकि लेखक नोट करते हैं कि पूर्ण प्रक्रिया के लिए 1.7B मॉडल पर "टाइम टू फर्स्ट टोकन" (बोलना शुरू करने में लगने वाला समय) लगभग 36.9 सेकंड था, मुख्य रूप से इसलिए क्योंकि इसे पहले मेमोरी को खोजना पड़ता था।

उन्होंने क्या खारिज किया

पेपर स्पष्ट रूप से कुछ सामान्य विचारों के विरुद्ध तर्क देता है:

  • केवल क्लाउड को कंप्रेस करना: आप एक विशाल क्लाउड-आधारित ग्राफ सिस्टम को लेकर उसे फोन में छोटा नहीं कर सकते; गणित और ऊर्जा की लागत बहुत अधिक है।
  • LLM-नेटिव एक्सट्रैक्शन: उन्होंने पाया कि मेमोरी को व्यवस्थित करने (तथ्यों को निकालने और ग्राफ बनाने) के लिए भारी LLM का उपयोग करना फोन के लिए बहुत धीमा और ऊर्जा-खर्चीला है। "परसेप्शन" मॉड्यूल एक हल्का, प्रशिक्षण योग्य घटक होना चाहिए, न कि भारी LLM।
  • Naïve Vector Search: केवल साधारण "सिमेंटिक समानता" (ऐसे शब्दों को खोजना जो सुनने में एक जैसे हों) पर निर्भर रहना पर्याप्त नहीं है, क्योंकि जटिल प्रश्नों के लिए तार्किक कनेक्शन की आवश्यकता होती है।

निष्कर्ष

लेखक सुझाव देते हैं कि ऑन-डिवाइस एआई का भविष्य मस्तिष्क को बड़ा बनाने के बारे में नहीं है, बल्कि सिस्टम को स्मार्ट बनाने के बारे में है। "तथ्यों को नोटिस करने" (परसेप्शन), "तथ्यों को व्यवस्थित करने" (मेमोरी), "तथ्यों को खोजने" (फोकस), और "तथ्यों के बारे में सोचने" (थिंकिंग) के काम को अलग करके, SmartRAG दिखाता है कि एक छोटा, कुशल फोन उन जटिल तर्क कार्यों को संभाल सकता है जिनके लिए आमतौर पर सुपरकंप्यूटर की आवश्यकता होती है।

हालाँकि यह सिस्टम अभी भी पूर्ण नहीं है (यह अभी भी AI और राजनीति जैसे बहुत विशिष्ट विषयों के साथ थोड़ा संघर्ष करता है, और गति तेज हो सकती है), प्रयोग यह सिद्ध करता है कि एक संरचित, ग्राफ-आधारित दृष्टिकोण गोपनीयता-केंद्रित, ऑफलाइन एआई सहायकों के लिए एक व्यवहार्य मार्ग है। यह बताता है कि सही आर्किटेक्चर के साथ, आपका फोन का व्यक्तिगत सहायक जल्द ही एक क्लाउड दिग्गज जितना स्मार्ट हो सकता है, लेकिन आपके सभी रहस्य आपकी जेब में ही सुरक्षित रहेंगे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →