← नवीनतम पेपर
💬 NLP

RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLM

RAGU एक ओपन-सोर्स, सिंगल-जीपीयू ग्राफआरएजी (GraphRAG) इंजन है जो निष्कर्षण (extraction) को समेकन (consolidation) से अलग करके और एक कॉम्पैक्ट, डोमेन-अनुकूलित 7B एलएलएम (Meno-Lite-0.1) का उपयोग करके नॉलेज ग्राफ निर्माण और रिट्रीवल में सुधार करता है, ताकि ग्राफ निर्माण और जटिल तर्क कार्यों दोनों पर बड़े मॉडलों से बेहतर प्रदर्शन किया जा सके।

मूल लेखक: Mikhail Komarov, Ivan Bondarenko, Stanislav Shtuka, Oleg Sedukhin, Roman Shuvalov, Yana Dementyeva, Matvey Solovyov, Nikolay O. Nikitin

प्रकाशित 2026-07-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mikhail Komarov, Ivan Bondarenko, Stanislav Shtuka, Oleg Sedukhin, Roman Shuvalov, Yana Dementyeva, Matvey Solovyov, Nikolay O. Nikitin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट के लिए सबसे उत्तम "मस्तिष्क" बनाने की कोशिश कर रहे हैं जिसे किताबों के एक विशाल पुस्तकालय के बारे में सवालों के जवाब देने की आवश्यकता है। अधिकांश लोग सोचते हैं कि यह करने का एकमात्र तरीका एक सुपर-जीनियस, सर्वज्ञ लाइब्रेरियन (एक बहुत बड़ा, महंगा AI मॉडल) को काम पर रखना है जिसने हर किताब को पढ़ा हो, हर तथ्य को याद किया हो, और आपके सवालों के जवाब दिए हों।

लेकिन इस पेपर के लेखक, RAGU, कहते हैं: "ठहरिए। यह ज़रूरत से ज़्यादा है!"

उन्होंने पाया कि लाइब्रेरियन को वास्तव में तथ्यों को कंठस्थ करने की आवश्यकता नहीं है। उसे बस अपने सामने जो कुछ भी है उसे पढ़ने, समझने और व्यवस्थित करने में बहुत कुशल होने की आवश्यकता है। यह एक ऐसे इंसान के बीच के अंतर जैसा है जिसने पूरी विश्वकोश (encyclopedia) को याद कर लिया है बनाम एक ऐसे इंसान के बीच का अंतर जो जानकारी खोजने और कड़ियों को जोड़ने में अविश्वसनीय रूप से तेज़ है। पेपर सुझाव देता है कि जैसे-जैसे मस्तिष्क बड़ा होता है, ये "पढ़ने के कौशल" में बहुत अधिक सुधार नहीं होता है, लेकिन "याद किए गए तथ्य" बढ़ते हैं। इसलिए, आपको एक विशाल मस्तिष्क की आवश्यकता नहीं है; आपको बस एक तेज़ दिमाग की आवश्यकता है।

पुराने तरीके के साथ समस्या

वर्तमान प्रणालियाँ एक ही बड़े, अव्यवस्थित प्रयास में एक ज्ञान मानचित्र (ग्राफ) बनाने की कोशिश करती हैं। यह एक छात्र से एक पूरा उपन्यास पढ़ने और पाँच मिनट में हर पात्र का फैमिली ट्री बनाने के लिए कहने जैसा है। परिणाम? डुप्लिकेट नामों, भ्रमित संबंधों और गायब कड़ियों का एक उलझा हुआ जाल। इसके अलावा, ये सिस्टम आमतौर पर महंगे, विशाल AI मॉडल पर निर्भर करते हैं जिन्हें चलाने में एक बड़ी राशि खर्च होती है।

RAGU समाधान: दो-चरणीय नृत्य

RAGU इस काम को दो अलग-अलग चरणों में तोड़कर खेल बदल देता है, जैसे एक साथी के साथ नृत्य:

  1. निष्कर्षण (द स्केच - रेखाचित्र): सबसे पहले, एक छोटा, तेज़ AI (जिसे Meno-Lite-0.1 कहा जाता है, जो केवल 7 बिलियन पैरामीटर्स का है) टेक्स्ट को पढ़ता है और महत्वपूर्ण नाम और तथ्य निकालता है। यह बहुत सावधान है, यह सुनिश्चित करने के लिए कि यह फर्जी संबंध न बनाए, अपने काम की जांच एक सख्त नियम पुस्तिका के विरुद्ध करता है।
  2. समेकन (द पॉलिश - चमक): यही असली सफलता का मंत्र है। स्केच को बस एक ढेर में डालने के बजाय, RAGU इसे साफ करता है। यह डुप्लिकेट नामों को खोजने और उन्हें मिलाने के लिए एक स्मार्ट क्लस्टरिंग टूल (DBSCAN) का उपयोग करता है। फिर, यह संबंधित विचारों को "समुदायों" (जैसे मानचित्र पर पड़ोस) में समूहित करता है। अंत में, यह इन समुदायों का सारांश देता है ताकि रोबोट व्यापक चित्र देख सके।

यह प्रक्रिया एक शोर-शराबे वाले, अव्यवस्थित स्केच को एक साफ, व्यवस्थित मानचित्र में बदल देती है।

"छोटा मस्तिष्क" वाला आश्चर्य

यहाँ सबसे रोमांचक हिस्सा है: लेखकों ने इस पढ़ने और व्यवस्थित करने के काम के लिए विशेष रूप से प्रशिक्षित एक 7 बिलियन पैरामीटर मॉडल (Meno-Lite-0.1) बनाया। उन्होंने इसकी तुलना एक 32 बिलियन पैरामीटर वाले विशाल मॉडल (Qwen2.5-32B) से की।

परिणाम? छोटे 7B मॉडल ने वास्तव में बड़े 32B मॉडल की तुलना में बेहतर ज्ञान मानचित्र बनाए, एक विशिष्ट स्कोरिंग मीट्रिक पर उसे 12.5% से पीछे छोड़ दिया। यह एक फुर्तीले, केंद्रित जासूस की तरह है जो एक सुस्त, अत्यधिक काम से थके हुए विशालकाय व्यक्ति की तुलना में तेजी से और अधिक सटीकता से मामला सुलझाता है।

क्या यह वास्तव में काम करता है?

टीम ने कुछ कठिन चिकित्सा और सामान्य ज्ञान चुनौतियों पर RAGм परीक्षण किया। यहाँ उन्हें क्या मिला:

  • "तथ्य प्राप्ति" (एक विशिष्ट तथ्य खोजना) पर: एक प्रतिस्पर्धी प्रणाली जिसे HippoRAG 2 कहा जाता है, एकल तथ्यों को सटीक रूप से पकड़ने में थोड़ी बेहतर थी। यह एक स्नाइपर की तरह है जो एक लक्ष्य को पूरी तरह से हिट करता है।
  • "रचनात्मक पीढ़ी" और "सारांशीकरण" (कई तथ्यों को एक साथ जोड़ना) पर: RAGU ने बढ़त बना ली। जब कार्य के लिए एक विस्तृत कहानी बुनने या जटिल विषय का सारांश देने की आवश्यकता थी, तो RAGU ने अधिक पूर्ण जानकारी प्राप्त की (अन्य लोगों के 0.76 के मुकाबले 0.84 साक्ष्य रिकॉल तक) और बेहतर उत्तर दिए।
  • "फॉर्मेट" का पैंतरा: कुछ परीक्षणों में, ऐसा लगा जैसे HippoRAG 2 भारी अंतर से जीत रहा है। लेकिन लेखकों ने महसूस किया कि यह मुख्य रूप से इसलिए था क्योंकि HippoRAG 2 बहुत छोटे, सीधे उत्तर दे रहा था, जबकि RAGU लंबे, विस्तृत उत्तर दे रहा था। जब उन्होंने सभी को एक ही छोटे प्रारूप में उत्तर देने के लिए मजबूर किया, तो RAGU ने बराबरी कर ली और कई परीक्षणों में उसे पीछे छोड़ दिया। पेपर सुझाव देता है कि पुराना "जीत" काफी हद तक उत्तरों के प्रारूप के कारण था, न कि वास्तविक श्रेष्ठता के कारण।

यह क्यों मायने रखता है (प्रतिभा की लागत)

पेपर का तर्क है कि हमें स्मार्ट ज्ञान प्रणाली बनाने के लिए विशाल AI मॉडल पर एक बड़ी राशि खर्च करने की आवश्यकता नहीं है। क्योंकि RAGU एक छोटा, कुशल मॉडल उपयोग करता है और एक सिंगल ग्राफिक्स कार्ड (GPU) पर चलता है, इसलिए एक दस्तावेज़ को प्रोसेस करने की लागत लगभग 0.001है।उनवाणिज्यिकविकल्पोंकीतुलनाकरेंजोप्रतिदस्तावेज़0.001** है। उन वाणिज्यिक विकल्पों की तुलना करें जो प्रति दस्तावेज़ **0.10 तक लग सकते हैं। यह सौ गुना सस्ता है!

इसका मतलब है कि आपको एक स्मार्ट AI बनाने के लिए एक विशाल सुपरकंप्यूटर क्लस्टर की आवश्यकता नहीं है; आप इसे एक सिंगल मशीन पर कर सकते हैं, जिससे उन्नत तकनीक आम लोगों और छोटी प्रयोगशालाओं के लिए सुलभ हो जाती है।

सावधानियां (वे क्या दावा नहीं कर रहे हैं)

लेखक सावधानी बरतते हैं। वे स्वीकार करते हैं कि:

  • उनके निष्कर्ष विशिष्ट परीक्षणों और मॉडल के एक परिवार (Qwen2.5) पर आधारित हैं, इसलिए हालांकि सबूत मजबूत हैं, यह एक "सुदृढ़ परिकल्पना" है न कि भौतिकी का कोई सार्वभौमिक नियम।
  • छोटा मॉडल (Meno-Lite-0.1) संदर्भ का उपयोग करने में महान है, लेकिन इसे स्टैंडअलोन विश्वकोश के रूप में उपयोग नहीं किया जाना चाहिए। यदि आप इसे बिना टेक्स्ट दिए कुछ पूछते हैं, तो शायद यह उत्तर नहीं दे पाएगा क्योंकि इसने "याद किए गए तथ्यों" के बदले "पढ़ने के कौशल" को चुना है।
  • यदि स्रोत दस्तावेज़ अस्त-व्यस्त या पक्षपाती हैं, तो मानचित्र भी वैसा ही होगा। सिस्टम केवल उतना ही अच्छा है जितना कि वह पुस्तकालय जिसे वह पढ़ रहा है।

संक्षेप में, RAGU सुझाव देता है कि स्मार्ट, जुड़े हुए ज्ञान तंत्र बनाने के लिए, संगठन और स्पष्टता, कच्चे आकार से अधिक महत्वपूर्ण हैं। यह सबसे बड़े मस्तिष्क के बारे में नहीं है; यह सबसे अच्छे वर्कफ़्लो के बारे में है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →