← नवीनतम पेपर
💻 computer science

MCompassRAG: Topic Metadata as a Semantic Compass for Paragraph-Level Retrieval

MCompassRAG एक मेटाडेटा-निर्देशित रिट्रीवल फ्रेमवर्क है जो LLM-टीचर डिस्टिलेशन के माध्यम से चंक एम्बेडिंग्स में टॉपिक-लेवल सिग्नल्स को एकीकृत करके रिट्रीवल-ऑगमेंटेड जनरेशन को बेहतर बनाता है, जिससे जटिल रिट्रीवल बेंचमार्क पर मौजूदा बेसलाइन्स की तुलना में काफी अधिक सूचना दक्षता और कम लेटेंसी प्राप्त होती है।

मूल लेखक: Amirhossein Abaskohi, Raymond Li, Gaetano Cimino, Peter West, Giuseppe Carenini, Issam H. Laradji

प्रकाशित 2026-06-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Amirhossein Abaskohi, Raymond Li, Gaetano Cimino, Peter West, Giuseppe Carenini, Issam H. Laradji

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक जटिल मामले को सुलझाने की कोशिश कर रहे हैं। आपके पास हजारों दस्तावेजों (कॉर्पस) का एक विशाल पुस्तकालय है और आपको एक विशिष्ट प्रश्न का उत्तर देना है। इस उत्तर को खोजने के लिए, आपको इन दस्तावेजों में तेज़ी से और सटीकता से खोज करनी होगी।

यह RAG (रिट्रीवल-ऑगमेंटेड जनरेशन) की चुनौती है: AI को सवालों के जवाब देने के लिए सही जानकारी खोजने में मदद करना।

यह शोध पत्र एक नया सिस्टम पेश करता है जिसे MCOMPASSRAG कहा जाता है। यह कैसे काम करता है, इसे सरल उपमाओं के माध्यम से समझाया गया है:

समस्या: "चंक" (Chunk) की दुविधा

एक पुस्तकालय में खोजने के लिए, आप एक बार में पूरी किताबें नहीं पढ़ सकते। आपको किताबों को छोटे टुकड़ों या "चंक्स" (chunks) में तोड़ना होगा।

  • छोटे चंक्स (Fine-grained): कल्पना कीजिए कि आप किताबों को व्यक्तिगत वाक्यों में काट रहे हैं।
    • लाभ: यह बहुत सटीक है। यदि आप "बिल्लियों" के बारे में पूछते हैं, तो आपको बिल्लियों के बारे में विशेष रूप से एक वाक्य मिलेगा।
    • हानि: आपको लाखों वाक्यों को खोजना होगा। यह एक शहर के आकार के भूसे के ढेर में सुई खोजने जैसा है। यह धीमा और महंगा है।
  • बड़े चंक्स (Coarse-grained): कल्पना कीजिए कि आप पूरे अध्यायों को एक साथ रखते हैं।
    • लाभ: यह बहुत तेज़ है। आपको खोजने के लिए कम अध्याय हैं।
    • हानि: एक ही अध्याय में बिल्लियों, कुत्तों और पक्षियों के बारे में सब कुछ मिला-जुला हो सकता है। यदि आप "बिल्लियों" के लिए खोजते हैं, तो कंप्यूटर भ्रमित हो सकता है क्योंकि अध्याय अन्य विषयों के साथ "शोर" (noisy) से भरा है।

ट्रेड-ऑफ (Trade-off): आपको आमतौर पर या तो तेज़ होने (बड़े चंक्स) या सटीक होने (छोटे चंक्स) के बीच किसी एक को चुनना पड़ता है।

समाधान: "सिमेंटिक कंपास" (Semantic Compass)

लेखकों ने महसूस किया कि उन्हें किताबों को छोटे टुकड़ों में काटने की ज़रूरत नहीं थी। इसके बजाय, उन्हें बड़े अध्यायों को नेविगेट करने का एक बेहतर तरीका चाहिए था।

उन्होंने MCOMPASSRAG पेश किया, जो एक सिमेंटिक कंपास की तरह कार्य करता है।

  1. अध्यायों को टैग करना (विषय मेटाडेटा):
    खोज शुरू करने से पहले ही, सिस्टम हर बड़े अध्याय को पढ़ता है और उसके मुख्य विषयों के आधार पर उसे "टैग" या "निर्देशांक" (coordinates) का एक सेट देता है। इसे ऐसे समझें जैसे हर अध्याय पर एक GPS निर्देशांक लगाना जो कहता है, "यह अध्याय 80% फाइनेंस के बारे में है, 20% लीगल के बारे में।"

  2. खोज प्रक्रिया:
    जब आप कोई प्रश्न पूछते हैं (जैसे, "सुपीरियर प्रपोजल की परिभाषा क्या है?"), तो सिस्टम केवल अध्याय के शब्दों को नहीं देखता है। यह कंपास को देखता है।

    • यह जाँचता है: "क्या इस अध्याय का GPS निर्देशांक मेरे प्रश्न की दिशा से मेल खाता है?"
    • भले ही अध्याय बहुत बड़ा और अव्यवस्थित हो, कंपास सिस्टम को बताता है कि अध्याय का कौन सा हिस्सा प्रासंगिक है।
  3. "टीचर-स्टूडेंट" ट्रिक (डिस्टिलेशन):
    इसे तेज़ बनाने के लिए, उन्होंने एक चतुर प्रशिक्षण पद्धति का उपयोग किया:

    • टीचर (शिक्षक): एक विशाल, सुपर-स्मार्ट AI (LLM) प्रश्नों और अध्यायों को पढ़ता है। वह जानता है कि कौन सा बड़ा अध्याय सही उत्तर है, भले ही वह शोर से भरा हो। वह एक सख्त प्रोफेसर की तरह काम करता है जो काम को ग्रेड देता है।
    • स्टूडेंट (छात्र): एक छोटा, तेज़ AI मॉडल। इसके पास प्रोफेसर जैसा दिमाग नहीं है, लेकिन यह देखकर सीखता है कि प्रोफेसर क्या कर रहा है। यह "कंपास टैग्स" को देखना और सही उत्तर का अनुमान लगाना सीखता है।
    • परिणाम: एक बार जब छात्र प्रशिक्षित हो जाता है, तो आपको अब उस विशाल, धीमे प्रोफेसर की आवश्यकता नहीं होती। छोटा छात्र "कंपास टैग्स" का उपयोग करके शोर को अनदेखा करते हुए तुरंत काम कर सकता है।

यह क्यों एक बड़ी बात है

शोध पत्र का दावा है कि यह सिस्टम गति-बनाम-सटीकता की समस्या को हल करता है:

  • गति: क्योंकि यह बड़े चंक्स (कम वस्तुओं को खोजने के लिए) का उपयोग करता है, यह अन्य तेज़ सिस्टमों की तुलना में 5 गुना तेज़ है।
  • सटीकता: क्योंकि यह शोर को फ़िल्टर करने के लिए "कंपास" का उपयोग करता है, यह अन्य तेज़ सिस्टमों की तुलना में अधिक सटीक है। वास्तव में, यह उन सिस्टमों के लगभग समान प्रदर्शन करता है जो खोज के दौरान विशाल, धीमे AI का उपयोग करते हैं, लेकिन बिना प्रतीक्षा समय के।

निचोड़ (The Bottom Line)

MCOMPASSRAG को पुस्तकालय के चुंबकीय मानचित्र (magnetic map) के रूप में देखें।

  • पुराने सिस्टम हर वाक्य को पढ़कर सही किताब खोजने की कोशिश करते थे (धीमा) या किताब के कवर के आधार पर अनुमान लगाते थे (अक्सर गलत)।
  • MCOMPASSRAG चुंबकीय मानचित्र (विषय टैग) को देखता है, जानता है कि ठीक किस शेल्फ पर जाना है, और अंदर के अप्रासंगिक पन्नों को अनदेखा करते हुए तुरंत सही बड़ी किताब चुन लेता है।

यह AI को विवरणों में खोए बिना विशाल पुस्तकालयों को तेज़ी से खोजने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →