← नवीनतम पेपर
💬 NLP

Efficient Retrieval-Augmented Generation via Token Co-occurrence Graphs

यह शोध पत्र TIGRAG का प्रस्ताव करता है, जो एक कुशल रिट्रीवल-ऑगमेंटेड जनरेशन (Retrieval-Augmented Generation) फ्रेमवर्क है जो टोकन सह-उपस्थिति ग्राफ (token co-occurrence graphs) और एक पुनरावृत्ति एंटिटी-संचालित रिट्रीवल रणनीति का लाभ उठाता है ताकि मानक RAG सिस्टम की मल्टी-हॉप रीजनिंग सीमाओं को दूर किया जा सके और साथ ही कंप्यूटेशनल लागतों को काफी कम करते हुए QA बेंचमार्क पर प्रदर्शन में सुधार किया जा सके।

मूल लेखक: Gianluca Bonifazi, Christopher Buratti, Michele Marchetti, Federica Parlapiano, Giulia Quaglieri, Davide Traini, Domenico Ursino, Luca Virgili

प्रकाशित 2026-06-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Gianluca Bonifazi, Christopher Buratti, Michele Marchetti, Federica Parlapiano, Giulia Quaglieri, Davide Traini, Domenico Ursino, Luca Virgili

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट सहायक (एक लार्ज लैंग्वेज मॉडल) है जो बहुत कुछ जानता है लेकिन कभी-कभी गलतियाँ कर देता है क्योंकि उसके पास सभी तथ्य सामने नहीं होते। इसे ठीक करने के लिए, हम उसे सवाल का जवाब देने से पहले किताबों की एक विशाल लाइब्रेरी चेक करने के लिए देते हैं। इसे RAG (रिट्रीवल-ऑगमेंटेड जनरेशन) कहा जाता है।

हालाँकि, एक समस्या है। यदि आप एक पेचीदा सवाल पूछते हैं जिसमें तीन अलग-अलग किताबों के बीच कड़ियों को जोड़ने की आवश्यकता होती है (जैसे, "उस फिल्म का निर्देशन किसने किया जिसमें उस अभिनेता ने भी काम किया था जो द लास्ट हॉर्स में था?"), तो सहायक का सामान्य तरीका विफल हो जाता है। वे आमतौर पर केवल वही एक किताब उठाते हैं जो सवाल से सबसे अधिक मिलती-जुलती लगती है, जिससे वे पहेली को सुलझाने के लिए आवश्यक अन्य दो महत्वपूर्ण किताबों को छोड़ देते हैं।

हाल के समाधानों ने एक विशाल, जटिल मानचित्र (नॉलेज ग्राफ) बनाने की कोशिश की जो हर तथ्य को दूसरे तथ्य से जोड़ता है। लेकिन इस मानचित्र को बनाना एक शहर की हर गली को हाथ से बनाने के लिए महंगे आर्किटेक्ट्स की एक टीम को काम पर रखने जैसा है—इसमें बहुत समय लगता है और कभी-कभी वे गलतियाँ भी करते हैं।

TIGRAG से मिलिए।

लेखकों ने इस मानचित्र को बनाने और सही उत्तर खोजने का एक नया, बहुत तेज़ तरीका प्रस्तावित किया है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. "शब्द पड़ोस" का मानचित्र (शहर के प्लान के बजाय)

पारंपरिक तरीके मानचित्र बनाने के लिए हर वाक्य के अर्थ को समझने की कोशिश करते हैं। TIGRAG एक शॉर्टकट लेता है। यह शब्द सह-उपस्थिति (word co-occurrence) को देखता है।

एक बड़ी पार्टी की कल्पना करें जहाँ लोग बातें कर रहे हैं। सभी के गहरे संबंधों को समझने के लिए उनका इंटरव्यू लेने के बजाय, TIGRAG बस यह देखता है कि कौन किसके पास खड़ा है। यदि "एप्पल" और "पाई" शब्द अक्सर एक ही पैराग्राफ (पार्टी के एक ही "कमरे") में पाए जाते हैं, तो TIGRAG उनके बीच एक रेखा खींच देता है। वह यह काम लाइब्रेरी के हर शब्द के लिए करता है।

  • परिणाम: संबंधों का एक विशाल, हल्का वेब जो इस आधार पर बना है कि कौन किसके साथ रहता है, जिसे बिना किसी महंगे मानवीय विश्लेषण के स्वचालित रूप से बनाया गया है।

2. "लहर प्रभाव" (Ripple Effect) खोज

जब आप कोई सवाल पूछते हैं, तो TIGRAG केवल सटीक शब्दों की तलाश नहीं करता है। यह तालाब में एक पत्थर डालता है (क्वेरी) और लहरों को फैलते हुए देखता है।

  • यह आपके सवाल के शब्दों से शुरू होता है।
  • यह अपने "शब्द पड़ोस" मानचित्र पर रेखाओं का पीछा करता है ताकि उन शब्दों को खोजा जा सके जो उनसे निकटता से संबंधित हैं, भले ही आपने उनका उल्लेख न किया हो।
  • उदाहरण: यदि आप "द लास्ट हॉर्स" के बारे में पूछते हैं, तो मानचित्र "एडगर नेविल" (निर्देशक) और "स्पेनिश कॉमेडी" (शैली) तक लहरें फैला सकता है, भले ही आपने ये शब्द टाइप न किए हों। यह इसे बहु-चरणीय पहेली के लिए आवश्यक अन्य किताबों को खोजने में मदद करता है।

3. "स्मार्ट फिल्टर" (द बाउंसर)

एक बार जब खोज कई संभावित पुस्तक अध्यायों (टेक्स्ट के टुकड़ों) को ढूंढ लेती है, तो TIGRAG उन्हें बस सहायक के सामने नहीं फेंक देता। वह ऐसा करना पूरी लाइब्रेरी को कमरे में फेंकने जैसा होगा।

  • चरण 1: यह केवल सबसे प्रासंगिक अध्यायों को रखने के लिए एक त्वरित गणितीय जांच (एक बाउंसर द्वारा लिस्ट चेक करने की तरह) का उपयोग करता है।
  • चरण 2: यह यह दोहरा जांच करने के लिए कि क्या ये अध्याय वास्तव में विशिष्ट प्रश्न का उत्तर देते हैं, न कि केवल संबंधित विषयों का, एक "न्यूरल रीरैंकर" (एक सुपर-स्मार्ट फिल्टर) का उपयोग करता है।
  • परिणाम: सहायक को पृष्ठों का एक छोटा, सटीक ढेर मिलता है जिसमें ठीक वही होता है जिसकी उसे आवश्यकता है, उससे अधिक कुछ नहीं।

4. "जासूस की नोटबुक" (मल्टी-हॉप रीजनिंग)

बहुत कठिन सवालों के लिए, TIGRAG चरणों में रहस्य सुलझाने वाले एक जासूस की तरह काम करता है।

  1. पहला सुराग: यह पहला प्रासंगिक अध्याय खोजता है।
  2. नया सुराग: यह उस अध्याय को पढ़ता है, एक प्रमुख नाम (जैसे कोई व्यक्ति या स्थान) खोजता है, और उस नाम को खोज में जोड़ देता है।
  3. दूसरा सुराग: यह अगले अध्याय को खोजने के लिए उस नए नाम का उपयोग करके फिर से खोज करता है।
  4. समाधान: यह पूर्ण प्रश्न का उत्तर देने के लिए दोनों अध्यायों के सुरागों को जोड़ता है।

यह एक बड़ी बात क्यों है?

पेपर का दावा है कि TIGRAG तीन कारणों से गेम-चेंजर है:

  • गति: इसका मानचित्र बनाना अविश्वसनीय रूप से तेज़ है क्योंकि इसे रेखाएं खींचने के लिए महंगे AI की आवश्यकता नहीं है; यह केवल यह गिनता है कि शब्द कितनी बार एक साथ आते हैं। यह जमीन का सर्वेक्षण करने के बजाय पदचिह्नों को गिनकर मानचित्र बनाने जैसा है।
  • सटीकता: यह पिछले तरीकों की तुलना में जटिल, बहु-चरणीय पहेलियों को बेहतर ढंग से हल करता है क्योंकि यह केवल सटीक मिलान खोजने के बजाय संबंधित शब्दों की "लहरों" का पीछा करता है।
  • दक्षता: यह सहायक को जानकारी का एक बहुत छोटा, साफ सेट प्रदान करता है। इससे समय और कंप्यूटिंग पावर बचती है, जिससे सहायक को बहुत अधिक टेक्स्ट के कारण भ्रमित होने से रोका जा सकता है।

संक्षेप में, TIGRAG एक तेज़, कुशल और स्मार्ट लाइब्रेरियन है जो जानता है कि लाइब्रेरी के हर पन्ने को पहले पढ़े बिना विभिन्न किताबों के बीच कड़ियों को कैसे जोड़ा जाए। यह जटिल प्रश्नों के लिए तेजी से और सटीकता से सही सबूत ढूंढ लेता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →