← नवीनतम पेपर
💬 NLP

MDKeyChunker: Single-Call LLM Enrichment with Rolling Keys and Key-Based Restructuring for High-Accuracy RAG

MDKeyChunker मार्कडाउन दस्तावेजों के लिए एक तीन-चरणीय पाइपलाइन है जो संरचना-जागरूक चंकिंग (structure-aware chunking), संदर्भ बनाए रखने के लिए रोलिंग की प्रोपेगेशन (rolling key propagation) के साथ सिंगल-कॉल एलएलएम एनरिचमेंट (single-call LLM enrichment) और सामग्री को पुनर्गठित करने के लिए की-आधारित बिन-पैकिंग (key-based bin-packing) का उपयोग करता है, जिससे सिमेंटिक इकाइयों को संरक्षित करके और कई एलएलएम कॉल्स को समाप्त करके उच्च-सटीक रिट्रीवल प्राप्त किया जाता है।

मूल लेखक: Bhavik Mangla

प्रकाशित 2026-03-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bhavik Mangla

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अव्यवस्थित पुस्तकालय में एक विशिष्ट रेसिपी (व्यंजन विधि) खोजने की कोशिश कर रहे हैं।

वर्तमान प्रणालियों के साथ समस्या ("फिक्स्ड-साइज़" दृष्टिकोण)
अधिकांश वर्तमान AI खोज प्रणालियाँ (RAG) एक ऐसे रोबोट की तरह काम करती हैं जो पुस्तकालय की हर किताब को बिना यह देखे कि वह किस बारे में है, समान 500-शब्दों के टुकड़ों में काट देता है।

  • समस्या: यदि किसी रेसिपी में सामग्री की सूची, निर्देशों का एक पैराग्राफ और एक तस्वीर है, तो रोबोट तस्वीर को निर्देशों से अलग कर सकता है। यह "ओवन प्रीहीट करें" वाले चरण को "बैटर मिलाएं" वाले चरण से अलग कर सकता है।
  • लागत: प्रत्येक टुकड़े के बारे में समझने के लिए, रोबोट को हर एक टुकड़े के लिए एक सुपर-स्मार्ट AI सहायक (एक LLM) को कई बार कॉल करना पड़ता है—एक बार शीर्षक लिखने के लिए, एक बार कीवर्ड खोजने के लिए, एक बार सारांश लिखने के लिए, आदि। यह धीमा और महंगा है।
  • भ्रम: क्योंकि प्रत्येक टुकड़े को अकेले प्रोसेस किया जाता है, रोबोट एक टुकड़े को "कुकीज़ बेक करना" कह सकता है और बाद के एक टुकड़े को "कुकी बनाना" कह सकता है, यह महसूस किए बिना कि ये दोनों एक ही चीज़ हैं।

समाधान: MDKeyChunker
यह पेपर MDKeyChunker को पेश करता है, जो इन किताबों को व्यवस्थित करने का एक स्मार्ट तरीका है। इसे एक बहुत ही व्यवस्थित लाइब्रेरियन (पुस्तकालयाध्यक्ष) द्वारा संचालित तीन-चरणीय प्रक्रिया के रूप में समझें।

चरण 1: "स्मार्ट कैंची" (स्ट्रक्चर-अवेयर चंकिंग)

किताब को यादृच्छिक (रैंडम) 500-शब्दों के टुकड़ों में काटने के बजाय, यह लाइब्रेरियन दस्तावेज़ की संरचना (जैसे हेडर, कोड ब्लॉक्स, टेबल और लिस्ट) को देखता है।

  • उपमा: कल्पना कीजिए कि दस्तावेज़ एक लेगो (Lego) महल है। एक फिक्स्ड-साइज़ कटर महल को ईंटों के रैंडम ढेरों में तोड़ देगा, जिससे टावर और दीवारें टूट जाएंगी। MDKeyChunker एक सावधानीपूर्वक निर्माण करने वाले की तरह है जो केवल महल के प्राकृतिक जोड़ों (seams) के साथ ही कट लगाता है। यदि एक टेबल 10 पंक्तियों लंबी है, तो पूरी टेबल एक साथ रहती है। यदि एक कोड ब्लॉक 50 पंक्तियों का है, तो वह अखंड रहता है।
  • परिणाम: अब रेसिपी या निर्देश टूटे हुए नहीं रहेंगे।

चरण 2: "वन-कॉल सुपर-इंटरव्यू" (सिंगल-कॉल एनरिचमेंट)

अब, लाइब्रेरियन को इन टुकड़ों (chunks) पर लेबल लगाने की आवश्यकता है। आमतौर पर, आप AI सहायक का पांच अलग-अलग लेबल के लिए पांच बार इंटरव्यू लेंगे। MDKeyChunker इसे एक ही इंटरव्यू में करता है।

  • उपमा: AI से अलग-अलग पूछने के बजाय, "क्या शीर्षक है?" फिर "कीवर्ड क्या हैं?" फिर "सारांश क्या है?", लाइब्रेरियन पूछता है: "यहाँ टेक्स्ट का एक टुकड़ा है। कृपया मुझे एक ही बार में शीर्षक, सारांश, कीवर्ड, महत्वपूर्ण नामों की सूची, पूछे गए प्रश्न और एक विशिष्ट 'टॉपिक टैग' दें।"
  • जादुई ट्रिक (रोलिंग कीज़): यही असली राज है। लाइब्रेरियन अब तक उपयोग किए गए "टॉपिक टैग्स" का एक रोलिंग नोटबुक (डिक्शनरी) रखता है।
    • यदि टुकड़ा 1 "प्रवेश प्रक्रिया" (Admissions) के बारे में है, तो लाइब्रेरियन नोटबुक में "प्रवेश प्रक्रिया" लिखता है।
    • जब टुकड़ा 5 आता है और उसी विषय के बारे में बात करता है, तो AI नोटबुक देखता है और कहता है, "ओह, यह अभी भी 'प्रवेश प्रक्रिया' के बारे में है, मैं नया नाम जैसे 'नामांकन प्रक्रिया' बनाने के बजाय इसी टैग का उपयोग करूँगा।"
    • यह AI को भ्रमित होने से बचाता है और पूरे दस्तावेज़ को एक सूत्र में बांधकर रखता है।

चरण 3: "पहेली पुनर्संयोजन" (की-बेस्ड रीस्ट्रक्चरिंग)

लेबलिंग के बाद, लाइब्रेरियन "टॉपिक टैग्स" को देखता है।

  • उपमा: कल्पना कीजिए कि आपके पास कमरे में बिखरे हुए पहेली के टुकड़े (puzzle pieces) हैं। कुछ टुकड़े किताब में दूर-दूर हो सकते हैं, लेकिन उन दोनों पर "सौर मंडल" (Solar System) का टैग लगा है।
  • क्रिया: लाइब्रेरियन "सौर मंडल" टैग वाले सभी टुकड़ों को लेता है और उन्हें एक बड़े, सुसंगत टुकड़े में जोड़ देता है, भले ही वे मूल रूप से 30 पन्नों के दूसरे टेक्स्ट द्वारा अलग किए गए हों।
  • परिणाम: आपको एक "सुपर-चंक" मिलता है जिसमें सौर मंडल के बारे में सारी जानकारी एक ही स्थान पर होती है, जिससे सर्च इंजन के लिए इसे खोजना बहुत आसान हो जाता है।

यह क्यों मायने रखता है?

इस पेपर ने 18 दस्तावेजों और 30 प्रश्नों पर इसका परीक्षण किया।

  • सटीकता (Accuracy): इसने लगभग पूरी तरह से सही उत्तर पाए (कुछ सेटअपों में Recall@5 = 1.000)।
  • दक्षता (Efficiency): इसने एक बार में सब कुछ करके AI कॉल्स की संख्या को आधा (या उससे अधिक) कम कर दिया।
  • अखंडता (Integrity): इसने कभी भी किसी टेबल या कोड ब्लॉक को बीच में से नहीं तोड़ा।

संक्षेप में:
MDKeyChunker एक ऐसी मशीन से अपग्रेड है जो दस्तावेज़ों को अंधाधुंध रैंडम टुकड़ों में काट देती है, और एक ऐसे स्मार्ट लाइब्रेरियन की तरह है जो दस्तावेज़ की प्राकृतिक संरचना का सम्मान करता है, सामग्री का कुशलतापूर्वक एक बार में इंटरव्यू लेता है, और संबंधित विचारों को एक पूर्ण, तैयार उपयोग योग्य बंडल में पुनर्गठित करता है। यह AI सर्च को तेज़, सस्ता और बहुत अधिक सटीक बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →