← नवीनतम पेपर
💬 NLP

Adaptive Chunking: Optimizing Chunking-Method Selection for RAG

यह शोध पत्र "एडेप्टिव चंकिंग" (Adaptive Chunking) प्रस्तुत करता है, जो पांच नवीन आंतरिक मेट्रिक्स के आधार पर प्रत्येक दस्तावेज़ के लिए सर्वोत्तम चंकिंग रणनीति को गतिशील रूप से चुनकर रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) के प्रदर्शन को अनुकूलित करता है, जिससे अंतर्निहित मॉडलों या प्रॉम्प्ट्स को बदले बिना विविध डोमेन में उत्तर की शुद्धता और सफलता दर में महत्वपूर्ण सुधार प्राप्त होता है।

मूल लेखक: Paulo Roberto de Moura Júnior, Jean Lelong, Annabelle Blangero

प्रकाशित 2026-03-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Paulo Roberto de Moura Júnior, Jean Lelong, Annabelle Blangero

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन थोड़े विस्मरशील छात्र (AI) को किताबों के एक विशाल पुस्तकालय के बारे में प्रश्न पूछने का तरीका सिखाने की कोशिश कर रहे हैं। समस्या यह नहीं है कि छात्र मूर्ख है; समस्या यह है कि किताबें एक साथ पढ़ने के लिए बहुत बड़ी हैं। इसलिए, आपको किताबों को छोटे "टुकड़ों" (chunks) में काटकर उसे सौंपना होगा।

"Adaptive Chunking" नामक शोध पत्र तर्क देता है कि वर्षों से, पुस्तकालयाध्यक्षों (librarians) ने एक "एक ही आकार के सभी के लिए" (one-size-fits-all) कैंची का उपयोग किया है। वे हर किताब को 500 शब्दों के टुकड़ों में काट देते हैं, चाहे वह कोई कानूनी अनुबंध हो, तकनीकी मैनुअल हो, या कोई उपन्यास।

कभी-कभी यह काम करता है। लेकिन अक्सर, यह एक आपदा होती है। आप शायद एक वाक्य को बीच से काट देते हैं, जिससे "वह" (he) और उस व्यक्ति के बीच का संबंध टूट जाता है जिसका वह संदर्भ दे रहा है। या आप एक तालिका (table) को बीच से काट सकते हैं, जिससे उसका ऊपरी हिस्सा एक ढेर में और निचला हिस्सा दूसरे ढेर में रह जाता है। छात्र भ्रमित हो जाता है, उत्तर गलत होते हैं, और पूरा सिस्टम विफल हो जाता है।

यहाँ इस शोध पत्र का समाधान सरल रूप में दिया गया है:

1. समस्या: "अंधा कैंची" (Blind Scissors) दृष्टिकोण

वर्तमान AI सिस्टम आमतौर पर कठोर नियमों (जैसे "हर 500 शब्दों में काटें") का उपयोग करके दस्तावेजों को काटते हैं।

  • उपमा: कल्पना कीजिए कि आप एक पिज्जा काटने की कोशिश कर रहे हैं। यदि आप बिना देखे कि पेपरोनी कहाँ है, उसे केवल सटीक वर्गों में काटते हैं, तो आपके पास एक ऐसा टुकड़ा हो सकता है जिसमें कोई चीज़ (cheese) नहीं है और दूसरा ऐसा जिसमें तीन पेपरोनी हैं।
  • परिणाम: AI अपना "संदर्भ" (context) खो देता है। वह पाठ का एक टुकड़ा तो देखता है लेकिन उसे पता नहीं होता कि वह किस बारे में है क्योंकि आसपास के संकेत कट गए थे।

2. समाधान: "स्मार्ट दर्जी" (Adaptive Chunking)

लेखक "Adaptive Chunking" नामक एक नई प्रणाली प्रस्तावित करते हैं। पूरे पुस्तकालय के लिए एक ही कैंची का उपयोग करने के बजाय, यह प्रणाली एक स्मार्ट दर्जी की तरह कार्य करती है।

काटने से पहले, दर्जी कपड़े (दस्तावेज) को देखता है और पूछता है:

  • "क्या यह सख्त अनुच्छेदों वाला एक कानूनी अनुबंध है?" (अनुच्छेद के अंत पर काटें)।
  • "क्या यह एक तकनीकी मैनुअल है जिसमें बड़ी तालिकाएँ हैं?" (तालिकाओं को पूरा रखें)।
  • "क्या यह एक कहानी है जिसमें लंबे पैराग्राफ हैं?" (पैराग्राफ के अंत पर काटें)।

यह प्रणाली स्वचालित रूप से प्रत्येक विशिष्ट दस्तावेज़ के लिए सबसे अच्छी काटने की रणनीति चुनती है।

3. पाँच "गुणवत्ता जाँच" (Metrics)

दर्जी को कैसे पता चलता है कि एक कट अच्छा है? वे टुकड़ों की गुणवत्ता मापने के लिए पाँच विशिष्ट "रूलर" (मापदंडों) का उपयोग करते हैं। इन्हें एक आदर्श पहेली के टुकड़े के लिए चेकलिस्ट के रूप में समझें:

  1. संदर्भ पूर्णता (References Completeness - RC): क्या हमने सर्वनामों को काट दिया?
    • उपमा: यदि पाठ कहता है "राजा", और अगला टुकड़ा "वह" से शुरू होता है, तो यह बुरा है। "वह" को "राजा" के साथ रहना चाहिए। यह मीट्रिक जाँचता है कि क्या हमने किसी व्यक्ति को उनके नाम से अलग कर दिया है।
  2. इंट्राचंक एकजुटता (Intrachunk Cohesion - ICC): क्या टुकड़ा एक ही चीज़ के बारे में है?
    • उपमा: एक टुकड़ा सलाद जैसा नहीं होना चाहिए जहाँ आपने सेब, पत्थर और टायर मिला दिए हों। इसे केवल सेब का एक कटोरा होना चाहिए। यह जाँचता है कि क्या टुकड़ा एक ही विषय पर बना रहता है।
  3. दस्तावेज़ प्रासंगिक सुसंगतता (Document Contextual Coherence - DCC): क्या यह अपने पड़ोसियों के साथ फिट बैठता है?
    • उपमा: भले ही एक टुकड़ा सेब के बारे में हो, क्या यह तब भी समझ में आता है जब आप ठीक पहले वाले टुकड़े को पढ़ते हैं? यह सुनिश्चित करता है कि कहानी का प्रवाह न टूटे।
  4. ब्लॉक अखंडता (Block Integrity - BI): क्या हमने फर्नीचर तोड़ दिया?
    • उपमा: यदि आपके पास एक चित्र या तालिका है, तो आप उसे आधा नहीं काट सकते। यह मीट्रिक सुनिश्चित करता है कि तालिकाएँ, चित्र और हेडर पूरे रहें।
  5. आकार अनुपालन (Size Compliance - SC): क्या टुकड़ा सही आकार का है?
    • उपमा: यदि टुकड़ा बहुत छोटा है, तो यह बेकार शोर है। यदि यह बहुत बड़ा है, तो छात्र अभिभूत हो जाएगा। यह सुनिश्चित करता है कि प्रत्येक टुकड़ा छात्र के "बस्ते" (backpack) में फिट हो जाए।

4. नए उपकरण

इसे काम करने के योग्य बनाने के लिए, लेखकों ने दो नए "काटने के उपकरण" बनाए हैं:

  • LLM-Regex Splitter: वे एक AI से पूछते हैं कि दस्तावेज़ के पहले कुछ पृष्ठों को देखकर यह बताए: "हे, इस विशिष्ट पुस्तक को काटने का सबसे अच्छा तरीका क्या है?" इसके बाद AI एक कस्टम निर्देश (regex pattern) लिखता है ताकि बाकी की किताब को पूरी तरह से काटा जा सके।
  • Split-Then-Merge Splitter: यह उपकरण पहले पाठ को छोटे टुकड़ों में काटता है, फिर उन्हें वापस जोड़ता है यदि वे बहुत छोटे हैं, यह सुनिश्चित करते हुए कि कुछ भी खोया नहीं है या बहुत छोटा नहीं है।

5. परिणाम: यह क्यों मायने रखता है

जब उन्होंने वास्तविक दुनिया के दस्तावेजों (कानूनी, तकनीकी और सामाजिक विज्ञान) पर इसका परीक्षण किया, तो परिणाम प्रभावशाली थे:

  • अधिक सही उत्तर: AI पुराने तरीकों की तुलना में 72% बार सही उत्तर देता है, जबकि पुराने तरीकों में यह 62-64% था।
  • अधिक प्रश्नों के उत्तर: सिस्टम ने "मुझे नहीं पता" कहना बंद कर दिया और वास्तव में 30% अधिक प्रश्नों के उत्तर दिए।
  • कोई जादू नहीं चाहिए: उन्होंने AI मॉडल या प्रॉम्प्ट्स को नहीं बदला। उन्होंने बस यह ठीक किया कि जानकारी उसे कैसे दी जा रही है।

निष्कर्ष

यह शोध पत्र हमें सिखाता है कि आप AI को जानकारी कैसे देते हैं, यह उतना ही महत्वपूर्ण है जितना कि स्वयं AI।

"एक ही आकार के सभी के लिए" दृष्टिकोण को रोककर और एक स्मार्ट, एडेप्टिव सिस्टम का उपयोग करके जो प्रत्येक दस्तावेज़ की अनूठी संरचना का सम्मान करता है, हम ऐसे AI सिस्टम बना सकते हैं जो बहुत अधिक स्मार्ट, अधिक विश्वसनीय और वास्तव में जो पढ़ रहे हैं उसे समझने में सक्षम हों। यह किसी को फटी हुई समाचार पट्टी देने और किसी को करीने से व्यवस्थित, आसानी से पढ़ी जाने वाली पत्रिका देने के बीच का अंतर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →