← नवीनतम पेपर
💬 NLP

CHOP: Chunkwise Context-Preserving Framework for RAG on Multi Documents

यह शोध पत्र CHOP को प्रस्तुत करता है, जो एक CNM-एक्स्ट्रैक्टर और कॉन्टिन्युइटी डिसीजन मॉड्यूल के साथ एक LLM-संचालित पुनरावृत्ति प्रक्रिया का उपयोग करके संदर्भ-जागरूक चंक सिग्नेचर (chunk signatures) उत्पन्न करता है, जिससे बहु-दस्तावेज़ डेटासेट पर रिट्रीवल-ऑगमेंटेड जनरेशन को बढ़ाता है और समान दस्तावेजों के बीच अर्थ संबंधी संघर्षों को हल करते हुए रिट्रीवल सटीकता में महत्वपूर्ण सुधार करता है।

मूल लेखक: Hyunseok Park, Jihyeon Kim, Jongeun Kim, Dongsik Yoon

प्रकाशित 2026-04-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hyunseok Park, Jihyeon Kim, Jongeun Kim, Dongsik Yoon

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप 100 अलग-अलग उत्पाद मैनुअलों (कैमरों, एयर कंडीशनर, नावों आदि के लिए) की एक विशाल लाइब्रेरी में एक विशिष्ट निर्देश खोजने की कोशिश कर रहे हैं, जिन्हें एक ही विशाल, अव्यवस्थित किताब में चिपका दिया गया है।

यदि आप एक लाइब्रेरियन (AI) से "225B एयर कंडीशनर का फिल्टर कैसे बदलें" के निर्देश मांगते हैं, तो एक पारंपरिक सिस्टम भ्रमित हो सकता है। यह 225B कैमरा फिल्टर के बारे में कोई पेज या किसी सामान्य एयर कंडीशनर फिल्टर के बारे में कोई पेज निकाल सकता है, क्योंकि "फिल्टर" और "225B" जैसे शब्द कई जगहों पर दिखाई देते हैं। इससे हैलुसिनेशन (AI द्वारा मनगढ़ंत बातें बनाना) या गलत उत्तर मिलते हैं।

यह पेपर CHOP (Chunkwise Context-Preserving Framework) पेश करता है, जो इस अव्यवस्थित लाइब्रेरी को व्यवस्थित करने का एक नया तरीका है ताकि AI कभी भी रास्ता न भटके।

CHOP कैसे काम करता है, इसे सरल उपमाओं (analogies) का उपयोग करके यहाँ समझाया गया है:

1. समस्या: "श्रेड किए गए दस्तावेज़" का दुस्वप्न

वर्तमान AI सिस्टम अक्सर लंबे दस्तावेजों को छोटे, समान आकार के टुकड़ों (chunks) में काट देते हैं, जैसे किसी पत्र को पट्टियों में फाड़ देना।

  • समस्या: यदि कोई वाक्य कहता है, "यह विधि X-सीरीज के लिए काम करती है," और आप कागज को "X-सीरीज" के ठीक बाद काट देते हैं, तो अगला कागज का टुकड़ा केवल "काम करती है" कहेगा। AI संदर्भ (context) खो देता है। उसे अब यह नहीं पता कि वह किस X-सीरीज के बारे में बात कर रहा है।
  • परिणाम: जब समान दस्तावेज़ मौजूद होते हैं (जैसे, 225B और 226R मॉडल के मैनुअल), तो AI भ्रमित हो जाता है और गलत कागज का टुकड़ा उठा लेता है।

2. समाधान: CHOP का दो-चरणीय जादू

CHOP इसे एक स्मार्ट लाइब्रेरियन की तरह काम करके ठीक करता है जो न केवल टेक्स्ट पढ़ता है, बल्कि फाइल करने से पहले हर पेज पर एक स्टिकर नोट (sticky note) भी लगा देता है।

चरण A: "आईडी बैज" (CNM-Extractor)

टेक्स्ट के एक टुकड़े को देखने से पहले, AI एक स्मार्ट सहायक (एक LLM) से उस विशिष्ट पेज के लिए एक छोटा "आईडी बैज" बनाने के लिए कहता है। इस बैज में तीन चीजें होती हैं:

  1. श्रेणी (Category): यह किसके बारे में है? (जैसे, "एयर कंडीशनर")
  2. संज्ञा (Nouns): मुख्य भाग क्या हैं? (जैसे, "फिल्टर")
  3. मॉडल (Model): कौन सा विशिष्ट संस्करण? (जैसे, "225B")

उपमा: कल्पना कीजिए कि लाइब्रेरी के हर पेज के ऊपर एक चमकीला पीला स्टिकर नोट है जिस पर लिखा है: "यह पेज 225B एयर कंडीशनर फिल्टर के बारे में है।" भले ही पेज पर लिखा टेक्स्ट अस्पष्ट हो, स्टिकर नोट इसे बिल्कुल स्पष्ट बना देता है। यह AI को कैमरा फिल्टर को एयर कंडीशनर फिल्टर के साथ भ्रमित होने से रोकता है।

चरण B: "निरंतरता की जाँच" (Continuity Decision Module)

यह सबसे चतुर हिस्सा है। जब AI पेज 1 से पेज 2 पर जाता है, तो वह पूछता है: "क्या ये दोनों पेज एक ही चीज़ के बारे में बात कर रहे हैं, या हमने अभी-अभी एक पूरी तरह से अलग मैनुअल पर स्विच किया है?"

  • परिदृश्य 1 (समान विषय): यदि पेज 1 225B एयर कंडीशनर के बारे में है और पेज 2 अभी भी 225B एयर कंडीशनर के बारे में है, तो AI कहता है, "हाँ, जारी रखें।" वह पेज 1 के लिए उसी आईडी बैज का पुन: उपयोग पेज 2 के लिए करता है। यह कहानी को सुचारू रूप से बहने में मदद करता है।
  • परिदृश्य 2 (नया विषय): यदि पेज 2 अचानक 226R मॉडल या किसी अलग उत्पाद के बारे में बात करने लगता है, तो AI कहता है, "रुको! नया विषय।" वह पुराने बैज को फेंक देता है और नए अनुभाग के लिए एक नया आईडी बैज बनाता है।

उपमा: इसे एक टीवी शो की तरह सोचें। यदि दृश्य अभी भी रसोई में है, तो कैमरा किचन के सेट पर ही रहता है (वही संदर्भ)। यदि दृश्य समुद्र तट पर बदल जाता है, तो कैमरा एक नए सेट पर कट जाता है (नया संदर्भ)। CHOP यह सुनिश्चित करता है कि AI को पता हो कि वह वर्तमान में किस "सेट" पर है, ताकि वह समुद्र तट पर स्टेक पकाने की कोशिश न करे।

3. यह क्यों महत्वपूर्ण है (परिणाम)

इन "स्टिकर नोट्स" और निरंतरता की जाँच को जोड़कर, CHOP एक बहुत अधिक स्वच्छ, अधिक व्यवस्थित डेटाबेस बनाता है।

  • बेहतर खोज: जब आप कोई प्रश्न पूछते हैं, तो AI बहुत तेज़ी से सटीक सही पेज ढूंढ लेता है क्योंकि "स्टिकर नोट्स" (मेटाडेटा) खोज को सटीक बनाते हैं।
  • कम गलतियाँ: AI के द्वारा 225B मॉडल को 226R मॉडल के साथ मिलाने की संभावना कम हो जाती है।
  • स्मार्ट उत्तर: क्योंकि AI को सही जानकारी मिलती है, इसलिए अंतिम उत्तर जो वह आपको देता है, वह बहुत सटीक होता है और उसके गलत (hallucination) होने की संभावना कम होती है।

निचोड़ (The Bottom Line)

CHOP एक अव्यवस्थित, असंगठित फाइलिंग कैबिनेट को एक स्मार्ट, स्व-वर्गीकृत प्रणाली में अपग्रेड करने जैसा है। केवल आकार के आधार पर कागजों को बक्सों में डालने के बजाय, यह हर एक शीट को लेबल करता है कि वह क्या है और यह भी जाँचता है कि क्या अगली शीट उसी फोल्डर से संबंधित है। यह सुनिश्चित करता है कि जब आप मदद मांगते हैं, तो आपको हर बार सही उत्तर मिले।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →