Qwen Goes Brrr: Off-the-Shelf RAG for Ukrainian Multi-Domain Document Understanding
यह शोध पत्र यूक्रेनी मल्टी-डोमेन डॉक्यूमेंट अंडरस्टैंडिंग कार्य के लिए एक उच्च-प्रदर्शन वाली रिट्रीवल-ऑगमेंटेड पाइपलाइन प्रस्तुत करता है जो जटिल ह्यूरिस्टिक्स के बजाय डॉक्यूमेंट स्ट्रक्चर प्रिजर्वेशन और आंसर-स्पेस अवेयरनेस को प्राथमिकता देकर, कॉन्टेक्स्टुअल चंकिंग, क्वेश्चन-अवेयर डेंस रिट्रीवल और आंसर ऑप्शंस पर आधारित रीरैंकिंग का लाभ उठाकर लीडरबोर्ड के शीर्ष स्कोर प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रहस्य सुलझाने की कोशिश कर रहे एक जासूस हैं, लेकिन आपके पास केवल एक सुराग नहीं, बल्कि हजारों किताबों से भरी एक लाइब्रेरी है, और आपको एक विशिष्ट प्रश्न का उत्तर देने वाला सटीक वाक्य खोजना है। मूल रूप से यह पेपर इसी के बारे में है: एक स्मार्ट सिस्टम बनाना जो यूकrainian दस्तावेजों को पढ़ सके और बहुविकल्पीय प्रश्नों (multiple-choice questions) के उत्तर दे सके।
यहाँ इस कहानी का विवरण दिया गया है कि कैसे टीम ने अपने "जासूस" को बनाया, जिसे सरल अवधारणाओं में विभाजित किया गया है।
चुनौती: घास के ढेर में सुई
टीम ने UNLP नामक एक प्रतियोगिता में भाग लिया। नियम कठिन थे:
- कार्य: आपको छह संभावित उत्तरों (A–F) के साथ एक प्रश्न दिया जाता है। आपको सही उत्तर चुनना है, सिस्टम को बताना है कि वह किस PDF दस्तावेज़ से आया है, और यहाँ तक कि कौन से पेज से।
- समस्या: दस्तावेज़ लंबे, अव्यवस्थित PDF (जैसे कानूनी या तकनीकी मैनुअल) हैं जिनमें अलग-अलग लेआउट हैं। प्रश्न यूकrainian भाषा में हैं, जो एक ऐसी भाषा है जिसके लिए अंग्रेजी की तुलना में कम AI टूल्स उपलब्ध हैं।
- पकड़: सिस्टम को एक विशिष्ट कंप्यूटर (Kaggle) पर चलना था जिसमें समय की सख्त सीमा थी और इंटरनेट की सुविधा नहीं थी। यह घंटों तक केवल "सोच" नहीं सकता था; इसे तेज़ और कुशल होना था।
समाधान: एक तीन-चरणीय जासूसी टीम
एक विशाल, अत्यंत जटिल मस्तिष्क बनाने के बजाय, टीम ने तीन विशिष्ट कार्यकर्ताओं वाली एक पाइपलाइन बनाई। वे इसे "रिट्रीवल-अगमेंटेड" (Retrieval-Augmented) सिस्टम कहते हैं, जो बस एक फैंसी तरीका है यह कहने का: "जानकारी खोजो, फिर उत्तर तय करो।"
चरण 1: लाइब्रेरियन (कॉन्टेक्स्टुअल चंकिंग)
कल्पना कीजिए कि आप एक ऐसी किताब पढ़ने की कोशिश कर रहे हैं जिसके पन्ने फटे हुए हैं और बेतरतीब ढंग से बिखरे हुए हैं। यदि आप केवल एक PDF को कंप्यूटर में डाल देते हैं, तो ऐसा ही होता है।
- उन्होंने क्या किया: उन्होंने टेक्स्ट को केवल रैंडम टुकड़ों में नहीं काटा। उन्होंने एक सावधान लाइब्रेरियन की तरह काम किया जो पुस्तक की संरचना का सम्मान करता है। उन्होंने हर टेक्स्ट के टुकड़े के साथ अध्याय के शीर्षक (chapter titles), अनुभाग हेडर (section headers), और दस्तावेज़ की शुरुआत को जोड़कर रखा।
- उपमा: जासूस को केवल एक ढीला वाक्य देने के बजाय जो कहता है "मीटिंग 5 बजे थी," उन्होंने उन्हें एक नोट थमाया जो कहता था, "अध्याय 4: शेड्यूलिंग, अनुभाग 2: मीटिंग 5 बजे थी।" यह अतिरिक्त संदर्भ कंप्यूटर को यह समझने में मदद करता है कि जानकारी कहाँ स्थित है।
चरण 2: सर्च इंजन (डेंस रिट्रीवल)
अब सिस्टम के पास लाखों ऐसे "कॉन्टेक्स्टुअल नोट्स" हैं। इसे सबसे संभावित 20 उम्मीदवारों को खोजने की आवश्यकता है।
- उन्होंने क्या किया: उन्होंने एक प्री-ट्रेंड AI मॉडल (जिसे Qwen3-Embedding-8B कहा जाता है) का उपयोग एक सर्च इंजन के रूप में किया। यह मॉडल प्रश्न और टेक्स्ट नोट्स को गणितीय "फिंगरप्रिंट्स" में बदल देता है। यह देखने के लिए फिंगरप्रिंट्स की तुलना करता है कि कौन से नोट्स प्रश्न से सबसे अच्छी तरह मेल खाते हैं।
- खोज: उन्होंने पाया कि बिना किसी नए कौशल के सीधे तौर पर एक बड़े, प्री-ट्रेन्ड मॉडल का उपयोग करना, एक छोटे मॉडल को नए तरीके सिखाने की तुलना में बेहतर काम करता है। यह एक नए इंटर्न को प्रशिक्षित करने के बजाय एक अनुभवी लाइब्रेरियन को काम पर रखने जैसा था।
चरण 3: जज (ऑप्शन-अवेयर रीरैंकिंग)
सर्च इंजन ने उन्हें 20 अच्छे नोट्स दिए, लेकिन उन्हें सबसे अच्छा चाहिए।
- ट्विस्ट: अधिकांश सिस्टम केवल प्रश्न को देखते हैं। इस टीम ने महसूस किया कि बहुविकल्पीय प्रश्नों के लिए, गलत उत्तर भी उतने ही महत्वपूर्ण हैं जितने कि सही उत्तर।
- उन्होंने क्या किया: उन्होंने एक "जज" (Qwen3-Reranker) बनाया जो प्रश्न और सभी छह उत्तर विकल्पों को एक साथ देखता है। यह पूछता है: "क्या यह टेक्स्ट उत्तर A का समर्थन करता है, या यह वास्तव में उत्तर B का समर्थन करता है?"
- उपमा: कल्पना कीजिए कि एक वकील एक मामले की दलील दे रहा है। यदि आप उन्हें केवल अभियोजन पक्ष के साक्ष्य दिखाते हैं, तो वे बारीकियों को मिस कर सकते हैं। लेकिन यदि आप उन्हें अभियोजन पक्ष के साक्ष्य और बचाव पक्ष के तर्क दोनों दिखाते हैं, तो वे सटीक रूप से पहचान सकते हैं कि कौन सा साक्ष्य जीतता है। यह चरण गेम-चेंजर साबित हुआ, जिसने उनकी सटीकता को काफी बढ़ा दिया।
चरण 4: अंतिम निर्णय (उत्तर चयन)
अंत में, सिस्टम शीर्ष 2 सर्वश्रेष्ठ नोट्स लेता है और एक शक्तिशाली AI (Qwen3-32B) से अंतिम उत्तर चुनने के लिए कहता है।
- ट्रिक: इसे तेज़ रखने और AI को "भ्रमित" (hallucinating) होने से रोकने के लिए, उन्होंने इसे केवल एक अक्षर (A, B, C, D, E, या F) चुनने के लिए मजबूर किया। यह एक बहुविकल्पीय बबल शीट की तरह है जहाँ AI केवल एक घेरे को भर सकता है।
उन्होंने क्या सीखा (द "सीक्रेट सॉस")
पेपर उन कुछ प्रमुख पाठों पर प्रकाश डालता है जिन्होंने उन्हें आश्चर्यचकित किया:
- संरचना ही सर्वोपरि है: टेक्स्ट चंक्स के साथ दस्तावेज़ की संरचना (हेडिंग, सेक्शन) को बनाए रखना बाद में जटिल, फैंसी गणितीय ट्रिक्स जोड़ने से अधिक महत्वपूर्ण था।
- कम ही अधिक है: उन्होंने एक "स्मार्ट एजेंट" बनाने की कोशिश की जो खोज सके, सोच सके और फिर से खोज सके (एक मानव जासूस की तरह)। यह बहुत धीमा था और गलतियाँ करता था। एक सरल, सीधी रेखा वाली पाइपलाइन (खोज → रैंक → उत्तर) तेज़ और अधिक सटीक थी।
- "अनसीन" डोमेन: प्रतियोगिता में दस्तावेजों की एक छिपी हुई तीसरी श्रेणी थी जिसे AI ने पहले कभी नहीं देखा था। जो सिस्टम यह अनुमान लगाने की कोशिश करते थे कि प्रश्न किस श्रेणी का है, वे विफल रहे। सबसे अच्छी रणनीति यह थी कि सर्च इंजन को बिना पहले से वर्गीकृत किए सब कुछ देखने दिया जाए।
परिणाम
इस तीन-चरणीय टीम (लाइब्रेरियन + सर्च इंजन + जज) का उपयोग करके, उन्होंने बहुत उच्च स्कोर प्राप्त किया।
- सुधार: "जज" चरण (रीरैंकिंग) जोड़ने से सही दस्तावेज़ खोजने की उनकी क्षमता 69% से बढ़कर 79% हो गई।
- अंतिम स्कोर: उनका सिस्टम हिडन टेस्ट सेट पर 96% बार सही उत्तर देता है, जो कई अन्य प्रतियोगियों को पीछे छोड़ देता है।
सारांश में
यह पेपर सिद्ध करता है कि कठिन दस्तावेज़ समस्याओं को हल करने के लिए आपको एक अत्यंत जटिल, कस्टम-निर्मित रोबोट की आवश्यकता नहीं है। इसके बजाय, आपको एक सुव्यवस्थित पाइपलाइन की आवश्यकता है जो दस्तावेजों की संरचना का सम्मान करती है और निर्णय लेने से पहले पूरी तस्वीर (प्रश्न + सभी उत्तर) को देखने के लिए स्मार्ट, प्री-ट्रेंड AI टूल्स का उपयोग करती है। उन्होंने अनिवार्य रूप से दिखाया कि यूकrainian दस्तावेज़ समझ के लिए, संगठन और संदर्भ (context) जटिलता पर भारी पड़ता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।