Agri-Query: A Case Study on RAG vs. Long-Context LLMs for Cross-Lingual Technical Question Answering
यह शोध पत्र एक केस स्टडी प्रस्तुत करता है जो यह प्रदर्शित करता है कि हाइब्रिड रिट्रीवल-ऑगमेंटेड जनरेशन (RAG), अंग्रेजी, फ्रेंच और जर्मन तकनीकी कृषि मैनुअल्स में डायरेक्ट लॉन्ग-कॉन्टेक्स्ट प्रॉम्प्टिंग की तुलना में लगातार बेहतर प्रदर्शन करता है, और जेमिनी 2.5 फ्लैश (Gemini 2.5 Flash) तथा क्वेन 2.5 7B (Qwen 2.5 7B) जैसे मॉडलों के साथ क्रॉस-लिंगुअल प्रश्नोत्तरी में 85% से अधिक सटीकता प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक किसान हैं जो एक उच्च-तकनीकी उर्वरक मशीन (fertilizer machine) के 165 पन्नों के विशाल निर्देश मैनुअल के सामने खड़े हैं। यह मैनुअल अंग्रेजी, फ्रेंच और जर्मन में लिखा गया है। आपका एक विशिष्ट प्रश्न है: "वेन लॉक नट्स (vane lock nuts) के लिए सटीक टॉर्क क्या है?"
अब, कल्पना कीजिए कि आपके पास इस उत्तर को खोजने के दो अलग-अलग तरीके हैं:
- "सुपर-रीडर" (लॉन्ग-कॉन्टेक्स्ट LLM): आप एक प्रतिभाशाली छात्र को पूरा 165 पन्नों का पन्ना सौंप देते हैं जो एक बार में 128,000 शब्द पढ़ सकता है। आप उसे उत्तर खोजने के लिए कहते हैं।
- "लाइब्रेरियन" (RAG): आप एक लाइब्रेरियन से किताब को जल्दी से स्कैन करने, सबसे प्रासंगिक तीन पन्ने खोजने और केवल उन पन्नों को छात्र को सौंपने के लिए कहते है। फिर, छात्र केवल उन पन्नों को पढ़कर आपको उत्तर देता है।
यह शोध पत्र, "Agri-Query," इन दोनों दृष्टिकोणों के बीच एक दौड़ है यह देखने के लिए कि घास के ढेर में सुई खोजने में कौन बेहतर है।
सेटअप: एक वास्तविक दुनिया का परीक्षण
टेक्निकल यूनिवर्सिटी ऑफ म्यूनिख के शोधकर्ताओं ने केवल रैंडम टेक्स्ट का उपयोग नहीं किया। उन्होंने एक कृषि मशीन (Kverneland Exacta-TLX) के एक वास्तविक, जटिल मैनुअल का उपयोग किया। उन्होंने 108 प्रश्नों के साथ एक परीक्षण बनाया:
- 54 "मिलने योग्य" (Findable) प्रश्न: उत्तर निश्चित रूप से किताब में है।
- 54 "न मिल पाने वाले" (Unanswerable) प्रश्न: उत्तर किताब में नहीं है (जैसे, "ट्रैक्टर कितना अतिरिक्त डीजल उपयोग करता है?")। यह एक जाल था यह देखने के लिए कि क्या AI मददगार होने के चक्कर में झूठ बोलता है (हैलुसिनेशन/hallucinate)।
उन्होंने इसका परीक्षण तीन भाषाओं में किया: अंग्रेजी, फ्रेंच और जर्मन। महत्वपूर्ण रूप से, उन्होंने सभी प्रश्न अंग्रेजी में पूछे, भले ही मैनुअल फ्रेंच या जर्मन में था, यह देखने के लिए कि क्या AI भाषा के इस अंतर को पाट सकता है।
प्रतियोगी
उन्होंने 9 अलग-अलग AI मॉडलों (Llama, Qwen और मालिकाना Gemini जैसे प्रसिद्ध मॉडलों सहित) को एक-दूसरे के खिलाफ खड़ा किया। कुछ बहुत बड़े थे, कुछ छोटे। उन्होंने उन्हें दो मोड में टेस्ट किया:
- डायरेक्ट लॉन्ग-कॉन्टेक्स्ट (Direct Long-Context): पूरी किताब को सीधे AI को खिलाना।
- RAG (रिट्रीवल-ऑगमेंटेड जनरेशन): पहले सही पन्ने खोजने के लिए एक सर्च सिस्टम का उपयोग करना।
उन्होंने तीन प्रकार के "लाइब्रेरियन" (रिट्रीवल विधियों) का परीक्षण किया:
- कीवर्ड सर्च (Keyword Search): जैसे सटीक शब्दों को खोजने के लिए "Ctrl+F" का उपयोग करना।
- सिमेंटिक सर्च (Semantic Search): जैसे किसी लाइब्रेरियन से पूछना, "मुझे नट कसने वाला हिस्सा चाहिए," भले ही "नट" शब्द का उपयोग न किया गया हो।
- हाइब्रिड सर्च (Hybrid Search): दोनों का मिश्रण, जो दोनों दुनिया की सर्वश्रेष्ठ चीजों का उपयोग करता है।
परिणाम: लाइब्रेरियन विजेता है!
यहाँ मुख्य निष्कर्ष दिया गया है, जिसे सरल शब्दों में समझाया गया है:
1. "सुपर-रीडर" अभिभूत (overwhelmed) हो जाता है।
जब AI ने एक बार में पूरा 165 पन्नों का मैनुअल पढ़ने की कोशिश की, तो उसे संघर्ष करना पड़ा। उसे उस समस्या का सामना करना पड़ा जिसे शोधकर्ता "लॉस्ट इन द मिडिल" (Lost in the Middle) प्रभाव कहते हैं। कल्पना कीजिए कि आप एक 500 पन्नों का उपन्यास पढ़ रहे हैं और आपसे पेज 250 के बारे में पूछा जाता है। यदि आप एक बार में पूरा पढ़ लेते हैं, तो आप बीच के हिस्सों को भूल सकते हैं। AI "शोर" (अप्रासंगिक टेक्स्ट) से भ्रमित हो गया और अक्सर उत्तर चूक गया या मनगढ़ंत बातें बनाने लगा।
2. "हाइब्रिड लाइब्रेरियन" चैंपियन है।
हाइब्रिड RAG (कीवर्ड + सिमेंटिक सर्च) दृष्टिकोण लगातार जीता। पहले विशिष्ट पन्ने ढूंढकर और फिर उन्हें AI को सौंपकर, मॉडल बहुत बेहतर प्रदर्शन कर रहे थे।
- सटीकता (Accuracy): उन्होंने 85% से अधिक उत्तर सही दिए।
- ईमानदारी (Honesty): वे "न मिले" कहने में बहुत बेहतर थे जब उत्तर किताब में नहीं था, बजाय इसके कि वे एक नकली उत्तर बनाकर पेश करें।
- छोटे मॉडल चमकते हैं: आश्चर्यजनक रूप से, छोटे, सस्ते AI मॉडल (जैसे 7B या 3B पैरामीटर वाले संस्करण) भी बड़े मॉडलों के बराबर प्रदर्शन करते थे जब उनके पास मदद के लिए एक अच्छा लाइब्रेरियन था। इसका मतलब है कि बेहतरीन परिणाम प्राप्त करने के लिए आपको सुपरकंप्यूटर की आवश्यकता नहीं है; आपको बस एक अच्छी खोज प्रणाली की आवश्यकता है।
3. भाषा कोई बाधा नहीं है।
भले ही प्रश्न अंग्रेजी में थे और मैनुअल फ्रेंच या जर्मन में था, हाइब्रिड RAG सिस्टम शानदार तरीके से काम कर गया। "लाइब्रेरियन" ने प्रश्न का अर्थ समझा और सही फ्रेंच या जर्मन पन्ने खोज लिए, फिर AI ने उत्तर को वापस अंग्रेजी में अनुवाद कर दिया।
"हैलुसिनेशन" (Hallucination) का जाल
झूठ बोलने के बारे में एक सबसे महत्वपूर्ण खोज थी।
- जब AI को पूरी किताब पढ़नी पड़ती थी (Long-Context), तो वह अक्सर "अनअंस्वरेबल" (बिना उत्तर वाले) प्रश्नों के उत्तर का अनुमान लगाने की कोशिश करता था, जिससे हैलुसिनेशन (आत्मविश्वास के साथ गलत उत्तर देना) होता था।
- जब AI ने लाइब्रेरियन (RAG) का उपयोग किया, तो वह बहुत अधिक ईमानदार था। यदि लाइब्रेरियन पन्ना नहीं ढूंढ पाता था, तो AI कहानी बनाने के बजाय "नहीं मिला" (Not found) कहने की अधिक संभावना रखता था।
निचोड़ (The Bottom Line)
यदि आप लोगों को तकनीकी मैनुअल (जैसे खेती, चिकित्सा या इंजीनियरिंग के लिए) पढ़ने में मदद करने के लिए एक AI सिस्टम बना रहे हैं:
- AI में पूरी किताब को बस डाल न दें। यह भ्रमित हो जाता है और अपना ध्यान खो देता है।
- "सर्च फर्स्ट" रणनीति (RAG) का उपयोग करें। प्रासंगिक पन्ने खोजें, फिर AI को उन्हें पढ़ने के लिए कहें।
- अपने खोज तरीकों को मिलाएं। कीवर्ड सर्च को "अर्थ" (meaning) वाली खोज के साथ मिलाने से सर्वोत्तम परिणाम मिलते हैं।
- आपको सबसे बड़े AI की आवश्यकता नहीं है। एक छोटा, सस्ता AI बहुत अच्छा काम करता है यदि उसके पास मदद के लिए एक अच्छा सर्च टूल है।
संक्षेप में: AI को लाइब्रेरी याद करने के लिए न कहें; उसे कैटलॉग (card catalog) का उपयोग करना सिखाएं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।