From BM25 to Corrective RAG: Benchmarking Retrieval Strategies for Text-and-Table Documents
यह शोध पत्र एक बड़े पैमाने के वित्तीय टेक्स्ट-एंड-टेबल (पाठ-और-तालिका) QA डेटासेट पर दस रिट्रीवल रणनीतियों का बेंचमार्किंग करता है, जिससे यह पता चलता है कि न्यूरल रीरैंकिंग वाला एक हाइब्रिड रिट्रीवल पाइपलाइन सिंगल-स्टेज विधियों से बेहतर प्रदर्शन करता है और BM25 अक्सर वित्तीय दस्तावेजों के लिए डेंस रिट्रीवल से बेहतर होता है, साथ ही सटीक संख्यात्मक प्रश्नों के लिए क्वेरी एक्सपेंशन की सीमित उपयोगिता पर व्यावहारिक अंतर्दृष्टि भी प्रदान करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जटिल वित्तीय रहस्य को सुलझाने की कोशिश कर रहे एक जासूस हैं। आपके पास दस्तावेजों का एक विशाल पुस्तकालय (वार्षिक रिपोर्ट, अर्निंग स्टेटमेंट) है जो कहानियों (टेक्स्ट) और स्प्रेडशीट्स (टेबल्स) का मिश्रण है। आपका लक्ष्य उस सटीक पृष्ठ और सटीक संख्या को खोजना है जो एक विशिष्ट प्रश्न का उत्तर देती है, जैसे "कंपनी X ने 2023 में कितना लाभ कमाया?"
यह पेपर अनिवार्य रूप से एक महान प्रयोग है यह पता लगाने के लिए कि एक कंप्यूटर (एक AI) के लिए इस पुस्तकालय में से उस सुई को खोजने का सबसे अच्छा तरीका क्या है जो घास के ढेर में छिपी है। शोधकर्ताओं ने यह देखने के लिए 10 अलग-अलग "खोज रणनीतियों" का परीक्षण किया कि कौन सी सबसे अच्छा काम करती है।
यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:
1. समस्या: "टेक्स्ट बनाम टेबल" का जाल
अधिकांश AI खोज उपकरण कहानियाँ खोजने में बहुत अच्छे होते हैं। यदि आप पूछते हैं, "कंपनी के इतिहास के बारे में बताएं," तो एक मानक AI खोज एक ऐसे लाइब्रेरियन की तरह काम करती है जिसे कीवर्ड के आधार पर पता होता है कि कौन सी किताब शेल्फ से निकालनी है।
लेकिन वित्तीय दस्तावेज पेचीदा होते हैं। उनमें नंबरों से भरी टेबल्स होती हैं।
- समस्या: यदि आप पूछते हैं, "राजस्व वृद्धि (revenue growth) क्या थी?", तो एक मानक AI भ्रमित हो सकता है। यह टेक्स्ट में "revenue" शब्द को खोज सकता है लेकिन स्प्रेडशीट सेल में छिपे नंबर को मिस कर सकता है। या, यह वृद्धि की अवधारणा को समझ सकता है लेकिन विशिष्ट वर्ष को मिस कर सकता है क्योंकि शब्दावली थोड़ी अलग थी।
- उपमा: यह एक रेसिपी में विशिष्ट सामग्री खोजने जैसा है। एक "कीवर्ड सर्च" शब्द "चीनी" को ढूंढता है, लेकिन एक "सिमेंटिक सर्च" (अर्थ समझना) "मिठास" को ढूंढ सकता है। लेकिन फाइनेंस में, आपको सटीक ग्राम मात्रा की आवश्यकता होती है। यदि आप गलत नंबर लेते हैं, तो पूरी रेसिपी विफल हो जाती है।
2. दावेदार: उन्होंने किसका परीक्षण किया?
शोधकर्ताओं ने विभिन्न खोज रणनीतियों को एक-दूसरे के खिलाफ खड़ा किया:
- पुराना स्कूल (BM25): यह एक बहुत ही सख्त लाइब्रेरियन की तरह है जो केवल तभी किताबें ढूंढता है जब आप किताब की रीढ़ (spine) पर लिखे सटीक शब्दों का उपयोग करते हैं। यह समानार्थी शब्दों को नहीं समझता, लेकिन यह "कंपनी का नाम" या "2023" जैसे विशिष्ट शब्दों को खोजने में अविश्वसनीय रूप से अच्छा है।
- आधुनिक AI (Dense Retrieval): यह एक स्मार्ट सहायक की तरह है जो आपके प्रश्न के भाव और अर्थ को समझता है। यह उन दस्तावेजों को भी ढूंढ सकता है जहाँ आपने अलग शब्दों का उपयोग किया हो, लेकिन यह कभी-कभी सटीक नंबरों पर धुंधला (fuzzy) हो जाता है।
- हाइब्रिड (RRF): यह दोनों को काम पर रखना है—सख्त लाइब्रेरियन और स्मार्ट सहायक, और फिर उन्हें वोट देने देना कि कौन सी किताब सबसे अच्छी है।
- "उत्तर का अनुमान लगाना" (HyDE): यह रणनीति AI से पूछती है कि वह दिखावा करे कि उसे पहले से ही उत्तर पता है, एक नकली दस्तावेज़ लिखे, और फिर उसके आधार पर खोज करे। (इसे एक जासूस द्वारा संदिग्ध का स्केच बनाने जैसा समझें, इससे पहले कि वह उसे ढूंढ ले)।
- "दूसरी राय" (Reranking): यह एक सीनियर एडिटर है जो शीर्ष 50 किताबों को देखता है जिन्हें खोज ने ढूँढा है और उन्हें फिर से व्यवस्थित करता है ताकि यह सुनिश्चित हो सके कि सबसे अच्छा मिलान सबसे ऊपर है।
3. बड़े आश्चर्य (परिणाम)
🏆 विजेता: "दो-चरणीय पाइपलाइन" (Two-Stage Pipeline)
सबसे अच्छी रणनीति केवल एक उपकरण नहीं थी; यह टीमवर्क का दृष्टिकोण था।
- चरण 1: हाइब्रिड विधि (लाइब्रेरियन + स्मार्ट सहायक) का उपयोग करें ताकि एक बड़ा जाल फैलाया जा सके और सबसे संभावित 50 दस्तावेजों को पकड़ा जा सके।
- चरण 2: उन 50 दस्तावेजों को एक सुपर-एडिटर (एक "क्रॉस-एनकोडर रेंकर") को दें जो प्रश्न और दस्तावेज़ को एक साथ पढ़ता है और सबसे अच्छा मिलान चुनता है।
- क्यों जीता: इसने एक बड़ा जाल फैलाने की गति और गहरे गोते लगाने की सटीकता को मिला दिया। इसने 81.6% बार सही दस्तावेज़ पाया, जो अन्य सभी को बड़े अंतर से पीछे छोड़ गया।
🚫 हारने वाला: "उत्तर का अनुमान लगाना" (HyDE)
शोधकर्ताओं ने उस रणनीति का परीक्षण किया जहाँ AI पहले उत्तर का अनुमान लगाता है।
- परिणाम: इसने वास्तव में चीज़ों को और खराब कर दिया।
- उपमा: कल्पना करें कि एक जासूस एक अस्पष्ट विवरण के आधार पर संदिग्ध का स्केच बना रहा है। फाइनेंस में, यदि AI "$50 मिलियन" जैसे नंबर का "भ्रम" (hallucinate) पैदा करता है जबकि वास्तविक नंबर "$48 मिलियन" है, तो खोज भ्रमित हो जाती है और गलत जगह तलाशने लगती है। सटीक नंबरों के लिए, अनुमान लगाना खतरनाक है।
🤔 आश्चर्य: पुराना स्कूल लाइब्रेरियन जीता (कभी-कभी)
सभी को लगा था कि "स्मार्ट असिस्टेंट" (Dense AI), "सख्त लाइब्रेरियन" (BM25) को हरा देगा क्योंकि AI को अधिक स्मार्ट माना जाता है।
- परिणाम: वित्तीय दस्तावेजों पर, सख्त लाइब्रेरियन (BM25) वास्तव में स्मार्ट असिस्टेंट से बेहतर रहा।
- क्यों? वित्तीय रिपोर्ट विशिष्ट शब्दावली (टिकर सिंबल, सटीक मेट्रिक नाम) से भरी होती हैं। AI कभी-कभी बहुत अधिक "बातूनी" हो जाता है और सटीक मिलान को मिस कर देता है, जबकि लाइब्रेरियन शब्दों को पूरी तरह से मैच करता है।
4. आपको क्या करना चाहिए? (सीख)
यदि आप वित्तीय रिपोर्ट या टेबल्स वाले दस्तावेज़ पढ़ने के लिए एक AI सिस्टम बना रहे हैं, तो यहाँ वह रेसिपी है जो लेखक सुझाते हैं:
- केवल एक खोज पद्धति पर भरोसा न करें। "कीवर्ड" खोज को "अर्थ" वाली खोज के साथ मिलाएं।
- "दूसरी राय" का चरण जोड़ें। हमेशा एक शक्तिशाली AI से शीर्ष परिणामों की दोबारा जांच करवाएं ताकि यह सुनिश्चित हो सके कि सबसे अच्छा परिणाम सबसे ऊपर है। यह सबसे बड़ा अपग्रेड है जो आप कर सकते हैं।
- खोजने से पहले "संदर्भ" (Context) जोड़ें। दस्तावेजों को इंडेक्स करने से पहले, एक AI से यह लिखवाएं कि दस्तावेज़ किस बारे में है (जैसे, "यह एप्पल की 2023 की रिपोर्ट है") और इसे फ़ाइल के साथ संलग्न करें। यह सर्च इंजन को दस्तावेज़ को बेहतर ढंग से समझने में मदद करता है।
- अनुमान लगाना बंद करें। ऐसी रणनीतियों का उपयोग न करें जो खोज में मदद करने के लिए "भ्रम" (hallucinate) पैदा करने की कोशिश करती हैं। फाइनेंस में, सटीकता सर्वोपरि है।
- अपने स्वयं के डेटा पर परीक्षण करें। केवल सामान्य AI बेंचमार्क पर भरोसा न करें। वित्तीय दस्तावेज़ अद्वितीय होते; जो समाचार लेखों के लिए काम करता है वह स्प्रेडशीट के लिए विफल हो सकता है।
सारांश
यह पेपर साबित करता है कि टेक्स्ट और नंबरों के मिश्रण वाले जटिल दस्तावेजों के लिए, केवल शारीरिक शक्ति (brute force) पर्याप्त नहीं है, और शुद्ध AI अंतर्ज्ञान भी पर्याप्त नहीं है। असली सफलता का मंत्र हाइब्रिड टीमवर्क है: एक बड़ा जाल फैलाएं, फिर एक सुपर-स्मार्ट संपादक को विजेता चुनने दें। और याद रखें, जब पैसे का मामला हो, तो अस्पष्ट अर्थों की तुलना में सटीक शब्द अधिक महत्वपूर्ण होते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।