Decomposing Retrieval Failures in RAG for Long-Document Financial Question Answering
यह शोध पत्र वित्तीय RAG प्रणालियों में उस महत्वपूर्ण विफलता मोड की पहचान करता है और उसे संबोधित करता है जहाँ सही दस्तावेज़ तो प्राप्त हो जाता है लेकिन उत्तर वाला विशिष्ट पृष्ठ छूट जाता है, और एक डोमेन फाइन-ट्यून्ड पेज स्कोरर का प्रस्ताव करता है जो लंबे नियामक फाइलिंग पर पेज और चंक-स्तरीय रिट्रीवल प्रदर्शन में महत्वपूर्ण सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक वित्तीय जासूस (financial detective) हैं जो एक रहस्य सुलझाने की कोशिश कर रहे हैं। आपके पास हजारों किताबों की एक विशाल लाइब्रेरी है (ये SEC फाइलिंग हैं, जो लंबी, उबाऊ और नंबरों से भरी होती हैं)। आपका काम एक विशिष्ट प्रश्न का उत्तर देना है, जैसे, "कंपनी X ने पिछले साल कितना पैसा कमाया?"
आपकी मदद के लिए, आपके पास एक सुपर-स्मार्ट रोबोट सहायक (AI) है जो पढ़ और लिख सकता है। लेकिन रोबोट अंधा है; वह एक साथ पूरी लाइब्रेरी नहीं देख सकता। इसलिए, आपको एक लाइब्रेरियन (Retriever) की आवश्यकता है जो सही पन्ने ढूँढ सके और रोबोट को थमा सके।
समस्या: सही किताब मिलना, लेकिन गलत पन्ना मिलना
अतीत में, शोधकर्ताओं का मानना था कि मुख्य समस्या सही किताब खोजने की थी। यदि लाइब्रेरियन ने रोबोट को सही वार्षिक रिपोर्ट थमा दी, तो सभी ने मान लिया कि रोबोट बहुत अच्छा काम करेगा।
लेकिन इस शोध ने एक छिपे हुए फेलियर मोड (failure mode) की खोज की: लाइब्रेरियन सही किताब तो ढूंढ लेता है, लेकिन गलत पन्ने थमा देता है।
कल्पना कीजिए कि आप "चॉकलेट केक" की रेसिपी मांगते हैं। लाइब्रेरियन सही कुकबुक (Document) तो उठा लेता है, लेकिन आपको वे पन्ने थमा देता है जो "बर्तन कैसे धोएं" या "आटे का इतिहास" के बारे में हैं, न कि केक की रेसिपी के बारे में। रोबोट, सही किताब लेकिन गलत पन्ने देखकर, रेसिपी का अनुमान लगाने की कोशिश करता है। यह सुनने में तर्कसंगत लग सकता है, लेकिन यह गलत होता है।
वित्तीय दुनिया में, यह खतरनाक है। यदि रोबोट गलत मुनाफे के नंबर का अनुमान लगाता है, तो निवेशकों को नुकसान हो सकता है।
समाधान: एक "पेज स्काउट" (Page Scout)
लेखकों ने महसूस किया कि केवल रोबोट को टेक्स्ट के टुकड़े थमाना पर्याप्त नहीं था। उन्हें टेक्स्ट के छोटे टुकड़ों (chunks) को देखने से पहले, किताब के अंदर विशिष्ट पन्नों को खोजने का एक स्मार्ट तरीका चाहिए था।
उन्होंने एक नया टूल बनाया जिसे "पेज स्काउट" (एक डोमेन-फाइन-ट्यून्ड पेज स्कोरर) कहा गया।
यहाँ उनका नया सिस्टम एक उपमा (analogy) का उपयोग करके बताया गया है कि यह कैसे काम करता है:
- पुराना तरीका (Direct Chunk Search): आप लाइब्रेरियन से पूछते हैं, "मुझे केक के बारे में टेक्स्ट ढूंढ कर दो।" लाइब्रेरियन पूरी लाइब्रेरी को स्कैन करता है, हर जगह से यादृच्छिक (random) 10-पेज के टुकड़े निकालता है, और उम्मीद करता है कि उनमें से किसी एक में रेसिपी होगी। यह घास के ढेर में सुई खोजने के लिए घास के रैंडम ढेर उठाने जैसा है।
- नया तरीका (Page-then-Chunk):
- चरण 1 (द स्काउट): सबसे पहले, "पेज स्काउट" किताब की विषय सूची (Table of Contents) या स्पाइन (spine) को देखता है। वह पूछता है, "इस किताब के कौन से विशिष्ट पन्नों पर चॉकलेट केक की रेसिपी होने की संभावना है?" वह किताब के उस 90% हिस्से को अनदेखा कर देता है जो केवल बर्तन धोने के बारे में है।
- चरण 2 (द सर्च): एक बार जब स्काउट कहता है, "यह निश्चित रूप से पेज 40 से 45 पर है," तो लाइब्रेरियन सटीक पैराग्राफ खोजने के लिए केवल उन्हीं विशिष्ट पन्नों को देखता है।
यह क्यों महत्वपूर्ण है
लेखकों ने इसका परीक्षण FinanceBench (150 कठिन वित्तीय प्रश्न) नामक एक डेटासेट पर किया।
- "ऑरेकल" टेस्ट (The Oracle Test): उन्होंने एक आदर्श परिदृश्य की कल्पना की जहाँ एक इंसान ठीक जानता था कि कौन सी किताब और कौन से पन्ने सही थे। इसके बावजूद, यदि उसे सटीक टेक्स्ट नहीं मिला, तो रोबोट संघर्ष करता रहा। इसने साबित कर दिया कि सही पन्ने खोजना सबसे कठिन हिस्सा है।
- परिणाम: उनका नया "पेज स्काउट" सिस्टम पुराने तरीकों की तुलना में बहुत बेहतर था।
- उसने सही पन्ने 55% समय खोजे, जबकि पुराने तरीकों ने उन्हें केवल 34-46% समय खोजा था।
- क्योंकि रोबोट को सही पन्ने मिले, इसलिए उसने सही उत्तर बहुत अधिक बार दिए।
कमी (सीमाएँ)
पेपर अपनी सीमाओं के बारे में ईमानदार है:
- प्रशिक्षण (Training): "पेज स्काउट" को मुख्य रूप से 10-K रिपोर्ट्स (बड़ी वार्षिक रिपोर्ट) पर प्रशिक्षित किया गया था। यह वहां बहुत अच्छा काम करता है, जैसे कि एक विशेषज्ञ जो वार्षिक रिपोर्ट को अंदर से जानता हो। लेकिन जब उन्होंने इसे Earnings Calls (जो अधिक अनौपचारिक बातचीत/ट्रांसक्रिप्ट की तरह होते हैं) पर आजमाया, तो स्काउट भ्रमित हो गया क्योंकि "किताब" का स्वरूप अलग था।
- डेटा: उन्होंने केवल 150 प्रश्नों का परीक्षण किया। यह सुनिश्चित करने के लिए कि यह वास्तव में सभी के लिए काम करता है, उन्हें हजारों और प्रश्नों पर परीक्षण करने की आवश्यकता होगी।
मुख्य निष्कर्ष
AI और वित्त की दुनिया में, सही दस्तावेज़ ढूँढना ही काफी नहीं है। आपको उस दस्तावेज़ के अंदर सही पन्ना ढूँढना होगा।
इसे इस तरह सोचें: यदि आप 500 पन्नों के उपन्यास में एक विशिष्ट उद्धरण (quote) की तलाश कर रहे हैं, तो किताब ढूँढना लड़ाई का केवल 50% है। दूसरा 50% यह जानना है कि बिल्कुल कौन सा पन्ना खोलना है। यह पेपर हमें एक बेहतर "पेज स्काउट" बनाना सिखाता है ताकि हमारा AI केवल उत्तर का अनुमान न लगाए, बल्कि वास्तव में सबूत ढूँढ सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।