Empirical Evaluation of PDF Parsing and Chunking for Financial Question Answering with RAG
यह शोध पत्र वित्तीय प्रश्नोत्तर के लिए रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) प्रणालियों के भीतर विभिन्न PDF पार्सर और चंकिंग रणनीतियों का मूल्यांकन करने वाला एक अनुभवजन्य अध्ययन प्रस्तुत करता है, जो मजबूत दस्तावेज़ समझ पाइपलाइन बनाने के लिए व्यावहारिक दिशा-निर्देश प्रदान करने हेतु 'टेबलक्वेस्ट' (TableQuest) नामक एक नया बेंचमार्क पेश करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक वित्तीय विश्लेषक (financial analyst) हैं जो किसी कंपनी की अर्निंग्स की एक विशाल, 200-पेज की PDF रिपोर्ट में एक विशिष्ट संख्या खोजने की कोशिश कर रहे हैं। समस्या क्या है? वह PDF इंसानों के पढ़ने के लिए डिज़ाइन की गई है, न कि कंप्यूटर के समझने के लिए। यह एक खूबसूरती से सजाई गई किताब की तरह है जहाँ टेक्स्ट, टेबल और चार्ट बिना किसी स्पष्ट लेबल के आपस में मिले हुए हैं। यदि आप कंप्यूटर से "प्रॉफिट मार्जिन" खोजने के लिए कहते हैं, तो वह भ्रमित हो सकता है, गलत पेज देख सकता है या अलग-अलग टेबल्स से नंबरों को मिला सकता है।
यह पेपर अनिवार्य रूप से एक वैज्ञानिक स्वाद परीक्षण (scientific taste test) है ताकि यह पता लगाया जा सके कि कंप्यूटर को इन अस्त-व्यस्त वित्तीय PDF को पढ़ने और सटीक उत्तर देने के लिए सबसे अच्छा तरीका क्या है।
यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:
1. समस्या: "अस्त-व्यस्त लाइब्रेरी" (The Messy Library)
एक वित्तीय PDF को एक ऐसी लाइब्रेरी की तरह समझें जहाँ सभी किताबों को फाड़कर एक विशाल ढेर में फेंक दिया गया है।
- लक्ष्य: आप एक विशिष्ट वाक्य ढूँढना चाहते हैं (जैसे, "2023 में राजस्व क्या था?")।
- चुनौती: उस वाक्य को खोजने से पहले, कंप्यूटर को यह करना होगा:
- पेजों को फिर से जोड़ना (Parsing): यह समझना कि कौन सा टेक्स्ट एक टेबल का हिस्सा है और कौन सा पैराग्राफ का।
- पेजों को छोटे टुकड़ों में काटना (Chunking): कंप्यूटर एक बार में पूरी 200-पेज की किताब नहीं पढ़ सकते; उनका "ध्यान केंद्रित करने का समय" (मेमोरी) सीमित होता है। इसलिए, आपको टेक्स्ट को छोटे टुकड़ों में काटना होगा।
- सही टुकड़ा ढूँढना (Retrieval): जब आप कोई प्रश्न पूछते हैं, तो सिस्टम को तुरंत सही टुकड़ा उठा लेना चाहिए।
2. प्रयोग: "कुकिंग कॉम्पिटिशन" (The Cooking Competition)
शोधकर्ताओं ने यह देखने के लिए एक बड़ा प्रयोग किया कि कौन से "शेफ" (टूल्स) और "काटने की शैलियाँ" (रणनीतियाँ) सबसे अच्छा काम करती हैं। उन्होंने इसे दो प्रकार के "रेसिपी" पर टेस्ट किया:
- FinanceBench: टेक्स्ट पर आधारित प्रश्न (जैसे कहानी पढ़ना)।
- TableQuest (नया!): टेबल्स पर आधारित प्रश्न (जैसे स्प्रेडशीट पढ़ना)। यह एक बड़ी बात है क्योंकि अधिकांश पिछले परीक्षणों में टेबल्स को अनदेखा कर दिया गया था, जबकि असली वित्तीय डेटा अक्सर वहीं छिपा होता है।
उन्होंने इनका परीक्षण किया:
- 6 अलग-अलग "कैंची" (PDF Parsers): कुछ बुनियादी कैंची हैं (जो केवल टेक्स्ट काटती हैं), जबकि अन्य हाई-टेक लेजर कटर हैं जो टेबल और इमेज को भी देख सकती हैं।
- 6 अलग-अलग "काटने की शैलियाँ" (Chunking): कुछ हर 50 शब्दों में काटते हैं, कुछ हर वाक्य पर काटते हैं, और कुछ AI का उपयोग करते हैं ताकि केवल वहीं काटें जहाँ अर्थ बदलता है।
- विभिन्न "सर्च इंजन" (Retrievers): कैसे कंप्यूटर सही टुकड़े को ढूँढता है।
- विभिन्न "दिमाग" (LLMs): वह AI जो टुकड़े को पढ़ता है और उत्तर देता है।
3. मुख्य निष्कर्ष (The Secret Sauce)
🏆 सर्वश्रेष्ठ कैंची (Parsing)
- टेक्स्ट के लिए: pdfminer नामक टूल चैंपियन रहा। यह एक सावधान लाइब्रेरियन की तरह है जो कच्चे टेक्स्ट स्ट्रीम को बहुत सटीकता से पढ़ता है।
- टेबल्स के लिए: pdfplumber विजेता रहा। यह एक विशेषज्ञ की तरह है जो जानता है कि स्प्रेडशीट को आसपास के टेक्स्ट से बिल्कुल कैसे अलग करना है।
- "ऑल-इन-वन" का जाल: भारी AI वाला फैंसी टूल (Unstructured) बहुत सटीक था लेकिन बेहद धीमा था। यह एक प्याज काटने के लिए सुपरकंप्यूटर का उपयोग करने जैसा है—यह काम तो करता है, लेकिन इसमें बहुत समय लगता है। व्यवसाय के लिए, गति मायने रखती है।
✂️ सर्वश्रेष्ठ काटने की शैली (Chunking)
- बहुत बारीक न काटें: यदि आप टेक्स्ट को बहुत छोटे, रैंडम टुकड़ों में काटते हैं, तो आप संदर्भ (context) खो देते हैं (जैसे एक वाक्य को बीच से आधा काट देना)।
- "ओवरलैप" का तरीका: शोधकर्ताओं ने पाया कि जब आप टेक्स्ट को काटते हैं, तो आपको टुकड़ों को थोड़ा ओवरलैप करना चाहिए (जैसे छत की टाइल्स एक-दूसरे के ऊपर होती हैं)। यदि आप एक पेज को टुकड़ों में काटते हैं, तो सुनिश्चित करें कि एक टुकड़े का अंतिम 25% अगले टुकड़े की शुरुआत में दोहराया गया हो। यह सुनिश्चित करता है कि यदि कोई नंबर या वाक्य कट के कारण विभाजित हो जाता है, तो भी कंप्यूटर पूरी तस्वीर देख सके।
- विजेता: एक "न्यूरल" कटर (AI जो अर्थ समझता है) सबसे अच्छा रहा, लेकिन एक साधारण "सेंटेंस" कटर भी लगभग उतना ही अच्छा था और बहुत सस्ता/तेज़ था।
🧠 सर्वश्रेष्ठ दिमाग (The AI Model)
- बड़ा बेहतर है (लेकिन सीमाओं के साथ): बड़े AI मॉडल (जैसे GPT-5 या बड़े ओपन-सोर्स मॉडल) छोटे मॉडलों की तुलना में बेहतर उत्तर देते हैं।
- स्वीट स्पॉट (Sweet Spot): 90% तक पहुँचने के लिए आपको सबसे बड़े, सबसे महंगे मॉडल की आवश्यकता नहीं है। एक "मीडियम" आकार का मॉडल अक्सर लागत और सटीकता का सबसे अच्छा संतुलन देता है।
4. "TableQuest" की खोज
शोधकर्ताओं ने महसूस किया कि पिछले परीक्षण केवल चिकनी सड़कों (टेक्स्ट) पर कार का परीक्षण करने जैसे थे। उन्होंने TableQuest बनाया ताकि ऑफ-रोड इलाके (टेबल्स) पर कार का परीक्षण किया जा सके।
- परिणाम: कई सिस्टम जो टेक्स्ट पढ़ने में बहुत अच्छे थे, वे टेबल्स पढ़ने में बुरी तरह विफल रहे। वे यह नहीं समझ पाए कि कोई नंबर किस रो (row) और कॉलम (column) से संबंधित है।
- सबक: यदि आप एक वित्तीय AI बनाना चाहते हैं, तो आपको टेबल्स पर टेस्ट करना ही होगा, अन्यथा वास्तविक दुनिया में आप विफल हो जाएंगे।
5. व्यवसाय के लिए अंतिम निष्कर्ष
यदि आप एक बैंक या ऐसी कंपनी हैं जो वित्तीय रिपोर्ट पढ़ने के लिए AI बनाने की कोशिश कर रही है:
- इसे बहुत जटिल न बनाएं: आपको सबसे महंगे, धीमे टूल्स की आवश्यकता नहीं है। pdfplumber (टेबल्स के लिए) और टेक्स्ट काटने के लिए 25% ओवरलैप का संयोजन अद्भुत काम करता है।
- ओवरलैप महत्वपूर्ण है: हमेशा अपने टेक्स्ट चंक्स को थोड़ा ओवरलैप होने दें ताकि संदर्भ न खो जाए।
- टेबल्स पर टेस्ट करें: केवल यह टेस्ट न करें कि आपका AI पैराग्राफ पढ़ सकता है या नहीं; यह टेस्ट करें कि क्या वह स्प्रेडशीट पढ़ सकता है।
संक्षेप में: यह पेपर एक गाइडबुक है जो कहती है: "यहाँ एक ऐसा वित्तीय AI बनाने का सटीक नुस्खा है जो गलत जानकारी (hallucinate) नहीं देता, टेबल्स से भ्रमित नहीं होता, और इतना तेज़ है कि वास्तविक बैंक में उपयोगी हो सके।"
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।