← नवीनतम पेपर
💬 NLP

PDF Retrieval Augmented Question Answering

यह शोध पत्र एक उन्नत रिट्रीवल ऑगमेंटेड जनरेशन (RAG) फ्रेमवर्क प्रस्तुत करता है जिसे टेक्स्ट के साथ इमेज, ग्राफ और टेबल जैसे मल्टीमॉडल तत्वों को प्रभावी ढंग से एकीकृत करके पीडीएफ-आधारित प्रश्नोत्तर को बेहतर बनाने के लिए डिज़ाइन किया गया है, ताकि परिष्कृत प्रसंस्करण और फाइन-ट्यून्ड लार्ज लैंग्वेज मॉडल्स के माध्यम से जटिल प्रश्नों का समाधान किया जा सके।

मूल लेखक: Thi Thu Uyen Hoang, Viet Anh Nguyen

प्रकाशित 2026-04-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Thi Thu Uyen Hoang, Viet Anh Nguyen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास हजारों किताबों से भरी एक विशाल, धूल भरी लाइब्रेरी है। लेकिन ये सामान्य किताबें नहीं हैं; ये PDFs (डिजिटल दस्तावेज़) हैं जो लिखित टेक्स्ट, रंगीन चार्ट, जटिल ग्राफ और तस्वीरों का एक अस्त-व्यस्त मिश्रण हैं।

अब, कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लाइब्रेरियन (AI) से एक सवाल पूछते हैं जैसे: "पेज 15 पर मौजूद सेल्स ग्राफ मार्केटिंग बजट के बारे में क्या कहता है, और क्या आप मुझे उस टीम की फोटो दिखा सकते हैं जिसने इसे बनाया है?"

पारंपरिक AI लाइब्रेरियन टेक्स्ट पढ़ने में बहुत अच्छे होते हैं, लेकिन वे चित्रों और चार्ट्स को लेकर भ्रमित हो जाते हैं। वे कह सकते हैं, "मुझे नहीं पता," या इससे भी बुरा, वे एक कहानी बना सकते हैं (हैलुसिनेशन/भ्रम) क्योंकि वे डेटा को "देख" नहीं पाते।

यह पेपर एक नए, सुपर-पावरफुल लाइब्रेरियन सिस्टम जिसे PIER-QA कहा जाता है, का परिचय देता है। यह इस प्रकार काम करता है, जिसे सरल चरणों में विभाजित किया गया है:

1. "क्लीन-अप क्रू" (प्रीप्रोसेसिंग - पूर्व-प्रसंस्करण)

दस्तावेजों को पढ़ने से पहले, AI को उन्हें साफ करना पड़ता है।

  • समस्या: PDFs "शोर" (noise) से भरे होते हैं—हेडर, फुटर, पेज नंबर और लोगो जो हर पेज पर दोहराए जाते हैं। यह एक ऐसी किताब को पढ़ने जैसा है जहाँ हर वाक्य के ऊपर "पेज 1 of 100" लिखा हुआ है।
  • समाधान: सिस्टम एक स्मार्ट एल्गोरिदम (जिसे DBSCAN कहा जाता है) का उपयोग करता है जो एक जासूस की तरह काम करता है। यह पैटर्न खोजता है। यदि यह हर पेज के बिल्कुल ऊपर और नीचे एक ही टेक्स्ट बॉक्स देखता है, तो इसे पता चल जाता है, "आह, यह सिर्फ हेडर/फुटर है, कहानी नहीं!" यह उन हिस्सों को काट देता है, जिससे केवल शुद्ध कंटेंट बचता है।
  • अनुवाद: इसके बाद, यह बिखरे हुए PDF को एक साफ, व्यवस्थित फॉर्मेट में बदल देता है जिसे Markdown कहा जाता है (सोचिए कि आप एक फैंसी, कठिन-से-पढ़ने वाले पांडुलिपि को एक सरल, अच्छी तरह से संरचित ब्लॉग पोस्ट में बदल रहे हैं)।

2. "कैप्शनिंग आर्टिस्ट" (इमेज को बोलना सिखाना)

यही असली जादू है।

  • समस्या: मानक AI मॉडल ऐसे लोगों की तरह हैं जो उपन्यास तो पढ़ सकते हैं लेकिन अंधे हैं। वे किसी चार्ट या फोटो को समझ नहीं सकते।
  • समाधान: सिस्टम एक विशेष "कलाकार" AI (जिसे LLaVA कहा जाता है) का उपयोग करता है जो दस्तावेज़ में मौजूद हर इमेज, ग्राफ और टेबल को देखता है और उसके लिए एक कैप्शन लिखता है।
    • उपमा: कल्पना कीजिए कि AI हर तस्वीर पर एक नेम-टैग लगा देता है। केवल एक बार चार्ट देखने के बजाय, AI उसके बगल में एक नोट लिखता है: "यह चार्ट दिखाता है कि जून में बिक्री 20% बढ़ी।"
    • अब, AI उस तस्वीर को "पढ़" सकता है क्योंकि उसने इमेज को टेक्स्ट में बदल दिया है!

3. "स्मार्ट फाइलिंग सिस्टम" (रिट्रीवल - पुनः प्राप्ति)

  • समस्या: यदि आपके पास 1,000 दस्तावेज़ हैं, तो आप हर बार किसी के सवाल पूछने पर उन सभी को नहीं पढ़ सकते। यह बहुत धीमा होगा।
  • समाधान: सिस्टम दस्तावेज़ों को छोटे, खाने योग्य टुकड़ों (जैसे पहेली के टुकड़ों) में काटता है और उन्हें एक सुपर-फास्ट डिजिटल फाइलिंग कैबिनेट (ElasticSearch) में रखता है।
  • अपग्रेड: यह RAPTOR नामक तकनीक का उपयोग करता है। कल्पना कीजिए कि दस्तावेजों को केवल वर्णानुक्रम (alphabetical) में फाइल करने के बजाय, सिस्टम उन्हें अर्थ के आधार पर भी समूहबद्ध करता है। यदि आप "बिक्री" (sales) के बारे में पूछते हैं, तो यह केवल "sales" शब्द को नहीं खोजता; यह बिक्री के बारे में चार्ट, राजस्व के बारे में पैराग्राफ और सेल्स टीम की फोटो भी ढूंढ लेता है, भले ही वे दस्तावेज़ के अलग-अलग हिस्सों में हों।

4. "विशेषज्ञ लाइब्रेरियन" (AI का दिमाग)

  • समस्या: एक सामान्य AI (जैसे कि एक स्टैंडर्ड चैटबॉट) शायद यह नहीं समझ पाएगा कि इन विशिष्ट "साफ किए गए" दस्तावेजों को कैसे संभालना है या हमारे द्वारा जोड़े गए इमेज कैप्शन को कैसे खोजना है।
  • समाधान: शोधकर्ताओं ने एक शक्तिशाली ओपन-सोर्स AI (Llama 3) लिया और उसे एक विशेष प्रशिक्षण पाठ्यक्रम दिया। उन्होंने इसे उनके विशिष्ट PDF फॉर्मेट पर आधारित हजारों प्रश्न-उत्तर के उदाहरण दिए।
    • उपमा: यह एक प्रतिभाशाली विश्वविद्यालय के छात्र को विशेष रूप से आपकी कंपनी की अव्यवस्थित रिपोर्ट पढ़ने के लिए 2-सप्ताह की इंटर्नशिप देने जैसा है। अब, उसे पता है कि कहाँ देखना है और कैसे उत्तर देना है।

5. "शो एंड टेल" (जवाब देना)

जब आप कोई सवाल पूछते हैं:

  1. सिस्टम प्रासंगिक टेक्स्ट चंक्स, इमेज कैप्शन और टेबल डेटा को ढूंढता है।
  2. यह इस "सुराग पैकेट" को विशेषज्ञ AI को सौंप देता है।
  3. AI उत्तर लिखता है।
  4. खास बात: यदि उत्तर के लिए किसी तस्वीर की आवश्यकता है, तो AI जानता कि उसे कहना है, "यहाँ डेटा है, और साथ ही, यहाँ वह इमेज फाइल [image_1.png] है जिसे आपने मांगा था।" सिस्टम फिर उस वास्तविक इमेज को निकालता है और आपको दिखाता है।

यह एक बड़ी बात क्यों है?

आज के अधिकांश AI सिस्टम केवल-टेक्स्ट वाले जासूस की तरह हैं। वे रहस्यों को सुलझा सकते हैं यदि सुराग लिखे गए हों, लेकिन वे विफल हो जाते हैं यदि सुराग एक ग्राफ या फोटो हो।

यह पेपर एक मल्टीमॉडल जासूस बनाता है जो:

  • फालतू चीजों (हेडर/फुटर) को अनदेखा कर सकता है।
  • तस्वीरों को उनका वर्णन करके "पढ़" सकता है।
  • टेबल्स और चार्ट्स को समझ सकता है।
  • एक सटीक उत्तर देने के लिए इन सभी विभिन्न प्रकार के सुरागों को मिला सकता है।

परिणाम: अपने परीक्षणों में, यह नया सिस्टम पुराने "केवल-टेक्स्ट" सिस्टम की तुलना में बहुत अधिक सटीक था, विशेष रूप से जब सवाल के लिए किसी चार्ट या टेबल को देखना आवश्यक था। यह PDF फाइलों की अस्त-व्यस्त वास्तविकता और AI से मिलने वाले स्मार्ट उत्तरों के बीच के अंतर को पाटता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →