← नवीनतम पेपर
🤖 AI

NovaLAD: A Fast, CPU-Optimized Document Extraction Pipeline for Generative AI and Data Intelligence

NovaLAD एक तेज़, CPU-अनुकूलित दस्तावेज़ निष्कर्षण पाइपलाइन है जो असंरचित दस्तावेज़ों को संरचित स्वरूपों में बदलने के लिए समवर्ती YOLO मॉडलों, नियम-आधारित समूहीकरण और चयनात्मक विज़न LLM प्रसंस्करण का लाभ उठाती है, जो बिना किसी GPU हार्डवेयर की आवश्यकता के DP-Bench बेंचमार्क पर अत्याधुनिक सटीकता के साथ कुशल जेनरेटिव AI अनुप्रयोगों को सक्षम बनाती है।

मूल लेखक: Aman Ulla

प्रकाशित 2026-03-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Aman Ulla

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, बिखरी हुई लाइब्रेरी है जिसमें हजारों पुरानी, स्कैन की गई किताबें, हस्तलिखित नोट्स और फोटोकॉपी किए गए चार्ट भरे पड़े हैं। आप एक सुपर-स्मार्ट AI असिस्टेंट (एक जीनियस लाइब्रेरियन की तरह) बनाना चाहते हैं जो इन किताबों के आधार पर सवालों के जवाब दे सके। लेकिन समस्या यह है कि AI सीधे उन बिखरे हुए पन्नों को नहीं पढ़ सकता। इसे जानकारी को व्यवस्थित, लेबल और साफ डिजिटल फोल्डर्स में रखने की जरूरत है।

NovaLAD एक हाई-स्पीड, सुपर-एफिशिएंट रोबोट लाइब्रेरियन है जिसे ठीक यही काम करने के लिए डिज़ाइन किया गया है। यह एक अव्यवस्थित दस्तावेज़ (जैसे PDF या स्कैन) को लेता है और उसे साफ, स्ट्रक्चर्ड डेटा में बदल देता है जिसे AI समझ सके, और वह भी बिना किसी महंगे, भारी-भरकम सुपरकंप्यूटर के।

यहाँ बताया गया है कि NovaLAD कैसे काम करता है, जिसे सरल चरणों और कुछ मजेदार उपमाओं (analogies) के साथ समझाया गया है:

1. "डबल-स्कैनिंग" आँखें (पैरेलल डिटेक्शन)

अधिकांश दस्तावेज़ रीडर एक पेज को एक बार देखते हैं और फिर अंदाज़ा लगाने की कोशिश करते हैं कि वहां क्या है। NovaLAD अधिक स्मार्ट है। यह एक ही समय में दो जोड़ी आँखों का उपयोग करता है जो पेज को देखती हैं:

  • "स्ट्रक्चर" (संरचना) आँख: यह बड़े चित्र (big picture) को देखती है। यह कॉलम, पंक्तियाँ और वे बॉक्स देखती है जहाँ टेक्स्ट रहता है। यह एक घर के फ्लोर प्लान को देखने जैसा है ताकि यह देखा जा सके कि दीवारें और कमरे कहाँ हैं।
  • "कंटेंट" (सामग्री) आँख: यह कमरों के अंदर की वास्तविक चीजों को ढूंढती है। यह शीर्षक, पैराग्राफ, सूचियाँ, टेबल और इमेज को पहचानती है। यह कमरों में जाने और यह कहने जैसा है, "आह, यहाँ एक बुकशेल्फ़ है, और वहाँ एक लैंप है।"

इसे एक साथ करने से समय बचता है। यह एक असेंबली लाइन पर एक व्यक्ति के बजाय दो श्रमिकों के होने जैसा है।

2. क्लब का "बाउंसर" (इमेज फ़िल्टरिंग)

एक बार जब रोबोट सभी इमेज और चार्ट ढूंढ लेता है, तो वह सब कुछ स्मार्ट AI को नहीं भेजता। ऐसा करना पैसे और समय की बर्बादी होगी।

  • कल्पना कीजिए कि एक एक्सक्लूसिव क्लब में एक बाउंसर है। NovaLAD के पास एक स्मार्ट बाउंसर (एक इमेज क्लासिफायर) है जो हर तस्वीर की जाँच करता है।
  • यदि तस्वीर एक फैंसी लोगो, सजावटी फूल, या खाली जगह है, तो बाउंसर कहता है, "तुम उपयोगी नहीं हो। घर जाओ।"
  • यदि तस्वीर एक डेटा चार्ट, फ्लोचार्ट, या जटिल आरेख (diagram) है, तो बाउंसर कहता है, "तुम VIP हो! अंदर जाओ।"
  • क्यों? यह महंगे AI को कंपनी के लोगो जैसी तस्वीर पढ़ने में समय बर्बाद करने से रोकता है और केवल उन्हीं चार्टों के विश्लेषण के लिए भुगतान करता है जिनमें वास्तव में जानकारी होती है।

3. "रीडिंग ऑर्डर" की पहेली (ग्रुपिंग और सॉर्टिंग)

दस्तावेज़ पेचीदा हो सकते हैं। कभी-कभी टेक्स्ट दो कॉलम में होता है, या एक टेबल कई पन्नों में बंटी होती है। यदि आप केवल ऊपर-से-नीचे पढ़ते हैं, तो आप कॉलम को आपस में मिला सकते हैं।

  • NovaLAD एक पहेली मास्टर (puzzle master) की तरह काम करता है। यह उन सभी टुकड़ों को लेता है जिन्हें इसने पाया है (टेक्स्ट, टेबल, इमेज) और उन्हें उनके स्थान के आधार पर एक साथ जोड़ देता है।
  • यह सही पढ़ने का क्रम (बाएं-से-दाएं, ऊपर-से-नीचे) निर्धारित करता है ताकि AI ठीक वैसे ही कहानी पढ़े जैसे एक इंसान पढ़ता है, न कि एक उलझे हुए ढेर के रूप में।

4. "स्मार्ट ट्रांसलेटर" (OCR और AI एनरिचमेंट)

कभी-कभी टेक्स्ट केवल शब्दों की एक तस्वीर होती है (जैसे स्कैन की गई रसीद), न कि डिजिटल टेक्स्ट।

  • ट्रांसलेटर (OCR): NovaLAD टेक्स्ट को पढ़ने के लिए EasyOCR नामक टूल का उपयोग करता है, जो "इमेज पिक्सल" को "वास्तविक शब्दों" में बदल देता है।
  • स्मार्ट ट्रांसलेटर (विज़न LLM): उन "VIP" इमेज (उपयोगी चार्ट और ग्राफ) के लिए जो बाउंसर से पास होकर आए हैं, NovaLAD एक सुपर-स्मार्ट AI (जैसे GPT-4) से सारांश लिखने के लिए कहता है। यह पूछता है: "यह चार्ट क्या दिखा रहा है? इसका शीर्षक क्या है?" यह एक भ्रमित करने वाले ग्राफ को एक स्पष्ट वाक्य में बदल देता है जिसे AI समझ सके।

5. "स्विस आर्मी नाइफ" आउटपुट

एक बार जब NovaLAD ने आपके दस्तावेज़ को साफ कर दिया है, तो यह आपको केवल एक परिणाम नहीं देता। यह तुरंत एक ही साथ एक ही दस्तावेज़ के चार अलग-अलग संस्करण बनाता है:

  1. JSON: डेटाबेस के लिए एक सख्त, कंप्यूटर-पठनीय प्रारूप।
  2. Markdown: मनुष्यों के पढ़ने के लिए एक साफ, पठनीय प्रारूप।
  3. RAG Chunks: टेक्स्ट के छोटे टुकड़े जो AI चैटबॉट के याद करने के लिए तैयार हैं।
  4. Knowledge Graph: एक मानचित्र जो यह दिखाता है कि दस्तावेज़ के विभिन्न भाग एक-दूसरे से कैसे जुड़ते हैं।

सबसे अच्छी बात: यह एक सामान्य कंप्यूटर पर चलता है

इनमें से अधिकांश फैंसी AI टूल्स के लिए भारी, महंगे ग्राफिक्स कार्ड (GPUs) की आवश्यकता होती है जो हजारों डॉलर के होते हैं और बहुत अधिक बिजली का उपयोग करते हैं।

  • NovaLAD, CPU-ऑप्टिमाइज्ड है। यह एक मानक कंप्यूटर प्रोसेसर (जो आपके लैपटॉप या ऑफिस सर्वर में होता है) पर तेजी से चलता है।
  • उपमा: यह एक रेस कार की तरह है जो ग्रैंड प्रिक्स जीत सकती है लेकिन महंगी रॉकेट ईंधन के बजाय साधारण अनलीडेड पेट्रोल पर चलती है। यह इसे चलाने के लिए सस्ता और कहीं भी उपयोग करने में आसान बनाता है, यहाँ तक कि उन जगहों पर भी जहाँ इंटरनेट या सीमित बिजली है।

परिणाम?

जब अन्य शीर्ष टूल्स (बड़ी कंपनियों जैसे गूगल और माइक्रोसॉफ्ट सहित) के मुकाबले परीक्षण किया गया, तो NovaLAD सबसे ऊपर रहा। यह टेबल पढ़ने में अधिक सटीक (96.5% सटीकता) और पढ़ने का क्रम बनाए रखने में (98.5% सटीकता) सबसे बेहतर था, और यह सब बहुत तेज़ और सस्ते में हुआ।

संक्षेप में: NovaLAD वह तेज़, किफायती और अविश्वसनीय रूप से स्मार्ट रोबोट है जो बिखरे हुए कागजी दस्तावेज़ों को साफ, व्यवस्थित डेटा में बदल देता है, जो अगली पीढ़ी के AI के सीखने के लिए तैयार है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →