← नवीनतम पेपर
💻 computer science

Boosting Document Parsing Efficiency and Performance with Coarse-to-Fine Visual Processing

यह शोध पत्र PaddleOCR-VL को प्रस्तुत करता है, जो एक अभिनव 0.9B कोर्स-टू-फाइन विजन-लैंग्वेज मॉडल है जो केवल अर्थपूर्ण रूप से प्रासंगिक दस्तावेज़ क्षेत्रों की पहचान करने और उन्हें संसाधित करने के लिए एक हल्के वैलिड रीजन फोकस मॉड्यूल का उपयोग करता है, जिससे मौजूदा हाई-रेज़ोल्यूशन दृष्टिकोणों की तुलना में काफी कम कम्प्यूटेशनल लागत और विजन टोकन के साथ अत्याधुनिक पार्सिंग प्रदर्शन प्राप्त होता है।

मूल लेखक: Cheng Cui, Ting Sun, Suyin Liang, Tingquan Gao, Zelun Zhang, Jiaxuan Liu, Xueqing Wang, Changda Zhou, Hongen Liu, Manhui Lin, Yue Zhang, Yubo Zhang, Jing Zhang, Jun Zhang, Xing Wei, Yi Liu, Dianhai Yu
प्रकाशित 2026-03-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Cheng Cui, Ting Sun, Suyin Liang, Tingquan Gao, Zelun Zhang, Jiaxuan Liu, Xueqing Wang, Changda Zhou, Hongen Liu, Manhui Lin, Yue Zhang, Yubo Zhang, Jing Zhang, Jun Zhang, Xing Wei, Yi Liu, Dianhai Yu, Yanjun Ma

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, बिखरी हुई लाइब्रेरी है जहाँ हर किताब अलग आकार की है, कुछ हाथ से लिखी गई हैं, कुछ में जटिल चार्ट हैं, और कुछ तो बस सजावटी वॉलपेपर से ढकी हुई हैं। आपका लक्ष्य हर एक शब्द को पढ़ना, गणित के समीकरणों को समझना और पन्नों को पढ़ने का सही क्रम पता लगाना है।

यह सब मैन्युअल रूप से करना धीमा और थका देने वाला है। कंप्यूटर के साथ करना आमतौर पर और भी कठिन होता है क्योंकि कंप्यूटर हर पेज के हर एक पिक्सेल (pixel) को एक साथ देखने की कोशिश करता है। यदि पेज हाई-रिज़ॉल्यूशन (क्रिस्टल क्लियर) है, तो कंप्यूटर अभिभूत हो जाता है, जैसे कोई व्यक्ति फायरहोस (firehose) से पानी पीने की कोशिश कर रहा हो। वह खाली मार्जिन, फैंसी बॉर्डर्स और व्हाइट स्पेस को देखने में अपनी ऊर्जा बर्बाद करता है, जिसमें वास्तव में कोई उपयोगी जानकारी नहीं होती।

PaddleOCR-VL से मिलिए: "स्मार्ट लाइब्रेरियन"

इस पेपर के पीछे के शोधकर्ताओं ने (Baidu के PaddlePaddle टीम से) एक नया सिस्टम बनाया है जिसे PaddleOCR-VL कहा जाता है। पूरी लाइब्रेरी को एक साथ निगलने के बजाय, उन्होंने एक दो-चरणीय "कोर्स-टू-फाइन" (Coarse-to-Fine) रणनीति बनाई है। इसे एक स्मार्ट लाइब्रेरियन और एक स्पेशलिस्ट रीडर (विशेषज्ञ पाठक) को काम पर रखने की तरह समझें।

स्टेप 1: स्मार्ट लाइब्रेरियन ("कोर्स" स्टेज)

कल्पना कीजिए कि एक लाइब्रेरियन बिखरे हुए कागजों से भरे कमरे में प्रवेश करता है। तुरंत हर शब्द को पढ़ने के बजाय, उनके पास एक विशेष चश्मा है (जिसे Valid Region Focus Module या VRFM कहा जाता है)।

  • वे क्या करते हैं: वे जल्दी से कमरे का स्कैन करते हैं और केवल उन्हीं हिस्सों की ओर इशारा करते हैं जो महत्वपूर्ण हैं: टेक्स्ट ब्लॉक्स, गणित के सूत्र और चार्ट।
  • वे क्या अनदेखा करते हैं: वे खाली सफेद स्थान, सजावटी बॉर्डर्स और बैकग्राउंड के शोर (noise) को पूरी तरह से अनदेखा कर देते हैं।
  • जादू: वे पढ़ने का क्रम (reading order) भी तय करते हैं। यदि एक पेज में ऊपर बाईं ओर टेक्स्ट है, बीच में एक चार्ट है, और दाईं ओर एक साइडबार है, तो लाइब्रेरियन जानता है कि पहले ऊपर बाईं ओर, फिर बीच में, और फिर दाईं ओर पढ़ना है।

ऐसा करके, लाइब्रेरियन भारी काम शुरू होने से पहले ही लगभग 60% कचरे को हटा देता है। वे केवल "अच्छी चीज़ों" को अगले व्यक्ति को सौंप देते हैं।

स्टेप 2: स्पेशलिस्ट रीडर ("फाइन" स्टेज)

अब, "अच्छी चीज़ें" (कटे हुए टेक्स्ट और चार्ट) एक बहुत ही स्मार्ट, लेकिन छोटे और तेज़ रीडर (PaddleOCR-VL-0.9B मॉडल) को सौंपी जाती हैं।

  • यह क्यों बेहतर है: क्योंकि रीडर खाली मार्जिन को देखने में समय बर्बाद नहीं कर रहा है, इसलिए वे जटिल विवरणों को समझने के लिए अपनी 100% मानसिक शक्ति पर ध्यान केंद्रित कर सकते हैं। वे बारीक लिखावट को पढ़ सकते हैं, कठिन गणितीय समस्याओं को हल कर सकते हैं, और बेहद सटीक रूप से अव्यवस्थित तालिकाओं (tables) की व्याख्या कर सकते हैं।
  • परिणाम: वे दस्तावेज़ का एक साफ, व्यवस्थित डिजिटल संस्करण (जैसे कि एक Markdown फ़ाइल) तैयार करते हैं जिसे कंप्यूटर आसानी से उपयोग कर सके।

यह एक बड़ी बात क्यों है?

1. यह "दक्षता विशेषज्ञ" (Efficiency Expert) है
पुराने सिस्टम ऐसे थे जैसे कोई व्यक्ति स्याही के हर एक बिंदु को देखते हुए पूरे अखबार को पढ़ने की कोशिश कर रहा हो, यहाँ तक कि कॉलम के बीच के खाली स्थानों को भी। इससे वे धीमे और महंगे (बड़े, महंगे कंप्यूटरों की आवश्यकता) हो जाते थे।
PaddleOCR-VL उस व्यक्ति की तरह है जो जल्दी से पेज को स्कैन करता है, उन लेखों को काट लेता है जिनकी उसे आवश्यकता है, और केवल उन्हें पढ़ता है। यह कम "टोकन" (सूचना की इकाइयाँ जिन्हें कंप्यूटर प्रोसेस करता है) का उपयोग करता है और मानक हार्डवेयर पर बहुत तेज़ी से चलता है।

2. यह "सटीकता का राजा" (Accuracy King) है
चूंकि सिस्टम केवल उसी पर ध्यान केंद्रित करता है जो महत्वपूर्ण है, इसलिए यह कम गलतियाँ करता है। यह लेआउट से भ्रमित नहीं होता। यह संभाल सकता है:

  • हस्तलेखन (Handwriting): यहाँ तक कि बिखरी हुई नोट्स भी।
  • गणितीय सूत्र (Math Formulas): जटिल समीकरण जो एलियन कोड की तरह दिखते हैं।
  • तालिकाएं (Tables): मर्ज किए गए सेल्स के साथ अव्यवस्थित ग्रिड।
  • चार्ट (Charts): ग्राफ की तस्वीर को डेटा टेबल में बदलना।
  • 109 भाषाएँ: अंग्रेजी और चीनी से लेकर हिंदी और रूसी तक।

3. "डेटा डाइट"
टीम ने केवल एक स्मार्ट दिमाग ही नहीं बनाया; उन्होंने इसे एक विशाल, उच्च-गुणवत्ता वाला आहार भी दिया। उन्होंने 3 करोड़ (30 मिलियन) से अधिक उदाहरण एकत्र किए, जिनमें वास्तविक दुनिया के दस्तावेज़ शामिल थे (जैसे पुरानी किताबें, परीक्षा के पेपर और वित्तीय रिपोर्ट) और उन्होंने कठिन मामलों (जैसे धुंधला टेक्स्ट या अजीब फोंट) को संभालने के लिए नकली उदाहरण भी बनाए।

निष्कर्ष

PaddleOCR-VL को घास के ढेर में सुई खोजने के लिए पूरे ढेर को खोदने के बजाय, एक चुंबक का उपयोग करके तुरंत सुई को बाहर निकालने के अंतर के रूप में देखें।

यह एक अस्त-व्यत, जटिल दस्तावेज़ लेता है, शोर को फिल्टर करता है, क्रम का पता लगाता है, और फिर सुपरह्यूमन गति और सटीकता के साथ महत्वपूर्ण हिस्सों को पढ़ता है। इसका मतलब है कि कंपनियाँ AI मॉडल को प्रशिक्षित करने, सर्च इंजन बनाने या आर्काइव को व्यवस्थित करने के लिए हर एक पेज के लिए सुपरकंप्यूटर की आवश्यकता के बिना, लाखों दस्तावेज़ों को तेज़ी से प्रोसेस कर सकती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →