PaddleOCR-VL-1.5: Towards a Multi-Task 0.9B VLM for Robust In-the-Wild Document Parsing
PaddleOCR-VL-1.5 एक उन्नत, अल्ट्रा-कॉम्पैक्ट 0.9B विजन-लैंग्वेज मॉडल है जो दस्तावेज़ पार्सिंग कार्यों पर अत्याधुनिक प्रदर्शन प्राप्त करता है, जिसमें वास्तविक दुनिया के भौतिक विकृतियों के विरुद्ध मजबूती और सील पहचान और टेक्स्ट स्पोटिंग जैसी नई क्षमताएं शामिल हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास दस्तावेजों का एक विशाल पुस्तकालय है। कुछ कंप्यूटर से बने एकदम सटीक, स्पष्ट PDF हैं। अन्य मुड़े हुए रसीदें, कम रोशनी में व्हाइटबोर्ड की तस्वीरें, पुराने समाचार पत्रों के टेढ़े-मेढ़े स्कैन, या ऐसे पन्ने हैं जो किसी डगमगाती मेज पर छपे हुए लगते हैं।
लंबे समय तक, कंप्यूटर सटीक वाले दस्तावेज़ों को पढ़ने में तो माहिर थे लेकिन वास्तविक दुनिया के अस्त-व्यस्त दस्तावेज़ों में वे बहुत खराब थे। एक टेढ़े फोटो या धुंधले स्टैम्प (मोहर) से वे भ्रमित हो जाते थे।
PaddleOCR-VL-1.5 एक बिल्कुल नए, अत्यंत बुद्धिमान लाइब्रेरियन (पुस्तकालयाध्यक्ष) की तरह है जिसने अभी-अभी एक बहुत ही गहन प्रशिक्षण शिविर से स्नातक किया है। यहाँ बताया गया है कि यह नया लाइब्रेरियन क्या विशेष बनाता है, इसे सरल शब्दों में समझाया गया है:
1. "छोटा दिग्गज" (दक्षता)
अधिकांश सुपर-स्मार्ट AI लाइब्रेरियन हाथियों की तरह होते हैं: वे विशाल होते हैं, उन्हें भारी मात्रा में भोजन (कंप्यूटिंग पावर) की आवश्यकता होती है, और वे धीरे चलते हैं।
- पुराना तरीका: उच्च स्कोर प्राप्त करने के लिए, आपको अरबों "मस्तिष्क कोशिकाओं" (पैरामीटर्स) वाले एक विशाल AI की आवश्यकता थी।
- नया तरीका: PaddleOCR-VL-1.5 एक 0.9 बिलियन पैरामीटर वाला मॉडल है। इसे एक सुव्यवस्थित, उच्च प्रदर्शन वाली स्पोर्ट्स कार के रूप में सोचें। हाथियों (जिनमें से कुछ के 200+ बिलियन पैरामीटर्स होते हैं) की तुलना में यह बहुत छोटा है, लेकिन यह तेज़ चलता है, कम ईंधन का उपयोग करता है, और फिर भी दौड़ में हाथियों को हरा सकता है। यह साबित करता है कि प्रतिभाशाली होने के लिए आपको विशाल होने की आवश्यकता नहीं है।
2. "जादुई चश्मा" (विकृतियों को संभालना)
कल्पना कीजिए कि आप एक मेनू पढ़ रहे हैं जबकि कोई मेज को हिला रहा है, लाइटें झिलमिला रही हैं, और कागज मुड़ा हुआ है। एक सामान्य पाठक हार मान लेगा।
- समस्या: वास्तविक दुनिया के दस्तावेज़ शायद ही कभी पूर्ण होते हैं। उन्हें टेढ़ा स्कैन किया जाता है, गर्मी से मुड़ा हुआ होता है, या फोन स्क्रीन के कारण अजीब पैटर्न (मोइरे) के साथ फोटो लिया जाता है।
- समाधान: यह नया मॉडल विशेष "जादुई चश्मा" (जिसे PP-DocLayoutV3 कहा जाता है) पहनता है।
- केवल एक पैराग्राफ के चारों ओर एक बॉक्स देखने के बजाय, यह टेक्स्ट के सटीक आकार को देखता है, भले ही वह किसी प्रेट्ज़ल (pretzel) की तरह मुड़ा हुआ हो।
- यह तुरंत पढ़ने के क्रम को समझ सकता है। यदि कोई पेज 45 डिग्री झुका हुआ है, तो यह जानता है कि ऊपर-बाएँ से नीचे-दाएँ पढ़ना है, न कि केवल बाएँ-से-दाएँ। यह शब्दों को पढ़ने से पहले ही अपने दिमाग में उस "टेढ़ेपन" को ठीक कर लेता है।
3. "नई महाशक्तियाँ" (सील और पहचान)
पुराना लाइब्रेरियन टेक्स्ट और टेबल पढ़ सकता था, लेकिन उसकी कुछ कमियां थीं।
- सील पहचान (Seal Recognition): कल्पना कीजिए कि एक दस्तावेज़ पर टेक्स्ट के ऊपर एक लाल, गोलाकार स्टैम्प है। वह स्टैम्प धुंधला या मुड़ा हुआ हो सकता है। नया लाइब्रेरियन उस स्टैम्प को मानसिक रूप से हटा सकता है और उसके नीचे के टेक्स्ट को पढ़ सकता है, या स्टैम्प के ऊपर के टेक्स्ट को पढ़ सकता है।
- टेक्स्ट स्पोटिंग (Text Spotting): कभी-कभी टेक्स्ट एक व्यवस्थित पैराग्राफ में नहीं होता; यह एक बिलबोर्ड, एक भित्तिचित्र (graffiti) दीवार, या एक घुमावदार साइन पर हो सकता है। नया लाइब्रेरियन केवल शब्दों को पढ़ता ही नहीं; यह बिल्कुल बता सकता है कि वे शब्द चित्र में कहाँ हैं, भले ही वे हर जगह बिखरे हुए हों।
4. "कठोर परीक्षण" (Real5-OmniDocBench)
यह साबित करने के लिए कि वे वास्तविक दुनिया के लिए तैयार थे, रचनाकारों ने केवल साफ, आदर्श दस्तावेज़ों पर उनका परीक्षण नहीं किया। उन्होंने एक "सर्वाइवल कोर्स" बनाया जिसे Real5-OmniDocBench कहा जाता है।
- उन्होंने दस्तावेज़ों को लिया और उन्हें पांच टॉर्चर टेस्ट (यातना परीक्षणों) के अधीन किया: स्कैनिंग (खराब गुणवत्ता), वार्पिंग (मुड़े हुए पन्ने), स्क्रीन फोटोग्राफी (स्क्रीन की फोटो लेना), खराब रोशनी, और स्क्यूइंग (टेढ़े कोण)।
- परिणाम: जबकि अन्य AI मॉडल इन अस्त-व्यस्त परीक्षणों में लड़खड़ा गए और विफल रहे, PaddleOCR-VL-1.5 ने 92.05% स्कोर किया। इसने केवल पास ही नहीं किया; बल्कि इसने दबदबा बनाया, और बहुत बड़े, भारी AI मॉडलों को भी पीछे छोड़ दिया।
5. "असेंबली लाइन" (गति)
एक पूरी किताब पढ़ने में समय लगता है। पुराना तरीका एक पेज पढ़ने, उसे रखने, सोचने, और फिर अगला पेज पढ़ने जैसा था।
- नया तरीका: टीम ने एक कन्वेयर बेल्ट सिस्टम बनाया।
- जब "लेआउट टीम" पेज 1 पर पैराग्राफ कहाँ हैं यह समझने में व्यस्त होती है, तब "रीडिंग टीम" पेज 2 को पढ़ना शुरू कर देती है।
- यह समानांतर प्रसंस्करण (parallel processing) इस लाइब्रेरियन को अविश्वसनीय रूप से तेज़ बनाता है, जो बिना थके प्रति घंटे हजारों पन्नों को प्रोसेस करने में सक्षम है।
निष्कर्ष
PaddleOCR-VL-1.5 एक बड़ी उपलब्धि है क्योंकि यह छोटे आकार को विशाल बुद्धिमत्ता के साथ जोड़ता है। यह पहला उपकरण है जो आपकी जेब से निकले किसी भी अस्त-व्यस्त, मुड़े हुए, टेढ़े-मेढ़े दस्तावेज़ की फोटो को ले सकता है, समझ सकता है कि वह वास्तव में क्या है, विकृतियों को ठीक कर सकता है, टेक्स्ट को पढ़ सकता है (स्टैम्प के नीचे भी), और उसे पूरी तरह से व्यवस्थित कर सकता है—और वह भी एक मानक कंप्यूटर पर बिना किसी सुपरकंप्यूटर की आवश्यकता के।
यह दस्तावेज़ों की अराजक, अस्त-व्यस्त वास्तविक दुनिया को साफ, व्यवस्थित डेटा में बदल देता है जिसका उपयोग कंप्यूटर वास्तव में कर सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।