← नवीनतम पेपर
💻 computer science

PaddleOCR-VL-1.5: Towards a Multi-Task 0.9B VLM for Robust In-the-Wild Document Parsing

PaddleOCR-VL-1.5 एक उन्नत, अल्ट्रा-कॉम्पैक्ट 0.9B विजन-लैंग्वेज मॉडल है जो दस्तावेज़ पार्सिंग कार्यों पर अत्याधुनिक प्रदर्शन प्राप्त करता है, जिसमें वास्तविक दुनिया के भौतिक विकृतियों के विरुद्ध मजबूती और सील पहचान और टेक्स्ट स्पोटिंग जैसी नई क्षमताएं शामिल हैं।

मूल लेखक: Cheng Cui, Ting Sun, Suyin Liang, Tingquan Gao, Zelun Zhang, Jiaxuan Liu, Xueqing Wang, Changda Zhou, Hongen Liu, Manhui Lin, Yue Zhang, Yubo Zhang, Yi Liu, Dianhai Yu, Yanjun Ma

प्रकाशित 2026-04-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Cheng Cui, Ting Sun, Suyin Liang, Tingquan Gao, Zelun Zhang, Jiaxuan Liu, Xueqing Wang, Changda Zhou, Hongen Liu, Manhui Lin, Yue Zhang, Yubo Zhang, Yi Liu, Dianhai Yu, Yanjun Ma

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास दस्तावेजों का एक विशाल पुस्तकालय है। कुछ कंप्यूटर से बने एकदम सटीक, स्पष्ट PDF हैं। अन्य मुड़े हुए रसीदें, कम रोशनी में व्हाइटबोर्ड की तस्वीरें, पुराने समाचार पत्रों के टेढ़े-मेढ़े स्कैन, या ऐसे पन्ने हैं जो किसी डगमगाती मेज पर छपे हुए लगते हैं।

लंबे समय तक, कंप्यूटर सटीक वाले दस्तावेज़ों को पढ़ने में तो माहिर थे लेकिन वास्तविक दुनिया के अस्त-व्यस्त दस्तावेज़ों में वे बहुत खराब थे। एक टेढ़े फोटो या धुंधले स्टैम्प (मोहर) से वे भ्रमित हो जाते थे।

PaddleOCR-VL-1.5 एक बिल्कुल नए, अत्यंत बुद्धिमान लाइब्रेरियन (पुस्तकालयाध्यक्ष) की तरह है जिसने अभी-अभी एक बहुत ही गहन प्रशिक्षण शिविर से स्नातक किया है। यहाँ बताया गया है कि यह नया लाइब्रेरियन क्या विशेष बनाता है, इसे सरल शब्दों में समझाया गया है:

1. "छोटा दिग्गज" (दक्षता)

अधिकांश सुपर-स्मार्ट AI लाइब्रेरियन हाथियों की तरह होते हैं: वे विशाल होते हैं, उन्हें भारी मात्रा में भोजन (कंप्यूटिंग पावर) की आवश्यकता होती है, और वे धीरे चलते हैं।

  • पुराना तरीका: उच्च स्कोर प्राप्त करने के लिए, आपको अरबों "मस्तिष्क कोशिकाओं" (पैरामीटर्स) वाले एक विशाल AI की आवश्यकता थी।
  • नया तरीका: PaddleOCR-VL-1.5 एक 0.9 बिलियन पैरामीटर वाला मॉडल है। इसे एक सुव्यवस्थित, उच्च प्रदर्शन वाली स्पोर्ट्स कार के रूप में सोचें। हाथियों (जिनमें से कुछ के 200+ बिलियन पैरामीटर्स होते हैं) की तुलना में यह बहुत छोटा है, लेकिन यह तेज़ चलता है, कम ईंधन का उपयोग करता है, और फिर भी दौड़ में हाथियों को हरा सकता है। यह साबित करता है कि प्रतिभाशाली होने के लिए आपको विशाल होने की आवश्यकता नहीं है।

2. "जादुई चश्मा" (विकृतियों को संभालना)

कल्पना कीजिए कि आप एक मेनू पढ़ रहे हैं जबकि कोई मेज को हिला रहा है, लाइटें झिलमिला रही हैं, और कागज मुड़ा हुआ है। एक सामान्य पाठक हार मान लेगा।

  • समस्या: वास्तविक दुनिया के दस्तावेज़ शायद ही कभी पूर्ण होते हैं। उन्हें टेढ़ा स्कैन किया जाता है, गर्मी से मुड़ा हुआ होता है, या फोन स्क्रीन के कारण अजीब पैटर्न (मोइरे) के साथ फोटो लिया जाता है।
  • समाधान: यह नया मॉडल विशेष "जादुई चश्मा" (जिसे PP-DocLayoutV3 कहा जाता है) पहनता है।
    • केवल एक पैराग्राफ के चारों ओर एक बॉक्स देखने के बजाय, यह टेक्स्ट के सटीक आकार को देखता है, भले ही वह किसी प्रेट्ज़ल (pretzel) की तरह मुड़ा हुआ हो।
    • यह तुरंत पढ़ने के क्रम को समझ सकता है। यदि कोई पेज 45 डिग्री झुका हुआ है, तो यह जानता है कि ऊपर-बाएँ से नीचे-दाएँ पढ़ना है, न कि केवल बाएँ-से-दाएँ। यह शब्दों को पढ़ने से पहले ही अपने दिमाग में उस "टेढ़ेपन" को ठीक कर लेता है।

3. "नई महाशक्तियाँ" (सील और पहचान)

पुराना लाइब्रेरियन टेक्स्ट और टेबल पढ़ सकता था, लेकिन उसकी कुछ कमियां थीं।

  • सील पहचान (Seal Recognition): कल्पना कीजिए कि एक दस्तावेज़ पर टेक्स्ट के ऊपर एक लाल, गोलाकार स्टैम्प है। वह स्टैम्प धुंधला या मुड़ा हुआ हो सकता है। नया लाइब्रेरियन उस स्टैम्प को मानसिक रूप से हटा सकता है और उसके नीचे के टेक्स्ट को पढ़ सकता है, या स्टैम्प के ऊपर के टेक्स्ट को पढ़ सकता है।
  • टेक्स्ट स्पोटिंग (Text Spotting): कभी-कभी टेक्स्ट एक व्यवस्थित पैराग्राफ में नहीं होता; यह एक बिलबोर्ड, एक भित्तिचित्र (graffiti) दीवार, या एक घुमावदार साइन पर हो सकता है। नया लाइब्रेरियन केवल शब्दों को पढ़ता ही नहीं; यह बिल्कुल बता सकता है कि वे शब्द चित्र में कहाँ हैं, भले ही वे हर जगह बिखरे हुए हों।

4. "कठोर परीक्षण" (Real5-OmniDocBench)

यह साबित करने के लिए कि वे वास्तविक दुनिया के लिए तैयार थे, रचनाकारों ने केवल साफ, आदर्श दस्तावेज़ों पर उनका परीक्षण नहीं किया। उन्होंने एक "सर्वाइवल कोर्स" बनाया जिसे Real5-OmniDocBench कहा जाता है।

  • उन्होंने दस्तावेज़ों को लिया और उन्हें पांच टॉर्चर टेस्ट (यातना परीक्षणों) के अधीन किया: स्कैनिंग (खराब गुणवत्ता), वार्पिंग (मुड़े हुए पन्ने), स्क्रीन फोटोग्राफी (स्क्रीन की फोटो लेना), खराब रोशनी, और स्क्यूइंग (टेढ़े कोण)।
  • परिणाम: जबकि अन्य AI मॉडल इन अस्त-व्यस्त परीक्षणों में लड़खड़ा गए और विफल रहे, PaddleOCR-VL-1.5 ने 92.05% स्कोर किया। इसने केवल पास ही नहीं किया; बल्कि इसने दबदबा बनाया, और बहुत बड़े, भारी AI मॉडलों को भी पीछे छोड़ दिया।

5. "असेंबली लाइन" (गति)

एक पूरी किताब पढ़ने में समय लगता है। पुराना तरीका एक पेज पढ़ने, उसे रखने, सोचने, और फिर अगला पेज पढ़ने जैसा था।

  • नया तरीका: टीम ने एक कन्वेयर बेल्ट सिस्टम बनाया।
    • जब "लेआउट टीम" पेज 1 पर पैराग्राफ कहाँ हैं यह समझने में व्यस्त होती है, तब "रीडिंग टीम" पेज 2 को पढ़ना शुरू कर देती है।
    • यह समानांतर प्रसंस्करण (parallel processing) इस लाइब्रेरियन को अविश्वसनीय रूप से तेज़ बनाता है, जो बिना थके प्रति घंटे हजारों पन्नों को प्रोसेस करने में सक्षम है।

निष्कर्ष

PaddleOCR-VL-1.5 एक बड़ी उपलब्धि है क्योंकि यह छोटे आकार को विशाल बुद्धिमत्ता के साथ जोड़ता है। यह पहला उपकरण है जो आपकी जेब से निकले किसी भी अस्त-व्यस्त, मुड़े हुए, टेढ़े-मेढ़े दस्तावेज़ की फोटो को ले सकता है, समझ सकता है कि वह वास्तव में क्या है, विकृतियों को ठीक कर सकता है, टेक्स्ट को पढ़ सकता है (स्टैम्प के नीचे भी), और उसे पूरी तरह से व्यवस्थित कर सकता है—और वह भी एक मानक कंप्यूटर पर बिना किसी सुपरकंप्यूटर की आवश्यकता के।

यह दस्तावेज़ों की अराजक, अस्त-व्यस्त वास्तविक दुनिया को साफ, व्यवस्थित डेटा में बदल देता है जिसका उपयोग कंप्यूटर वास्तव में कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →