← नवीनतम पेपर
💻 computer science

PP-OCRv5: A Specialized 5M-Parameter Model Rivaling Billion-Parameter Vision-Language Models on OCR Tasks

यह शोध पत्र PP-OCRv5 को प्रस्तुत करता है, जो एक अत्यधिक कुशल 5-मिलियन-पैरामीटर वाला OCR मॉडल है जो सटीकता में अरबों-पैरामीटर वाले विजन-लैंग्वेज मॉडल्स की बराबरी करता है और साथ ही बेहतर टेक्स्ट लोकलाइजेशन (पाठ स्थानीयकरण) और कम मतिभ्रम (hallucinations) प्रदान करता है, जो यह प्रदर्शित करता है कि उच्च-प्रदर्शन वाले OCR प्राप्त करने के लिए मॉडल का पैमाना (scale) होने की तुलना में डेटा की गुणवत्ता और विविधता अधिक महत्वपूर्ण है।

मूल लेखक: Cheng Cui, Yubo Zhang, Ting Sun, Xueqing Wang, Hongen Liu, Manhui Lin, Yue Zhang, Tingquan Gao, Changda Zhou, Jiaxuan Liu, Zelun Zhang, Jing Zhang, Jun Zhang, Yi Liu

प्रकाशित 2026-03-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Cheng Cui, Yubo Zhang, Ting Sun, Xueqing Wang, Hongen Liu, Manhui Lin, Yue Zhang, Tingquan Gao, Changda Zhou, Jiaxuan Liu, Zelun Zhang, Jing Zhang, Jun Zhang, Yi Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को किराने की सूची (grocery list) से हाथ से लिखी गई एक अस्त-व्यस्त नोट पढ़ने के लिए सिखाने की कोशिश कर रहे हैं।

लंबे समय तक, तकनीकी दुनिया का मानना था कि रोबोट को एक बेहतरीन पाठक बनाने का एकमात्र तरीका उसे विशाल बनाना है। उन्होंने सोचा, "यदि हम रोबोट को एक अरब न्यूरॉन्स (पैरामीटर्स) वाला मस्तिष्क दें, तो वह सब कुछ पूरी तरह से समझ जाएगा।" ये विशाल रोबोट ब्रह्मांड की हर किताब पढ़ चुके अति-बुद्धिमान पुस्तकालयाध्यक्षों (librarians) की तरह हैं। वे जटिल कहानियों को समझने या किसी चित्र के बारे में गहरे सवाल पूछने में अद्भुत हैं।

लेकिन समस्या यह है: ये विशाल पुस्तकालयाध्यक्ष भोंडे, धीमे और महंगे होते हैं।

  • भोंडे (Clumsy): यदि आप उनसे किसी पन्ने पर किसी शब्द की सटीक स्थिति बताने को कहें, तो वे पूरे पैराग्राफ की ओर इशारा करते हुए केवल हाथ हिला सकते हैं।
  • भ्रम (Hallucinations): कभी-कभी, वे इतने आत्मविश्वासी हो जाते हैं कि वे ऐसे शब्द "गढ़" लेते हैं जो वहां हैं ही नहीं (जैसे कि "apricot" को "apple" पढ़ लेना)।
  • धीमे: उन्हें सोचने में बहुत समय लगता है और उन्हें चलाने के लिए एक विशाल सुपरकंप्यूटर की आवश्यकता होती है।

PP-OCRv5 से मिलिए: एक कुशल शिल्पकार (The Master Artisan)।

Baidu की टीम ने एक अलग सवाल पूछा: "क्या हमें किराने की सूची पढ़ने के लिए एक अरब-न्यूरॉन वाले विशालकाय जीव की आवश्यकता है, या हमें बस एक बहुत अच्छी तरह से प्रशिक्षित, छोटे विशेषज्ञ की आवश्यकता है?"

उन्होंने PP-OCRv5 बनाया, जिसमें केवल 5 मिलियन पैरामीटर्स हैं। एक उपमा (analogy) का उपयोग करने के लिए, यदि एक अरब-पैरामीटर वाले मॉडल एक 100 टन के मालवाहक जहाज की तरह हैं, तो PP-OCRv5 एक सुव्यवस्थित, तेज़ गति वाली स्पीडबोट है। यह छोटी है, लेकिन अविश्वसनीय रूप से तेज़ और सटीक है।

उन्होंने एक छोटी नाव को इतना तेज़ कैसे बनाया?

उन्होंने महसूस किया कि रहस्य नाव को बड़ा बनाने में नहीं था; बल्कि यह था कि वे नाव को क्या खिला रहे थे। उन्होंने प्रशिक्षण डेटा (training data) को एक शानदार भोजन के लिए सामग्री की तरह माना, और तीन विशिष्ट गुणों पर ध्यान केंद्रित किया:

1. "गोल्डीलॉक्स" कठिनाई (डेटा की कठिनाई)

कल्पना कीजिए कि आप एक बच्चे को पढ़ना सिखा रहे हैं।

  • यदि आप उसे केवल "A" शब्द वाली किताब देते हैं, तो वह ऊब जाएगा और कुछ नहीं सीखेगा।
  • यदि आप उसे क्वांटम भौतिकी की किताब देते हैं, तो वह निराश होकर हार मान लेगा।
  • सही संतुलन (The Sweet Spot): आप उसे एक ऐसी किताब देते हैं जो चुनौतीपूर्ण लेकिन हल करने योग्य हो।

शोधकर्ताओं ने पाया कि सबसे अच्छा प्रशिक्षण डेटा न तो सबसे आसान चीज़ थी (जो बहुत सरल है) और न ही सबसे कठिन चीज़ (जो अक्सर अस्त-व्यस्त और भ्रमित करने वाली होती है)। उन्होंने डेटा का एक "गोल्डीलॉक्स ज़ोन" खोजा जो बस इतना कठिन था कि मॉडल को नए कौशल सिखा सके, लेकिन उसे भ्रमित न करे। उन्होंने "उबाऊ" आसान चीज़ों और "टूटी हुई" कठिन चीज़ों को हटा दिया, और केवल सटीक मध्य मार्ग को रखा।

2. "कठोर कोच" (डेटा की सटीकता)

आमतौर पर, यदि कोई शिक्षक गलती करता है (जैसे "cat" लिखना लेकिन "dog" कहना), तो छात्र भ्रमित हो जाता है।
शोधकर्ताओं ने कुछ आश्चर्यजनक खोजा: PP-OCRv5 एक कठोर छात्र है। भले ही प्रशिक्षण डेटा में कुछ गलतियाँ या गलत लेबल (जैसे कि 20% नोट्स थोड़े गलत थे) हों, मॉडल क्रैश नहीं हुआ। इसने अक्षरों के चित्र को देखना सीखा, बजाय इसके कि वह अंधाधुंध शिक्षक के नोट्स पर भरोसा करे। इसका मतलब है कि उन्हें हर एक छवि को पूरी तरह से लेबल करने के लिए करोड़ों डॉलर खर्च करने की आवश्यकता नहीं थी; वे "काफी हद तक सही" डेटा का उपयोग कर सकते थे और फिर भी सटीक परिणाम प्राप्त कर सकते थे।

3. "विश्व यात्री" (डेटा की विविधता)

यह सबसे महत्वपूर्ण हिस्सा है। कल्पना कीजिए कि आप एक शेफ को प्रशिक्षित कर रहे हैं।

  • यदि आप उन्हें केवल पिज्जा बनाना सिखाते हैं, तो वे पिज्जा में तो बहुत अच्छे होंगे लेकिन सुशी बनाने में बहुत खराब।
  • यदि आप उन्हें पिज्जा, सुशी, टैकोस और सूप बनाना सिखाते हैं, तो वे एक मास्टर शेफ बन जाते हैं।

शोधकर्ताओं ने महसूस किया कि केवल अधिक पिज्जा डेटा होने से मदद नहीं मिली। उन्हें विविधता की आवश्यकता थी। उन्होंने मॉडल को पूरी दुनिया का डेटा खिलाया: प्राचीन पुस्तकें, हस्तलिखित नोट्स, नियॉन संकेत, लंबवत (vertical) टेक्स्ट और अस्त-व्यस्त रसीदें। उन्होंने सुनिश्चित किया कि मॉडल ने हर संभव "स्वाद" को देखा। क्योंकि मॉडल ने उदाहरणों की एक विस्तृत श्रृंखला देखी, इसलिए उसने केवल विशिष्ट शब्दों को रटने के बजाय, पढ़ने के सार को सीखा।

परिणाम: दक्षता का एक चमत्कार

एक छोटे, कुशल इंजन को इस "परफेक्ट रेसिपी" के डेटा के साथ जोड़कर, PP-OCRv5 ने कुछ चौंकाने वाला हासिल किया:

  • यह अरबों-पैरामीटर वाले विशाल मॉडलों जितनी सटीकता से पढ़ता है।
  • यह लेजर जैसी सटीकता के साथ शब्दों की ओर इशारा करता है (अस्पष्ट इशारे नहीं)।
  • यह शायद ही कभी नकली शब्द बनाता है (कोई भ्रम/hallucination नहीं)।
  • यह एक साधारण फोन या छोटे सर्वर पर चलता है, जिसमें बहुत कम पैसा और ऊर्जा खर्च होती है।

मुख्य निष्कर्ष

यह पेपर यह सिद्ध करता है कि "बड़ा ही बेहतर है" के युग में, स्मार्ट होना बेहतर है। आपको किसी विशिष्ट कार्य को अच्छी तरह से करने के लिए अरबों डॉलर के दिमाग की आवश्यकता नहीं है। यदि आप एक छोटे, विशिष्ट कार्यकर्ता को सही मिश्रण—चुनौतीपूर्ण, विविध और उच्च गुणवत्ता वाले अनुभव—के साथ प्रशिक्षित करते हैं, तो वे अपने विशिष्ट क्षेत्र में एक विशाल, भोंडे जीनियस से बेहतर प्रदर्शन कर सकते हैं।

PP-OCRv5 इस बात का प्रमाण है कि प्रशिक्षण की गुणवत्ता, आकार की मात्रा से बेहतर होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →