LightOnOCR: A 1B End-to-End Multilingual Vision-Language Model for State-of-the-Art OCR
यह शोध पत्र LightOnOCR-2-1B को प्रस्तुत करता है, जो एक संक्षिप्त 1B-पैरामीटर वाला एंड-टू-एंड बहुभाषी विजन-लैंग्वेज मॉडल है, जो दस्तावेज़ छवियों को सीधे स्वच्छ टेक्स्ट और स्थानीयकृत बाउंडिंग बॉक्स में परिवर्तित करके OlmOCR-Bench पर अत्याधुनिक (state-of-the-art) OCR प्रदर्शन प्राप्त करता है, जबकि RLVR और चेकपॉइंट मर्जिंग जैसी उन्नत प्रशिक्षण रणनीतियों के माध्यम से पिछले मॉडलों की तुलना में महत्वपूर्ण गति और आकार के लाभ प्रदान करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास दस्तावेजों का एक विशाल पुस्तकालय है: कुछ आधुनिक और स्पष्ट PDF हैं; अन्य पुराने किताबों के धूल भरे, स्कैन किए गए पन्ने हैं जिनमें स्याही फीकी पड़ गई है, टेढ़ा-मेढ़ा टेक्स्ट है और जटिल गणितीय सूत्र हैं। दशकों तक, इन छवियों को संपादन योग्य टेक्स्ट में बदलने की कोशिश करना ऐसा था जैसे किसी पहेली को जोड़ने के लिए पहले एक अलग मशीन बनाना जो किनारों को खोज सके, दूसरी जो रंगों को छाँट सके, और तीसरी जो टुकड़ों को चिपका सके। यह पुराना तरीका (जिसे "पाइपलाइन्स" कहा जाता था) नाजुक था, महंगा था, और अक्सर दस्तावेज़ों के बदलने पर टूट जाता था।
LightOnOCR एक नया, ऑल-इन-वन रोबोट है जो असेंबली लाइन को छोड़ देता है। यह पन्ने की तस्वीर को देखता है और तुरंत टेक्स्ट को "पढ़ता" है, लेआउट को समझता है, और उसे एक ही बार में पूरी तरह से टाइप कर देता है।
यहाँ इस पेपर का एक सरल विवरण दिया गया है:
1. "नन्हा दिग्गज" (द मॉडल)
टीम ने LightOnOCR-2 नामक एक मॉडल बनाया है। अविश्वसनीय रूप से छोटा होने के बावजूद (केवल 1 बिलियन पैरामीटर्स, जो आमतौर पर आवश्यक 8 या 9 बिलियन पैरामीटर वाले मॉडलों की तुलना में बहुत कम है), यह वर्तमान में दुनिया का सबसे शक्तिशाली पाठक है।
- उपमा: अन्य शीर्ष मॉडलों को विशाल, ईंधन-प्यास वाले ट्रकों के रूप में सोचें जो बहुत कुछ ढो सकते हैं लेकिन धीमे और महंगे होते हैं। LightOnOCR एक फुर्तीली, हाई-स्पीड स्पोर्ट्स कार की तरह है जो समान भार ढोती है लेकिन बहुत कम ईंधन का उपयोग करती है और बहुत तेजी से पहुँचती है।
- परिणाम: यह मानक परीक्षणों (OlmOCR-Bench) पर सबसे बड़े प्रतिस्पर्धियों को भी पीछे छोड़ देता है, जबकि यह 9 गुना छोटा और काफी तेज़ है।
2. इसने कैसे सीखा (प्रशिक्षण)
इस रोबोट को पढ़ना सिखाने के लिए, टीम ने इसे केवल रैंडम किताबें नहीं खिलाईं। उन्होंने एक "सुपर-शेफ" रेसिपी बनाई:
- शिक्षक: उन्होंने एक विशाल, अत्यंत बुद्धिमान AI (एक "शिक्षक") का उपयोग किया जिसने लाखों दस्तावेज़ों को पढ़ा और सटीक टेक्स्ट लिखा। LightOnOCR ने इस शिक्षक की नकल करके सीखना शुरू किया।
- आहार: उन्होंने मॉडल को 43 मिलियन पन्नों का एक विशाल और विविध आहार दिया। इसमें शामिल थे:
- स्कैन (Scans): यह सीखने के लिए कि बिखरे हुए, पुराने या धुंधले पन्नों को कैसे पढ़ा जाए।
- फ्रेंच दस्तावेज़: यूरोपीय भाषाओं में वास्तव में कुशल होने के लिए।
- वैज्ञानिक PDF: जटिल गणितीय सूत्रों और घने टेक्स्ट को संभालने के लिए।
- उच्च रिज़ॉल्यूशन (High Resolution): उन्होंने मॉडल को 1,540 पिक्सेल चौड़ाई तक के पन्ने देखने की अनुमति दी, ताकि वह छोटे अक्षरों या छोटे प्रतीकों को न छोड़ दे।
- "खाली पन्ना" ट्रिक: उन्होंने विशेष रूप से मॉडल को सिखाया कि खाली पन्ना देखते समय क्या करना है (बस "कुछ नहीं" कहना) ताकि वह कल्पना करने या बेतुकी बातें दोहराने न लगे।
3. "दूसरा मस्तिष्क" (रीइन्फोर्समेंट लर्निंग)
प्रारंभिक प्रशिक्षण के बाद भी, मॉडल कुछ मूर्खतापूर्ण गलतियाँ करता था, जैसे कि एक ही वाक्य को दोहराने के लूप में फंस जाना या गणितीय प्रतीकों को बिगाड़ देना।
- समाधान: टीम ने RLVR (वेरिफिएबल रिवॉर्ड्स के साथ रीइन्फोर्समेंट लर्निंग) नामक तकनीक का उपयोग किया। एक सख्त कोच की कल्पना करें जो केवल "अच्छा काम किया" नहीं कहता, बल्कि एक विशिष्ट परीक्षण चलाता है: "क्या आपने गणित सही लिखा? क्या आपने वाक्य समाप्त होने पर बोलना बंद किया?"
- यदि मॉडल परीक्षण पास करता है, तो उसे इनाम मिलता है। यदि वह विफल होता है (जैसे, लूप में फंसना या खराब फॉर्मेटिंग का उपयोग करना), तो उसे दंड मिलता है। इस "कोच" ने मानवीय हस्तक्षेप के बिना मॉडल की बुरी आदतों को ठीक कर दिया।
4. "बाज जैसी नज़र" (इमेज ढूंढना)
आमतौर पर, OCR मॉडल केवल टेक्स्ट पढ़ते हैं। लेकिन LightOnOCR-2 दस्तावेज़ के भीतर चित्रों की ओर भी इशारा कर सकता है।
- विशेषता: यह कह सकता है, "यहाँ टेक्स्ट है, और यहाँ X, Y निर्देशांकों पर एक चित्र है।"
- चुनौती: आमतौर पर, एक मॉडल को दो काम सिखाने से (टेक्स्ट पढ़ना + चित्र ढूंढना) पहला काम खराब हो जाता है।
- समाधान: उन्होंने मॉडल को पढ़ने के दौरान ही (प्रीट्रेनिंग के दौरान) चित्र ढूंढना सिखाया और फिर अपनी सटीकता को तेज करने के लिए "कोच" (RLVR) का उपयोग किया। उन्होंने "मिक्सिंग" ट्रिक (मॉडल के विभिन्न संस्करणों का औसत निकालना) का भी उपयोग किया ताकि एक अंतिम संस्करण बनाया जा सके जो गुणवत्ता से समझौता किए बिना पढ़ने और चित्र खोजने दोनों में माहिर हो।
5. यह क्या कर सकता है और क्या नहीं
पेपर इसकी सीमाओं के बारे में बहुत स्पष्ट है:
- यह इसमें माहिर है: मुद्रित दस्तावेज़ (Printed documents), वैज्ञानिक शोध पत्र, जटिल तालिकाएँ, मल्टी-कॉलम लेआउट और लैटिन वर्णमाला (जैसे अंग्रेजी, फ्रेंच, स्पेनिश) का उपयोग करने वाली भाषाएं।
- इसे संघर्ष करना पड़ता है:
- हस्तलेखन (Handwriting): यह कर्सिव या बिखरे हुए हस्तलेखन को पढ़ने के लिए डिज़ाइन नहीं किया गया है।
- गैर-लैटिन लिपियाँ: यह अभी चीनी, जापानी या अरबी जैसी भाषाओं के लिए अनुकूलित नहीं है।
सारांश
LightOnOCR-2 एक कॉम्पैक्ट, तेज़ और अविश्वसनीय रूप से स्मार्ट टूल है जो दस्तावेज़ छवियों को साफ टेक्स्ट में बदल देता है, जो अपने आकार के अन्य किसी भी मॉडल से बेहतर है। यह एक विशाल, उच्च-गुणवत्ता वाले डेटासेट से सीखकर, स्वचालित परीक्षणों द्वारा कोचिंग प्राप्त करके और अपनी गलतियों को सुधारने के लिए चतुर गणितीय ट्रिक्स का उपयोग करके ऐसा करता है। टीम ने मॉडल, डेटा और दस्तावेज़ों में चित्र खोजने के लिए एक नया परीक्षण भी जारी किया है ताकि कोई भी इसका उपयोग कर सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।