← नवीनतम पेपर
💻 computer science

LightOnOCR: A 1B End-to-End Multilingual Vision-Language Model for State-of-the-Art OCR

यह शोध पत्र LightOnOCR-2-1B को प्रस्तुत करता है, जो एक संक्षिप्त 1B-पैरामीटर वाला एंड-टू-एंड बहुभाषी विजन-लैंग्वेज मॉडल है, जो दस्तावेज़ छवियों को सीधे स्वच्छ टेक्स्ट और स्थानीयकृत बाउंडिंग बॉक्स में परिवर्तित करके OlmOCR-Bench पर अत्याधुनिक (state-of-the-art) OCR प्रदर्शन प्राप्त करता है, जबकि RLVR और चेकपॉइंट मर्जिंग जैसी उन्नत प्रशिक्षण रणनीतियों के माध्यम से पिछले मॉडलों की तुलना में महत्वपूर्ण गति और आकार के लाभ प्रदान करता है।

मूल लेखक: Said Taghadouini, Adrien Cavaillès, Baptiste Aubertin

प्रकाशित 2026-07-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Said Taghadouini, Adrien Cavaillès, Baptiste Aubertin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास दस्तावेजों का एक विशाल पुस्तकालय है: कुछ आधुनिक और स्पष्ट PDF हैं; अन्य पुराने किताबों के धूल भरे, स्कैन किए गए पन्ने हैं जिनमें स्याही फीकी पड़ गई है, टेढ़ा-मेढ़ा टेक्स्ट है और जटिल गणितीय सूत्र हैं। दशकों तक, इन छवियों को संपादन योग्य टेक्स्ट में बदलने की कोशिश करना ऐसा था जैसे किसी पहेली को जोड़ने के लिए पहले एक अलग मशीन बनाना जो किनारों को खोज सके, दूसरी जो रंगों को छाँट सके, और तीसरी जो टुकड़ों को चिपका सके। यह पुराना तरीका (जिसे "पाइपलाइन्स" कहा जाता था) नाजुक था, महंगा था, और अक्सर दस्तावेज़ों के बदलने पर टूट जाता था।

LightOnOCR एक नया, ऑल-इन-वन रोबोट है जो असेंबली लाइन को छोड़ देता है। यह पन्ने की तस्वीर को देखता है और तुरंत टेक्स्ट को "पढ़ता" है, लेआउट को समझता है, और उसे एक ही बार में पूरी तरह से टाइप कर देता है।

यहाँ इस पेपर का एक सरल विवरण दिया गया है:

1. "नन्हा दिग्गज" (द मॉडल)

टीम ने LightOnOCR-2 नामक एक मॉडल बनाया है। अविश्वसनीय रूप से छोटा होने के बावजूद (केवल 1 बिलियन पैरामीटर्स, जो आमतौर पर आवश्यक 8 या 9 बिलियन पैरामीटर वाले मॉडलों की तुलना में बहुत कम है), यह वर्तमान में दुनिया का सबसे शक्तिशाली पाठक है।

  • उपमा: अन्य शीर्ष मॉडलों को विशाल, ईंधन-प्यास वाले ट्रकों के रूप में सोचें जो बहुत कुछ ढो सकते हैं लेकिन धीमे और महंगे होते हैं। LightOnOCR एक फुर्तीली, हाई-स्पीड स्पोर्ट्स कार की तरह है जो समान भार ढोती है लेकिन बहुत कम ईंधन का उपयोग करती है और बहुत तेजी से पहुँचती है।
  • परिणाम: यह मानक परीक्षणों (OlmOCR-Bench) पर सबसे बड़े प्रतिस्पर्धियों को भी पीछे छोड़ देता है, जबकि यह 9 गुना छोटा और काफी तेज़ है।

2. इसने कैसे सीखा (प्रशिक्षण)

इस रोबोट को पढ़ना सिखाने के लिए, टीम ने इसे केवल रैंडम किताबें नहीं खिलाईं। उन्होंने एक "सुपर-शेफ" रेसिपी बनाई:

  • शिक्षक: उन्होंने एक विशाल, अत्यंत बुद्धिमान AI (एक "शिक्षक") का उपयोग किया जिसने लाखों दस्तावेज़ों को पढ़ा और सटीक टेक्स्ट लिखा। LightOnOCR ने इस शिक्षक की नकल करके सीखना शुरू किया।
  • आहार: उन्होंने मॉडल को 43 मिलियन पन्नों का एक विशाल और विविध आहार दिया। इसमें शामिल थे:
    • स्कैन (Scans): यह सीखने के लिए कि बिखरे हुए, पुराने या धुंधले पन्नों को कैसे पढ़ा जाए।
    • फ्रेंच दस्तावेज़: यूरोपीय भाषाओं में वास्तव में कुशल होने के लिए।
    • वैज्ञानिक PDF: जटिल गणितीय सूत्रों और घने टेक्स्ट को संभालने के लिए।
    • उच्च रिज़ॉल्यूशन (High Resolution): उन्होंने मॉडल को 1,540 पिक्सेल चौड़ाई तक के पन्ने देखने की अनुमति दी, ताकि वह छोटे अक्षरों या छोटे प्रतीकों को न छोड़ दे।
  • "खाली पन्ना" ट्रिक: उन्होंने विशेष रूप से मॉडल को सिखाया कि खाली पन्ना देखते समय क्या करना है (बस "कुछ नहीं" कहना) ताकि वह कल्पना करने या बेतुकी बातें दोहराने न लगे।

3. "दूसरा मस्तिष्क" (रीइन्फोर्समेंट लर्निंग)

प्रारंभिक प्रशिक्षण के बाद भी, मॉडल कुछ मूर्खतापूर्ण गलतियाँ करता था, जैसे कि एक ही वाक्य को दोहराने के लूप में फंस जाना या गणितीय प्रतीकों को बिगाड़ देना।

  • समाधान: टीम ने RLVR (वेरिफिएबल रिवॉर्ड्स के साथ रीइन्फोर्समेंट लर्निंग) नामक तकनीक का उपयोग किया। एक सख्त कोच की कल्पना करें जो केवल "अच्छा काम किया" नहीं कहता, बल्कि एक विशिष्ट परीक्षण चलाता है: "क्या आपने गणित सही लिखा? क्या आपने वाक्य समाप्त होने पर बोलना बंद किया?"
  • यदि मॉडल परीक्षण पास करता है, तो उसे इनाम मिलता है। यदि वह विफल होता है (जैसे, लूप में फंसना या खराब फॉर्मेटिंग का उपयोग करना), तो उसे दंड मिलता है। इस "कोच" ने मानवीय हस्तक्षेप के बिना मॉडल की बुरी आदतों को ठीक कर दिया।

4. "बाज जैसी नज़र" (इमेज ढूंढना)

आमतौर पर, OCR मॉडल केवल टेक्स्ट पढ़ते हैं। लेकिन LightOnOCR-2 दस्तावेज़ के भीतर चित्रों की ओर भी इशारा कर सकता है।

  • विशेषता: यह कह सकता है, "यहाँ टेक्स्ट है, और यहाँ X, Y निर्देशांकों पर एक चित्र है।"
  • चुनौती: आमतौर पर, एक मॉडल को दो काम सिखाने से (टेक्स्ट पढ़ना + चित्र ढूंढना) पहला काम खराब हो जाता है।
  • समाधान: उन्होंने मॉडल को पढ़ने के दौरान ही (प्रीट्रेनिंग के दौरान) चित्र ढूंढना सिखाया और फिर अपनी सटीकता को तेज करने के लिए "कोच" (RLVR) का उपयोग किया। उन्होंने "मिक्सिंग" ट्रिक (मॉडल के विभिन्न संस्करणों का औसत निकालना) का भी उपयोग किया ताकि एक अंतिम संस्करण बनाया जा सके जो गुणवत्ता से समझौता किए बिना पढ़ने और चित्र खोजने दोनों में माहिर हो।

5. यह क्या कर सकता है और क्या नहीं

पेपर इसकी सीमाओं के बारे में बहुत स्पष्ट है:

  • यह इसमें माहिर है: मुद्रित दस्तावेज़ (Printed documents), वैज्ञानिक शोध पत्र, जटिल तालिकाएँ, मल्टी-कॉलम लेआउट और लैटिन वर्णमाला (जैसे अंग्रेजी, फ्रेंच, स्पेनिश) का उपयोग करने वाली भाषाएं।
  • इसे संघर्ष करना पड़ता है:
    • हस्तलेखन (Handwriting): यह कर्सिव या बिखरे हुए हस्तलेखन को पढ़ने के लिए डिज़ाइन नहीं किया गया है।
    • गैर-लैटिन लिपियाँ: यह अभी चीनी, जापानी या अरबी जैसी भाषाओं के लिए अनुकूलित नहीं है।

सारांश

LightOnOCR-2 एक कॉम्पैक्ट, तेज़ और अविश्वसनीय रूप से स्मार्ट टूल है जो दस्तावेज़ छवियों को साफ टेक्स्ट में बदल देता है, जो अपने आकार के अन्य किसी भी मॉडल से बेहतर है। यह एक विशाल, उच्च-गुणवत्ता वाले डेटासेट से सीखकर, स्वचालित परीक्षणों द्वारा कोचिंग प्राप्त करके और अपनी गलतियों को सुधारने के लिए चतुर गणितीय ट्रिक्स का उपयोग करके ऐसा करता है। टीम ने मॉडल, डेटा और दस्तावेज़ों में चित्र खोजने के लिए एक नया परीक्षण भी जारी किया है ताकि कोई भी इसका उपयोग कर सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →