MonkeyOCRv2: A Visual-Text Foundation Model for Document AI
MonkeyOCRv2 एक विजुअल-टेक्स्ट फाउंडेशन मॉडल है जिसे इमेज-टू-टेक्स्ट जनरेशन और पिक्सेल-लेवल रिकंस्ट्रक्शन की दोहरी रणनीति का उपयोग करके 113-मिलियन-इमेज के विशाल डॉक्यूमेंट कॉर्पस पर प्रीट्रेन किया गया है, जो डॉक्यूमेंट एनालिसिस कार्यों में मौजूदा एनकोडर्स से काफी बेहतर प्रदर्शन करता है और मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में एकीकृत होने पर अत्यधिक कुशल, स्टेट-ऑफ-द-आर्ट डॉक्यूमेंट पार्सिंग और अंडरस्टैंडिंग को सक्षम बनाता है।