MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
यह शोध पत्र MME-VideoOCR प्रस्तुत करता है, जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में ऑप्टिकल कैरेक्टर रिकग्निशन क्षमताओं का मूल्यांकन करने के लिए 44 वीडियो परिदृश्यों में 25 कार्यों वाला एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान अत्याधुनिक मॉडल समग्र वीडियो समझ, स्थानिक-कालिक तर्क और क्रॉस-फ्रेम एकीकरण में संघर्ष करते हैं, भले ही शीर्ष प्रदर्शन करने वाली प्रणालियों के साथ भी केवल 73.7% सटीकता प्राप्त की गई हो।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक आधुनिक कंप्यूटर की शांत गूँज में, एक नए प्रकार की बुद्धिमत्ता देखना सीख रही है। ये प्रणालियाँ, जिन्हें मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (multimodal large language models) के रूप में जाना जाता है, केवल शब्दों को ही नहीं, बल्कि छवियों और वीडियो को भी संसाधित करने के लिए डिज़ाइन की गई हैं, और उन्हें समझ की एक एकल धारा में मिला देती हैं। वे स्थिर चित्रों से टेक्स्ट पढ़ने में उल्लेखनीय रूप से कुशल हो गई हैं, जिससे एक सड़क के संकेत या दस्तावेज़ की तस्वीर को उच्च सटीकता के साथ डिजिटल शब्दों में बदला जा सकता है। इस क्षमता ने मशीनों के लिए दुनिया में नेविगेट करने, निर्देश पढ़ने और सूचना को व्यवस्थित करने के द्वार खोल दिए हैं। हालाँकि, वास्तविक दुनिया शायद ही कभी स्थिर होती है। यह चलती है, बदलती है और परिवर्तित होती है। जब इन्हीं बुद्धिमान प्रणालियों से चलते हुए वीडियो से टेक्स्ट पढ़ने के लिए कहा जाता है, तो कार्य कहीं अधिक कठिन हो जाता है। कार के तेजी से गुजरने पर टेक्स्ट धुंधला हो सकता है, केवल एक पल के लिए दिखाई दे सकता है, या समय के विभिन्न क्षणों में बिखरा हुआ हो सकता है। गतिमान टेक्स्ट को समझने के लिए केवल देखने से अधिक की आवश्यकता होती; इसके लिए घटनाओं के एक क्रम में याद रखने, जोड़ने और तर्क करने की आवश्यकता होती है।
शोधकर्ताओं की एक टीम ने अब इस बात पर बारीकी से नज़र डाली है कि ये उन्नत प्रणालियाँ वीडियो की गतिशील दुनिया में टेक्स्ट को कितनी अच्छी तरह संभालती हैं। उन्होंने एक नया परीक्षण मैदान बनाया जिसे MME-VideoOCR कहा गया, जो वीडियो क्लिप्स का एक व्यापक संग्रह है जिसे मशीनों को उन विशिष्ट तरीकों से चुनौती देने के लिए डिज़ाइन किया गया है जिनसे मानव आँखें और मस्तिष्क चलते हुए टेक्स्ट के साथ संघर्ष करते हैं। यह बेंचमार्क केवल कंप्यूटर से एक शब्द पढ़ने के लिए नहीं कहता; यह कंप्यूटर से एक रेसिंग कार पर एक विशिष्ट नंबर खोजने, वाहन के लेन बदलने पर लाइसेंस प्लेट को ट्रैक करने, या एक ऐसे वाक्य को जोड़ने के लिए कहता है जो कई सेकंड के फुटेज में टूटा हुआ और बिखरा हुआ है। शोधकर्ताओं ने 1,464 वीडियो एकत्र किए, जो छोटी क्लिप से लेकर लंबे अनुक्रमों तक फैले हुए थे, जिसमें ड्राइविंग, खाना बनाना, समाचार देखना और व्याख्यान अटेंड करने जैसे चालीस-चार अलग-अलग वास्तविक दुनिया के परिदृश्य शामिल थे। प्रत्येक वीडियो के लिए, उन्होंने दो हजार सावधानीपूर्वक तैयार किए गए प्रश्न और उत्तर बनाए, जिन्हें सटीकता और निष्पक्षता सुनिश्चित करने के लिए मानव विशेषज्ञों द्वारा सत्यापित किया गया था।
जब उन्होंने अठारह सबसे उन्नत वीडियो-रीडिंग मॉडल्स को परीक्षण के लिए रखा, तो परिणामों ने वर्तमान क्षमताओं और वास्तविक दुनिया की मांगों के बीच एक महत्वपूर्ण अंतर को प्रकट किया। यहाँ तक कि सबसे अच्छा प्रदर्शन करने वाली प्रणाली, एक शक्तिशाली मॉडल जिसे Gemini-2.5 Pro के रूप में जाना जाता है, केवल 73.7 प्रतिशत बार ही सही उत्तर दे पाई। हालांकि यह एक उच्च स्कोर लग सकता है, शोधकर्ताओं ने पाया कि मॉडल उन कार्यों पर बुरी तरह विफल रहे जिनमें उन्हें पूरे वीडियो को देखने और समय के साथ सूचनाओं को जोड़ने की आवश्यकता थी। उदाहरण के लिए, जब किसी चलती वस्तु के पथ द्वारा बनाई गई आकृति (अक्षर) को पहचानने के लिए कहा गया, या अलग-अलग फ्रेमों में यादृच्छिक क्रम में दिखने वाले अक्षरों से एक शब्द को पुनर्गठित करने के लिए कहा गया, तो शीर्ष मॉडल्स का स्कोर शून्य के करीब था। वे एक एकल फ्रेम में स्पष्ट रूप से दिखाई देने वाले संकेत को पढ़ सकते थे, लेकिन अक्सर वे अपना संपर्क खो देते थे जब जानकारी बिखरी हुई होती थी।
अध्ययन ने इन मशीनों के सोचने के तरीके में एक अजीब आदत का भी खुलासा किया। धुंधले या गलत वर्तनी वाले टेक्स्ट का सामना करने पर, मॉडल अक्सर उस चीज़ को अनदेखा कर देते थे जो वास्तव में स्क्रीन पर थी और इसके बजाय अनुमान लगाते थे कि टेक्स्ट को क्या होना चाहिए था, जो सामान्य भाषा पैटर्न पर आधारित होता है। यदि किसी वीडियो में एक साइन स्पष्ट रूप से "OFF COURS" (एक अक्षर की कमी के साथ) पढ़ रहा था, तो मॉडल अक्सर आत्मविश्वास के साथ इसे "OFF COURSE" रिपोर्ट करेगा, जो कि शब्दों के सामान्य रूप से कैसे लिखे जाते हैं, इसके आंतरिक ज्ञान को दृश्य साक्ष्य पर प्राथमिकता देता है। दिखने की अपेक्षा पर निर्भर रहने की यह प्रवृत्ति, जो वास्तव में वहां है उसके बजाय, यह सुझाव देती है कि ये प्रणालियाँ अभी भी लिखित भाषा पर अपने प्रशिक्षण से गहराई से प्रभावित हैं, जो कभी-कभी दृश्य सटीकता की कीमत पर होता है।
इसके अलावा, शोधकर्ताओं ने पाया कि वीडियो इनपुट की गुणवत्ता अत्यधिक मायने रखती है। जब उन्होंने मॉडल्स को कम-रिज़ॉल्यूशन वाली छवियां या वीडियो के कम फ्रेम दिए, तो प्रदर्शन तेजी से गिर गया। मशीनों को कहानी को जोड़ने के लिए हाई-डेफिनिशन स्पष्टता और समय के पर्याप्त क्षणों की आवश्यकता थी। यह निष्कर्ष निकालता है कि केवल मॉडल को बड़ा या स्मार्ट बनाना पर्याप्त नहीं है; दुनिया को देखने का उसका तरीका स्पष्ट और निरंतर होना चाहिए। अध्ययन यह निष्कर्ष निकालता है कि हालांकि इन कृत्रिम बुद्धिमिकाओं ने स्थिर चित्र पढ़ने में बड़ी प्रगति की है, फिर भी उनमें गतिमान टेक्स्ट की तरल, खंडित और अक्सर अव्यवस्थित प्रकृति को पूरी तरह से समझने की क्षमता की कमी है। आगे का रास्ता न केवल बेहतर एल्गोरिदम की मांग करता है, बल्कि दृश्य स्मृति के गहरे एकीकरण और आदत के आधार पर अनुमान लगाने की इच्छा के प्रतिरोध की भी मांग करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।