← नवीनतम पेपर
💻 computer science

MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios

यह शोध पत्र MME-VideoOCR प्रस्तुत करता है, जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में ऑप्टिकल कैरेक्टर रिकग्निशन क्षमताओं का मूल्यांकन करने के लिए 44 वीडियो परिदृश्यों में 25 कार्यों वाला एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान अत्याधुनिक मॉडल समग्र वीडियो समझ, स्थानिक-कालिक तर्क और क्रॉस-फ्रेम एकीकरण में संघर्ष करते हैं, भले ही शीर्ष प्रदर्शन करने वाली प्रणालियों के साथ भी केवल 73.7% सटीकता प्राप्त की गई हो।

मूल लेखक: Yang Shi, Huanqian Wang, Wulin Xie, Huanyao Zhang, Lijie Zhao, Yi-Fan Zhang, Xinfeng Li, Chaoyou Fu, Zhuoer Wen, Wenting Liu, Zhuoran Zhang, Xinlong Chen, Bohan Zeng, Sihan Yang, Yushuo Guan, Zhang Zh
प्रकाशित 2026-08-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yang Shi, Huanqian Wang, Wulin Xie, Huanyao Zhang, Lijie Zhao, Yi-Fan Zhang, Xinfeng Li, Chaoyou Fu, Zhuoer Wen, Wenting Liu, Zhuoran Zhang, Xinlong Chen, Bohan Zeng, Sihan Yang, Yushuo Guan, Zhang Zhang, Liang Wang, Haoxuan Li, Zhouchen Lin, Yuanxing Zhang, Pengfei Wan, Haotian Wang, Wenjing Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक आधुनिक कंप्यूटर की शांत गूँज में, एक नए प्रकार की बुद्धिमत्ता देखना सीख रही है। ये प्रणालियाँ, जिन्हें मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (multimodal large language models) के रूप में जाना जाता है, केवल शब्दों को ही नहीं, बल्कि छवियों और वीडियो को भी संसाधित करने के लिए डिज़ाइन की गई हैं, और उन्हें समझ की एक एकल धारा में मिला देती हैं। वे स्थिर चित्रों से टेक्स्ट पढ़ने में उल्लेखनीय रूप से कुशल हो गई हैं, जिससे एक सड़क के संकेत या दस्तावेज़ की तस्वीर को उच्च सटीकता के साथ डिजिटल शब्दों में बदला जा सकता है। इस क्षमता ने मशीनों के लिए दुनिया में नेविगेट करने, निर्देश पढ़ने और सूचना को व्यवस्थित करने के द्वार खोल दिए हैं। हालाँकि, वास्तविक दुनिया शायद ही कभी स्थिर होती है। यह चलती है, बदलती है और परिवर्तित होती है। जब इन्हीं बुद्धिमान प्रणालियों से चलते हुए वीडियो से टेक्स्ट पढ़ने के लिए कहा जाता है, तो कार्य कहीं अधिक कठिन हो जाता है। कार के तेजी से गुजरने पर टेक्स्ट धुंधला हो सकता है, केवल एक पल के लिए दिखाई दे सकता है, या समय के विभिन्न क्षणों में बिखरा हुआ हो सकता है। गतिमान टेक्स्ट को समझने के लिए केवल देखने से अधिक की आवश्यकता होती; इसके लिए घटनाओं के एक क्रम में याद रखने, जोड़ने और तर्क करने की आवश्यकता होती है।

शोधकर्ताओं की एक टीम ने अब इस बात पर बारीकी से नज़र डाली है कि ये उन्नत प्रणालियाँ वीडियो की गतिशील दुनिया में टेक्स्ट को कितनी अच्छी तरह संभालती हैं। उन्होंने एक नया परीक्षण मैदान बनाया जिसे MME-VideoOCR कहा गया, जो वीडियो क्लिप्स का एक व्यापक संग्रह है जिसे मशीनों को उन विशिष्ट तरीकों से चुनौती देने के लिए डिज़ाइन किया गया है जिनसे मानव आँखें और मस्तिष्क चलते हुए टेक्स्ट के साथ संघर्ष करते हैं। यह बेंचमार्क केवल कंप्यूटर से एक शब्द पढ़ने के लिए नहीं कहता; यह कंप्यूटर से एक रेसिंग कार पर एक विशिष्ट नंबर खोजने, वाहन के लेन बदलने पर लाइसेंस प्लेट को ट्रैक करने, या एक ऐसे वाक्य को जोड़ने के लिए कहता है जो कई सेकंड के फुटेज में टूटा हुआ और बिखरा हुआ है। शोधकर्ताओं ने 1,464 वीडियो एकत्र किए, जो छोटी क्लिप से लेकर लंबे अनुक्रमों तक फैले हुए थे, जिसमें ड्राइविंग, खाना बनाना, समाचार देखना और व्याख्यान अटेंड करने जैसे चालीस-चार अलग-अलग वास्तविक दुनिया के परिदृश्य शामिल थे। प्रत्येक वीडियो के लिए, उन्होंने दो हजार सावधानीपूर्वक तैयार किए गए प्रश्न और उत्तर बनाए, जिन्हें सटीकता और निष्पक्षता सुनिश्चित करने के लिए मानव विशेषज्ञों द्वारा सत्यापित किया गया था।

जब उन्होंने अठारह सबसे उन्नत वीडियो-रीडिंग मॉडल्स को परीक्षण के लिए रखा, तो परिणामों ने वर्तमान क्षमताओं और वास्तविक दुनिया की मांगों के बीच एक महत्वपूर्ण अंतर को प्रकट किया। यहाँ तक कि सबसे अच्छा प्रदर्शन करने वाली प्रणाली, एक शक्तिशाली मॉडल जिसे Gemini-2.5 Pro के रूप में जाना जाता है, केवल 73.7 प्रतिशत बार ही सही उत्तर दे पाई। हालांकि यह एक उच्च स्कोर लग सकता है, शोधकर्ताओं ने पाया कि मॉडल उन कार्यों पर बुरी तरह विफल रहे जिनमें उन्हें पूरे वीडियो को देखने और समय के साथ सूचनाओं को जोड़ने की आवश्यकता थी। उदाहरण के लिए, जब किसी चलती वस्तु के पथ द्वारा बनाई गई आकृति (अक्षर) को पहचानने के लिए कहा गया, या अलग-अलग फ्रेमों में यादृच्छिक क्रम में दिखने वाले अक्षरों से एक शब्द को पुनर्गठित करने के लिए कहा गया, तो शीर्ष मॉडल्स का स्कोर शून्य के करीब था। वे एक एकल फ्रेम में स्पष्ट रूप से दिखाई देने वाले संकेत को पढ़ सकते थे, लेकिन अक्सर वे अपना संपर्क खो देते थे जब जानकारी बिखरी हुई होती थी।

अध्ययन ने इन मशीनों के सोचने के तरीके में एक अजीब आदत का भी खुलासा किया। धुंधले या गलत वर्तनी वाले टेक्स्ट का सामना करने पर, मॉडल अक्सर उस चीज़ को अनदेखा कर देते थे जो वास्तव में स्क्रीन पर थी और इसके बजाय अनुमान लगाते थे कि टेक्स्ट को क्या होना चाहिए था, जो सामान्य भाषा पैटर्न पर आधारित होता है। यदि किसी वीडियो में एक साइन स्पष्ट रूप से "OFF COURS" (एक अक्षर की कमी के साथ) पढ़ रहा था, तो मॉडल अक्सर आत्मविश्वास के साथ इसे "OFF COURSE" रिपोर्ट करेगा, जो कि शब्दों के सामान्य रूप से कैसे लिखे जाते हैं, इसके आंतरिक ज्ञान को दृश्य साक्ष्य पर प्राथमिकता देता है। दिखने की अपेक्षा पर निर्भर रहने की यह प्रवृत्ति, जो वास्तव में वहां है उसके बजाय, यह सुझाव देती है कि ये प्रणालियाँ अभी भी लिखित भाषा पर अपने प्रशिक्षण से गहराई से प्रभावित हैं, जो कभी-कभी दृश्य सटीकता की कीमत पर होता है।

इसके अलावा, शोधकर्ताओं ने पाया कि वीडियो इनपुट की गुणवत्ता अत्यधिक मायने रखती है। जब उन्होंने मॉडल्स को कम-रिज़ॉल्यूशन वाली छवियां या वीडियो के कम फ्रेम दिए, तो प्रदर्शन तेजी से गिर गया। मशीनों को कहानी को जोड़ने के लिए हाई-डेफिनिशन स्पष्टता और समय के पर्याप्त क्षणों की आवश्यकता थी। यह निष्कर्ष निकालता है कि केवल मॉडल को बड़ा या स्मार्ट बनाना पर्याप्त नहीं है; दुनिया को देखने का उसका तरीका स्पष्ट और निरंतर होना चाहिए। अध्ययन यह निष्कर्ष निकालता है कि हालांकि इन कृत्रिम बुद्धिमिकाओं ने स्थिर चित्र पढ़ने में बड़ी प्रगति की है, फिर भी उनमें गतिमान टेक्स्ट की तरल, खंडित और अक्सर अव्यवस्थित प्रकृति को पूरी तरह से समझने की क्षमता की कमी है। आगे का रास्ता न केवल बेहतर एल्गोरिदम की मांग करता है, बल्कि दृश्य स्मृति के गहरे एकीकरण और आदत के आधार पर अनुमान लगाने की इच्छा के प्रतिरोध की भी मांग करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →