← नवीनतम पेपर
💬 NLP

How Robust is OCR-Reasoning? Evaluating OCR-Reasoning Robustness of Vision-Language Models under Visual Perturbations

यह शोधपत्र OCR-Robust को प्रस्तुत करता है, जो दृश्य गड़बड़ी (visual perturbations) के विरुद्ध 18 विजन-लैंग्वेज मॉडलों की मजबूती का मूल्यांकन करने वाला एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि उच्च 'क्लीन एक्यूरेसी' लचीलेपन की गारंटी नहीं देती है और चार्ट तथा तालिकाओं जैसे संरचित डेटा को संभालने वाले मॉडल विशेष रूप से गिरावट के प्रति संवेदनशील होते हैं।

मूल लेखक: Yuxing Cheng, Yuan Wu, Yi Chang

प्रकाशित 2026-06-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuxing Cheng, Yuan Wu, Yi Chang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास सुपर-स्मार्ट रोबोटों की एक टीम है (जिन्हें विजन-लैंग्वेज मॉडल्स कहा जाता है), जो चित्रों से टेक्स्ट पढ़ने में विशेषज्ञ हैं, जैसे कि रसीदें, गणित का होमवर्क, या सड़क के संकेत। वे इसे पढ़ने में इतने माहिर हैं कि वे पढ़े गए टेक्स्ट के आधार पर जटिल पहेलियाँ भी हल कर सकते हैं।

लेकिन समस्या यह है: क्या होता है जब तस्वीर एकदम सही नहीं होती?

वास्तविक दुनिया में, तस्वीरें किसी लैब में नहीं ली जातीं। उन्हें बारिश में, कांपते हाथों से, खराब रोशनी में, या मुड़े हुए कागज पर ली जाती है। यह पेपर पूछता है: जब तस्वीर खराब हो जाती है, तो ये रोबोट कितनी अच्छी तरह काम करते रहते हैं?

लेखकों ने यह पता लगाने के लिए एक नया "तनाव परीक्षण" (stress test) बनाया है जिसे OCR-Robust कहा जाता है। यहाँ उनके अध्ययन का विवरण सरल उपमाओं के साथ दिया गया है:

1. तनाव परीक्षण: "गंदी खिड़की"

रोबोट्स को एक खिड़की के माध्यम से मेनू पढ़ने की कोशिश करने वाले लोगों के रूप में समझें।

  • साफ खिड़की: मेनू स्पष्ट है। रोबोट इसे पूरी तरह से पढ़ लेते हैं।
  • गंदी खिड़कियाँ: शोधकर्ताओं ने खिड़की पर अलग-अलग प्रकार की गंदगी लगाकर यह देखा कि रोबोट इसे कैसे संभालते हैं। उन्होंने केवल एक प्रकार की गंदगी का उपयोग नहीं किया; उन्होंने पाँच विशिष्ट "गंदगी" का परीक्षण किया:
    • ग्लास ब्लर (Glass Blur): जैसे धुंधली खिड़की के माध्यम से देखना।
    • मोशन ब्लर (Motion Blur): जैसे फोटो लेते समय कैमरा हिल रहा हो।
    • इलास्टिक विरूपण (Elastic Deformation): जैसे कागज को खींचा या मरोड़ा गया हो।
    • कलर शिफ्ट (Color Shift): जैसे टेक्स्ट के रंग अजीब तरह से बदल गए हों।
    • बर्फ (Snow): जैसे बर्फ के टुकड़े टेक्स्ट को ढक रहे हों।

उन्होंने इन "गंदगी" के स्तरों को तीन श्रेणियों में परखा: थोड़ी सी गंदगी, मध्यम मात्रा में गंदगी, और बहुत अधिक गंदगी।

2. दो प्रकार की पहेलियाँ

शोधकर्ताओं ने रोबोट्स का दो अलग-अलग प्रकार के पढ़ने के कार्यों पर परीक्षण किया:

  • OCR 1.0 (प्राकृतिक चीजें): सामान्य दस्तावेज़, हस्तलिखित नोट्स, रसीदें और सड़क के संकेत पढ़ना। यह एक सामान्य किताब पढ़ने जैसा है।
  • OCR 2.0 (संरचित चीजें): चार्ट, ज्यामिति आरेख (geometry diagrams), और टेबल पढ़ना। यह एक जटिल स्प्रेडशीट या ब्लूप्रिंट पढ़ने जैसा है जहाँ संख्याओं के साथ-साथ उनकी आकृति और स्थिति भी उतनी ही महत्वपूर्ण होती है।

3. परिणाम: "मजबूत होने का मतलब कठिन होना नहीं है"

टीम ने 18 अलग-अलग रोबोट्स का परीक्षण किया, जिनमें GPT-5, Gemini और ओपन-सोर्स मॉडल जैसे प्रसिद्ध मॉडल शामिल थे। उन्हें यहाँ क्या पता चला:

  • "अमीर" रोबोट जीतते हैं: सबसे महंगे, क्लोज्ड-सोर्स रोबोट (जैसे GPT-5 और Gemini) आम तौर पर सबसे मजबूत थे। वे मुफ्त, ओपन-सोर्स वाले रोबोट्स की तुलना में गंदी खिड़कियों को बेहतर तरीके से संभाल सकते थे।
  • बुद्धिमत्ता \neq मजबूती: यह सबसे बड़ा आश्चर्य था। एक रोबोट जो एक साफ तस्वीर पर अविश्वसनीय रूप से स्मार्ट है, वह जरूरी नहीं कि गंदी तस्वीर होने पर भी मजबूत हो।
    • उपमा: कल्पना कीजिए कि एक शतरंज का ग्रैंडमास्टर जो एक शांत कमरे में किसी को भी हरा सकता है, लेकिन अगर आप एक शोर वाले, हिलते हुए ट्रक में शतरंज खेलना शुरू कर दें, तो वह भ्रमित हो जाता है और गलतियाँ करने लगता है। कुछ "सोचने वाले" (Thinking) मॉडल्स साफ छवियों पर कठिन पहेलियाँ सुलझाने में बेहतरीन थे, लेकिन जब छवि विकृत हो गई, तो उनका प्रदर्शन साधारण मॉडल्स की तुलना में कहीं अधिक तेजी से गिरा।
  • चार्ट नाजुक होते हैं: रोबोट गंदी रसीदों (OCR 1.0) को पढ़ने में चार्ट (OCR 2.0) की तुलना में बहुत बेहतर थे।
    • उपमा: यदि आप किसी वाक्य पर कुछ लकीरें खींच देते हैं, तो आप अक्सर शब्द का अनुमान लगा सकते हैं। लेकिन यदि आप एक ग्राफ पर लकीरें खींच देते हैं, तो आप लाइन और नंबर के बीच के संबंध को खो सकते हैं, जिससे पूरा चार्ट समझना असंभव हो जाता है। "संरचित" डेटा बहुत अधिक नाजुक होता है।
  • "दो-चरणीय" टीम विफल होती है: कुछ टीमों ने काम को विभाजित करने की कोशिश की: एक रोबोट टेक्स्ट पढ़ता है, और दूसरा रोबोट पहेली हल करता है।
    • उपमा: यह एक अनुवादक द्वारा एक गंदे दस्तावेज़ को पढ़ने और फिर नोट्स को वकील को सौंपने जैसा है ताकि वह केस सुलझा सके। यदि अनुवादक गंदगी के कारण एक अक्षर भी गलत पढ़ लेता है, तो वकील को गलत तथ्य मिलते हैं और वह केस हार जाता है। यदि पहला चरण कमजोर है, तो पूरी श्रृंखला टूट जाती है।

4. "चेन ऑफ थॉट" (Chain of Thought) का जाल

शोधकर्ताओं ने रोबोट्स से उत्तर देने से पहले "ज़ोर से सोचने" (Chain of Thought) के लिए भी कहा।

  • परिणाम: इससे उन्हें साफ तस्वीरों पर सही उत्तर पाने में मदद मिली। लेकिन गंदी तस्वीरों पर, इससे ज्यादा मदद नहीं मिली।
  • निष्कर्ष: सिर्फ इसलिए कि एक रोबोट अधिक समय तक "सोचने" में लगाता है, इसका मतलब यह नहीं है कि वह एक टूटी हुई इमेज को ठीक कर सकता है। यदि विजुअल जानकारी खराब है, तो तर्क प्रक्रिया (reasoning process) उसे जादू से वापस जीवित नहीं कर सकती।

सारांश

पेपर यह निष्कर्ष निकालता है कि पढ़ने में अच्छा होना, मजबूत होने के समान नहीं है।

सिर्फ इसलिए कि एक मॉडल एक परफेक्ट टेस्ट पर 99% स्कोर करता है, इसका मतलब यह नहीं है कि वह वास्तविक दुनिया में काम करेगा जहाँ तस्वीरें धुंधली, मुड़ी हुई या बारिश वाली होती हैं। यह अध्ययन दिखाता है कि इन AI सिस्टमों के वास्तव में उपयोगी होने के लिए, उन्हें केवल "परफेक्ट" इनपुट के लिए नहीं, बल्कि "मेसी" (messy) इनपुट को संभालने के लिए प्रशिक्षित करने की आवश्यकता है। वर्तमान में, यहाँ तक कि सबसे स्मार्ट मॉडल भी आश्चर्यजनक रूप से नाजुक हैं जब दृश्य दुनिया थोड़ी सी भी गंदी हो जाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →