Reading or Guessing? Visual Grounding Failures of Vision-Language Models for OCR in Ancient Greek Editions
यह शोध पत्र प्रदर्शित करता है कि प्राचीन ग्रीक ग्रंथों पर OCR करने वाले विजन-लैंग्वेज मॉडल्स (VLMs) अक्सर प्रवाहपूर्ण लेकिन दृश्य रूप से अग्राउंडेड (visually ungrounded) त्रुटियाँ उत्पन्न करने के लिए भाषाई पूर्वग्रहों (language priors) पर निर्भर करते हैं, जो एक ऐसा विफलता मोड है जो डिकोड-टाइम हस्तक्षेपों के साथ भी बना रहता है और पारंपरिक OCR प्रणालियों के शोर पैटर्न से काफी भिन्न है।