OCR or Not? Rethinking Document Information Extraction in the MLLMs Era with Real-World Large-Scale Datasets
تقدم هذه الورقة دراسة معيارية واسعة النطاق تثبت أن النماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) القوية يمكنها تحقيق أداء في استخراج معلومات المستندات يضاهي مسارات العمل التقليدية المعززة بتقنية التعرف الضوئي على الحروف (OCR) باستخدام مدخلات الصور فقط، مع توفير إطار عمل آلي لتحليل الأخطاء وإرشادات عملية لتحسين المخطط والتعليمات.