← أحدث الأبحاث
💻 computer science

Optical Character Recognition of Historical Moroccan Arabic Calligraphy Using Transformer-Based TrOCR

تقترح هذه الورقة إطار عمل TrOCR القائم على نموذج Transformer، والذي يتجاوز عملية تجزئة الحروف الصعبة من خلال التعرف المباشر على سطور النصوص المعالجة مسبقاً من المخطوطات العربية المغربية التاريخية، محققاً بذلك نسخاً فعالاً للخطوط المعقدة والمتدهورة من أجل حفظ التراث الرقمي.

المؤلفون الأصليون: Adnane Mehdaoui, Khadija El Maaroufi

نُشر 2026-09-15
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Adnane Mehdaoui, Khadija El Maaroufi

البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

على مر قرون، كانت الكلمة المكتوبة هي الوعاء الأساسي للذاكرة البشرية، حاملةً قوانين وقصص واكتشافات الحضارات عبر الزمن. ومع ذلك، مع تقادم الورق وتلاشي الحبر، غالبًا ما تصبح هذه الوثائق غير قابلة للقراءة للعين الحديثة، محبوسة خلف طبقات من التحلل المادي وأنماط الخط اليدوي غير المألوفة. وفي مجال علوم الحاسوب، تعلم الباحثون منذ فترة طويلة كيفية تعليم الآلات قراءة النصوص المطبوعة بدقة تقارب الكمال، وهو مجال يُعرف بالتعرف الضوئي على الحروف. ومع ذلك، عندما تواجه تلك الآلات الصفحات التاريخية الفوضوية والمنسابة والمتضررة غالبًا، فإنها تتعثر في كثير من الأحيان. ويصبح التحدي حادًا بشكل خاص مع الخط العربي، حيث غالبًا ما تكون الحروف داخل الكلمة الواحدة متصلة في سلاسل منحنية ومعقدة تختلف اختلافًا كبيرًا من كاتب لآخر. وبالنسبة للتقليد الغني ثقافيًا والخاص بالمخطوطات العربية المغربية، المكتوبة بأسلوب مميز يُعرف بالخط المغربي، كانت المهمة صعبة للغاية لأن الحروف تتلامس وتتداخل وتتحرك بطرق تربك برمجيات القراءة القياسية.

لقد تصدى باحثان مستقلان، عدنان مهداوي وخديجة المعروفي، لهذه المشكلة من خلال تطوير نهج جديد يتجاوز الحاجة التقليدية لفصل الحروف الفردية. فبدلاً من محاولة تقطيع الكلمة إلى أجزائها المكونة لها — وهي مهمة غالبًا ما تفشل عندما يسيل الحبر أو تندمج الحروف — قاما بتدريب نظام ذكاء اصطناعي حديث للنظر إلى سطر كامل من النص كقصة واحدة متصلة. ومن خلال استخدام نوع من النماذج الحاسوبية المتقدمة يسمى "المحول" (Transformer)، والمصمم لفهم سياق الجملة بأكملها دفعة واحدة، أنشأوا نظامًا قادرًا على فك رموز هذه الصفحات التاريخية الصعبة. ويُظهر عملهما أنه من خلال الجمع بين التنظيف الدقيق للصور ونموذج يتعلم من تدفق الكتابة بدلاً من الأشكال المنعزلة، فإنه من الممكن فتح الأسرار الخاصة بالتراث المغربي التي كانت مخفية في وضح النهار.

بدأ الباحثان بمجموعة مكونة من مائتي صفحة من أرشيفات مفتوحة المصدر، تمثل الخط المغربي الفريد الموجود في المغرب. لم تكن هذه الصفحات مثالية؛ بل عانت من الأمراض النموذجية للوثائق القديمة، مثل الإضاءة غير المتساوية، والحبر الباهت، والورق الذي تعرض للالتواء بمرور الوقت. ولجعل هذه الصور قابلة للقراءة بواسطة الحاسوب، بنى الفريق أولاً مسارًا متخصصًا لتنظيف وتنظيم البيانات. فقد قاموا بضبط التباين لجعل الحبر الداكن يبرز مقابل الورق العتيق، ثم استخدموا نظام كشف ذكي لتحديد مكان بدء كل سطر من النص ونهايته. كانت هذه الخطوة حاسمة لأن الخط اليدوي التاريخي غالبًا ما يميل أو ينزاح، مما يجعل من الصعب على الأدوات القياسية تحديد أين ينتهي سطر وما هو السطر التالي. قام النظام بتحليل المسافات وكثافة الحبر تلقائيًا لتقطيع الصفحات إلى أسطر فردية، مما خلق مجموعة نظيفة من الصور الجاهزة للمرحلة التالية من التعلم.

بمجرد عزل الأسطر، انتقل الباحثون إلى أداة قوية تُعرف باسم TrOCR، والتي ترمز إلى "التعرف الضوئي على الحروف القائم على المحول". وعلى عكس الأنظمة القديمة التي حاولت تحديد حرف واحد في كل مرة، يعمل هذا النموذج من خلال النظر إلى سطر النص بأكمله في آن واحد. وهو يستخدم آلية تسمى "الانتباه الذاتي" (self-attention)، والتي تسمح للحاسوب بتقدير أهمية الأجزاء المختلفة من الصورة أثناء القراءة. على سبيل المثال، إذا كان حرف ما مشوهًا قليلاً أو يفتقد إلى نقطة، يمكن للنموذج النظر إلى الحروف المحيطة والشكل العام للكلمة لتخمين ما قد يكون الجزء المفقود. وهذه القدرة على فهم السياق أمر حيوي للغة العربية، حيث يتغير شكل الحرف اعتمادًا على ما إذا كان في بداية الكلمة أو وسطها أو نهايتها، وحيث يمكن للنقاط الصغيرة فوق أو تحت الحرف أن تغير معناه تمامًا.

لتعليم هذا النموذج قراءة العربية المغربية، لم يبدأ الباحثون من الصفر. لقد استخدموا تقنية تسمى "تعلم النقل" (transfer learning)، حيث أخذوا نموذجًا تم تدريبه بالفعل على آلاف الوثائق المكتوبة بخط اليد باللغة الإنجليزية وتكييفه مع الخط العربي. يشبه هذا كيف يمكن لشخص تعلم بالفعل عزف البيانو أن يلتقط آلة جديدة بسرعة أكبر من المبتدئ تمامًا، لأنه يفهم بالفعل أساسيات الإيقاع واللحن. ثم تم ضبط النموذج بدقة على مجموعة البيانات المغربية، ليتعلم المنحنيات والاتصالات والأنماط المحددة للخط المغربي. درب الفريق النظام على حوالي ثمانية آلاف زوج من الصور ونسخ نصوصها الصحيحة، مع حجز ألفي زوج آخر لاختبار مدى أداء النموذج على مواد لم يرها من قبل.

تم قياس نتائج هذا التدريب باستخدام مقياس قياسي يسمى "معدل خطأ الحروف" (Character Error Rate)، والذي يحسب عدد الحروف التي أخطأ فيها الحاسوب مقارنة بالنص الصحيح. وفي مجموعة الاختبار، حقق النموذج معدل خطأ يزيد قليلاً عن خمسة بالمائة. وهذا يعني أنه لكل مائة حرف في سطر نصي، حدد النظام أكثر من خمسة وتسعين منها بشكل صحيح. وأشار الباحثون إلى أن الأداء ظل ثابتًا عبر مراحل التدريب والتحقق والاختبار، مما يشير إلى أن النموذج قد تعلم حقًا أنماط الخط وليس مجرد حفظ الصفحات المحددة التي عُرضت عليه. هذا المستوى من الدقة يعتبر مهمًا للوثائق التاريخية، حيث تجعل التباينات في الخط اليدوي ووجود الأضرار تحقيق التعرف المثالي هدفًا صعب المنال للغاية.

وعلى الرغم من هذه النجاحات، يحرص المؤلفون على الإشارة إلى أن العمل ليس حلاً كاملاً لجميع مشكلات قراءة المخطوطات القديمة. فلا يزال النظام يعاني مع العلامات الإعرابية (أو التشكيل)، وهي النقاط والخطوط الصغيرة التي توضع فوق أو تحت الحروف للإشارة إلى النطق أو المعنى، والتي غالبًا ما تكون باهتة أو مفقودة في الوثائق القديمة. وإذا أسيء قراءة هذه العلامات، يمكن أن يتغير معنى الكلمة تمامًا. علاوة على ذلك، تم تدريب النموذج على أسطر نصية تم استخراجها بعناية؛ فهو لا يتعامل بعد مع الصفحات الكاملة ذات التخطيطات المعقدة، مثل الملاحظات المكتوبة في الهوامش أو النص الذي يمتد في أعمدة متعددة. كما سلط الباحثون الضوء على أن ندرة البيانات المشروحة تظل عقبة رئيسية، حيث يتطلب إنشاء مجموعات التدريب من الخبراء نسخ النص يدويًا، وهي عملية بطيئة وصعبة.

تخلص الدراسة إلى أنه بينما حقق التعلم العميق خطوات كبيرة، فإنه لا يمكنه بعد استبدال الحاجة إلى الخبرة البشرية أو التغلب على كل القيود الفيزيائية للورق العتيق. ومع ذلك، فإن النهج الذي اتخذه مهداوي والمعروفي يقدم مسارًا قويًا للمضي قدمًا. فمن خلال الجمع بين المعالجة المسبقة الذكية للصور ونموذج يفهم سياق السطر بأكمله، نجحا في إنشاء أداة يمكنها تسريع رقمنة التراث التاريخي المغربي بشكل كبير. إن هذا العمل لا ينتج مجرد قائمة من الأرقام؛ بل يوفر إطارًا عمليًا يسمح للباحثين بالوصول إلى المعرفة اللغوية والثقافية لقرون مضت والحفاظ عليها، والتي كانت في السابق صعبة القراءة للغاية. وبينما يمضي هذا المجال قدمًا، فإن دمج نماذج اللغة لتصحيح الأخطاء وتطوير تقنيات أفضل لتعزيز البيانات يمكن أن يؤدي إلى تحسين هذه الأنظمة، مما يقرب التاريخ المكتوب للمغرب العربي من العالم الحديث.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →