← أحدث الأبحاث
🤖 machine learning

Digitizing Nepal's Written Heritage: A Comprehensive HTR Pipeline for Old Nepali Manuscripts

تقدم هذه الورقة أول مسار عمل متكامل (end-to-end) للتعرف على النصوص المكتوبة بخط اليد للمخطوطات النيبالية القديمة، محققةً معدل خطأ في الحروف بنسبة 4.9% من خلال الاستكشاف المنهجي لبنيات المشفر وفك التشفير (encoder-decoder) والتقنيات المتمحورة حول البيانات، مع إتاحة الكود والإعدادات لدعم أبحاث النصوص التاريخية ذات الموارد المنخفضة.

المؤلفون الأصليون: Anjali Sarawgi, Esteban Garces Arias, Christof Zotter

نُشر 2026-04-29
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Anjali Sarawgi, Esteban Garces Arias, Christof Zotter

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مكتبة من الكتب القديمة والهشة المكتوبة بلغة لم تُنطق بصيغتها الأصلية منذ قرون. الحبر باهت، والورق مجعد، والخط اليدوي فريد كبصمة الإصبع — لا يوجد كاتبان كتبوا بنفس الطريقة. محاولة جعل الكمبيوتر يقرأ هذه الكتب تشبه مطالبة روبوت بفك شفرة سرية رسمها ألف فنان مختلف، وكل منهم استخدم نصاً يشبه أغصان الكروم المتشابكة.

هذه الورقة هي قصة كيف قام فريق من الباحثين ببناء "قارئ خارق" لرقمنة المخطوطات النيبالية القديمة. إليكم كيف فعلوا ذلك، مشروحاً ببساطة:

التحدي: إبرة في كومة قش

أراد الباحثون تعليم الكمبيوتر قراءة اللغة النيبالية القديمة، وهي لغة مكتوبة بخط "ديفاناغاري" (نفس الخط المستخدم في اللغات النيبالية والهندية الحديثة، ولكن مع بعض الخصائص القديمة).

  • المشكلة: تتوفر أمثلة قليلة جداً من هذه الملاحظات اليدوية القديمة ليدرسها الكمبيوتر. الأمر يشبه محاولة تعليم شخص ما التعرف على نوع معين من الطيور بينما لا تملك سوى ثلاث صور ضبابية له.
  • الفوضى: الوثائق فوضوية؛ الحبر ملطخ، والورق مشوه، والكُتّاب لم يستخدموا مسافات بين الكلمات. كما استخدموا رموزاً غريبة تشبه النقاط أو الخطوط، والتي يتغير معناها بناءً على مكان وضعها.

الحل: معسكر تدريبي من ثلاث مراحل

بما أنهم لم يمتلكوا ما يكفي من "الكتب القديمة الحقيقية" لتعليم الكمبيوتر مباشرة، فقد أنشأوا مسار تدريب مكوناً من ثلاث مراحل. فكر في هذا كطالب ينتقل من مرحلة الروضة إلى الجامعة قبل أن يتصدى لأطروحة الدكتوراه.

1. المرحلة الأولى: الملعب الاصطناعي (الروضة)
لم يستطع الكمبيوتر التعلم من الكتب القديمة الحقيقية بعد لأنه لم يكن هناك ما يكفي منها. لذا، بنى الفريق "مكتبة وهمية" ضخمة باستخدام نصوص مولدة حاسوبياً. أخذوا كتباً مدرسية نيبالية حديثة، وطبعوها بـ 11 خطاً مختلفاً، ثم "أفسدوها" عمداً. أضافوا ضجيجاً رقمياً، وجعلوا الخطوط ضبابية، ولووا الصفحات لتبدو وكأنها كانت قابعة في علية مغبرة لمدة 200 عام. منح هذا الكمبيوتر 100,000 مثال للتدريب لتعلم الأشكال الأساسية للحروف.

2. المرحلة الثانية: الجسر المطبوع (المدرسة الثانوية)
بعد ذلك، انتقلوا إلى نص "ديفاناغاري" حقيقي ولكنه مطبوع. هذا يشبه الانتقال من لعبة فيديو إلى فصل دراسي حقيقي. النص لا يزال نظيفاً وواضحاً، لكنه بيانات حقيقية من أرشيف جامعي. ساعدت هذه الخطوة الكمبيوتر على سد الفجوة بين الصور "الوهمية" الفوضوية وبين العالم الحقيقي.

3. المرحلة الثالثة: الامتحان النهائي (الجامعة)
أخيراً، قدموا للكمبيوتر الكنز الحقيقي: 3,100 سطر من اللغة النيبالية القديمة الحقيقية المكتوبة بخط اليد من 155 مخطوطة قديمة. ولأن الكمبيوتر كان مدرباً جيداً بالفعل في المرحلتين الأولى والثانية، أصبح بإمكانه الآن التركيز على الخصائص الفريدة للخط اليدوي القديم، واللطخات، والأسلوب الفريد للكتبة.

السر الصغير: التنظيف والتمديد

أدرك الباحثون أن جودة البيانات أهم من تعقيد "عقل" الكمبيوتر.

  • تنظيف التسميات: وجدوا أن الملاحظات الرقمية التي تصف ما يجب أن يكتبه الخط اليدوي كانت تحتوي على أخطاء طفيفة (مثل استخدام كودين مختلفين لنفس رمز النقطة). قاموا بـ "تنظيف" هذه الملاحظات حتى لا يرتبك الكمبيوتر بسبب معلمه.
  • تعزيز البيانات (النادي الرياضي): لجعل الكمبيوتر أقوى، أخذوا الصور الموجودة وقموا بـ "تمديدها"، "وإمالتها"، و"تلطيخها" رقمياً. الأمر يشبه لاعب رفع الأثقال الذي يضيف وزناً إضافياً للبار. من خلال جعل الكمبيوتر يتدرب على آلاف النسخ المختلفة قليلاً من نفس الصفحة، تعلم التعرف على النص حتى عندما يكون مشوهاً.

النتائج: قارئ شبه مثالي

اختبر الفريق نظامهم مقابل أدوات أخرى (مثل برنامج OCR القياسي من جوجل ونسخة أساسية من نموذجهم الخاص).

  • النتيجة: ارتكب أفضل نموذج لديهم خطأ في 4.9% فقط من الحروف. هذا يعني أنه إذا أعطيته صفحة بها 1,000 حرف، فسوف يقرأ حوالي 951 حرفاً بشكل صحيح.
  • المقارنة: فشلت الأدوات القياسية فشلاً ذريعاً، حيث كانت تفقد غالباً الحروف المتصلة المعقدة (المركبة) الشائعة في هذا الخط. كان نموذجهم المخصص أفضل بكثير.

أين أخطأ الكمبيوتر؟

حتى مع نسبة نجاح 95%، فإن الكمبيوتر ليس مثالياً. حلل الباحثون الأخطاء ووجدوا أنها لم تكن عشوائية.

  • التوائم البصرية: غالباً ما خلط الكمبيوتر بين الحروف التي تبدو متشابهة جداً في الكتابة اليدوية (مثل حرف 'y' وحرف 'p'). الأمر يشبه إنسان يخلط بين حرف 'b' وحرف 'd' في الكتابة اليدوية.
  • الصراعات الطويلة: أدى الكمبيوتر أداءً جيداً في الجمل القصيرة والمتوسطة، لكنه بدأ يتعثر في السطور الطويلة جداً (أكثر من 120 حرفاً). يبدو أن الكمبيوتر "يتعب" أو يفقد مكانه عندما يصبح النص طويلاً جداً، ويرجع ذلك على الأرجح إلى عدم رؤيته لأمثلة طويلة كافية أثناء التدريب.

الخلاصة

بنى الباحثون تطبيق ويب حيث يمكنك رفع صورة لمخطوطة قديمة، وسيقوم التطبيق تلقائياً بالعثور على أسطر النص وكتابتها لك.

الدرس الكبير: في عالم قراءة الخط اليدوي القديم والفوضوي، البيانات هي الملك. لست بحاجة بالضرورة إلى عقل كمبيوتر أكبر أو أكثر تعقيداً؛ بل تحتاج إلى بيانات تدريب أفضل، وتسميات أكثر دقة، والكثير من التدريب على أمثلة "فوضوية". من خلال تنظيم عملية التدريب بعناية، استطاعوا تحويل لغة صعبة ومنخفضة الموارد إلى شيء يمكن للكمبيوتر قراءته بدقة عالية، مما يساعد في الحفاظ على التاريخ المكتوب لنيبال من أجل المستقبل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →