← أحدث الأبحاث
💬 NLP

PashtoCorp: A 1.25-Billion-Word Corpus, Evaluation Suite, and Reproducible Pipeline for Low-Resource Language Development

تقدم هذه الورقة البحثية PashtoCorp، وهو متن لغوي مكون من 1.25 مليار كلمة ومسار عمل قابل لإعادة الإنتاج للغة البشتو، يتفوق بشكل كبير على مجموعات البيانات السابقة، مما يؤدي إلى تحسينات جوهرية في حيرة النماذج اللغوية، والتعرف على الكيانات المسماة، ومعايير فهم القراءة لهذه اللغة ذات الموارد المحدودة.

المؤلفون الأصليون: Hanif Rahman

نُشر 2026-03-18
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Hanif Rahman

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت التحدث بلغة البشتو، وهي لغة يتحدث بها 60 مليون شخص. حتى الآن، كانت "مكتبة" الروبوت من كتب البشتو صغيرة للغاية—كأنك تحاول تعلم لغة كاملة من كتيب صغير. كان الروبوت بالكاد يستطيع فهم أي شيء، وكان يرتكب الأخطاء باستمرار.

تقدم هذه الورقة البحثية مشروع PashtoCorp، وهو مشروع ضخم جديد يغير قواعد اللعبة. إليك قصة ما فعلوه، مشروحة ببساة:

1. المشكلة: مكتبة عطشى

فكر في لغة البشتو كمدينة ضخمة وحيوية. لكن بالنسبة للحواسيب (الذكاء الاصطالي)، كانت هذه المدينة فارغة في الغالب. كانت أكبر المجموعات الموجودة لنصوص البشتو تشبه مجرد بضعة رفوف صغيرة في مكتبة ضخمة. كانت أصغر من أن تُعلم روبوتاً ذكياً أي شيء مفيد.

2. الحل: بناء "مكتبة خارقة"

بنى الباحثون PashtoCorp، وهي مكتبة رقمية تحتوي على 1.25 مليار كلمة.

  • ما مدى ضخامة ذلك؟ إنها أكبر بـ 40 مرة من أكبر مجموعة سابقة، وأكبر بـ 83 مرة من المجموعة التي كانت تحمل الرقم القياسي القديم.
  • من أين جاءت الكتب؟ لم يقوموا بمجرد نسخ ولصق شيء واحد. لقد بنوا 32 "عنكبوت روبوت" مخصصاً زحفت عبر الإنترنت لجمع النصوص من:
    • المواقع الإخبارية (مثل بي بي سي بشتو أو الأخبار الأفغانية المحلية).
    • نصوص الإذاعة (ما يقوله الناس فعلياً في الهواء).
    • ملفات PDF للكتب والتقارير الحكومية (أشياء "المعرفة العميقة").
    • ويكيبيديا (الموسوعة).
    • مجموعات البيانات الموجودة على الإنترنت.

3. عملية التنظيف: "منقب الذهب"

لا يمكنك فقط إلقاء جبل من التراب وتوقع العثور على الذهب؛ عليك تصفية التراب. بنى الباحثون مساراً لتنظيف البيانات:

  • فحص اللغة: تخلصوا من أي شيء ليس بشتو فعلياً (مثل الإنجليزية أو الأوردو المختلطة).
  • إزالة التكرار: إذا ظهر نفس المقال في خمسة مواقع مختلفة، احتفظوا بنسخة واحدة فقط.
  • ضبط الجودة: استبعدوا القطع النصية الصغيرة والمكسورة التي كانت قصيرة جداً بحيث لا تكون مفيدة.
  • النتيجة: احتفظوا بـ "الذهب" (النصوص عالية الجودة) ورموا "التراب".

4. التجربة: تعليم الروبوت

أخذوا نموذج ذكاء اصطناعي قياسياً (روبوت يعرف لغات عديدة ولكنه سيء في البشتو) وأطعموه هذه المكتبة الجديدة.

  • النتيجة: أصبح الروبوت أذكى بنسبة 25% في فهم قواعد البشتو وبنيتها.
  • "اختبار الاسم": اختبروا الروبوت في مهمة تسمى "التعرف على الكيانات المسماة" (إيجاد أسماء الأشخاص، الأماكن، والمنظمات).
    • قبل: كان الروبوت يخمن بشكل عشوائي وكان غير متسق للغاية (مثل طالب يحصل على درجة امتياز يوماً ما ودرجة رسوب في اليوم التالي).
    • بعد: أصبح الروبوت أكثر دقة وأكثر اتساقاً بـ 7 مرات. توقف عن التخمين وبدأ في المعرفة.

5. المفاجأة الكبرى: الأمر لا يتعلق بـ "كم الكمية"، بل بـ "ما هي النوعية"

هذا هو الجزء الأكثر إثارة للاهتمام في الورقة. أجرى الباحثون اختبار "الاستبعاد التدريجي". سألوا: "ماذا يحدث إذا أزلنا نوعاً معيناً من المصادر؟"

  • الأخبار/الإذاعة (الكتلة الكبرى): شكلت 35% من المكتبة. إزالتها أضرت بالروبوت قليلاً، لكنه ظل جيد الحال.
  • ويكيبيديا (الشريحة الضئيلة): كانت ويكيبيديا تمثل 0.7% فقط من إجمالي المكتبة (مجرد فتات صغير). ولكن عندما أزالوها، انهارت قدرة الروبوت على إيجاد الأسماء بنسبة 47%.
  • كتب الـ PDF (الشريحة الضئيلة): كانت تمثل 0.6% فقط. لكنها احتوت على 35% من جميع الكلمات الفريدة في المجموعة بأكملها.

التشبيه: تخيل أنك تحاول تعلم لغة. قراءة 1,000 عنوان إخباري متطابق (الأخبار/الإذاعة) يساعدك على تعلم الكلمات الشائعة مثل "الـ" و"و" و"اليوم". لكن قراءة مدخل موسوعي واحد كثيف (ويكيبيديا) أو كتاب معقد (PDFs) يعلمك الكلمات "الصعبة"، والأسماء المحددة، والمفاهيم العميقة. القليل من النص المتنوع عالي الجودة يساوي أكثر من جبل من النص المتكرر.

6. أين لا يزال يعاني

أصبح الروبوت بارعاً في فهم الأخبار والكتابة الرسمية. ومع ذلك، عندما اختبروه على لغة وسائل التواصل الاجتماعي العامية (مثل منشورات تويتر أو فيسبب المليئة بالاختصارات أو الكلام غير الرسمي)، لم يتحسن الروبوت.

  • لماذا؟ لأن المكتبة لم تكن تحتوي على ما يكفي من "اللغة العامية للشارع". كانت في الغالب أخباراً رسمية. هذا يعلمنا أنه إذا كنت تريد من الذكاء الاصطناعي أن يفهم رسائلكم النصية، فأنت بحاجة لتغذيته بالرسائل النصية، وليس فقط بالمقالات الإخبارية.

7. الخلاصة للمستقبل

أصدر المؤلفون كل شيء مجاناً: المكتبة، وعقل الروبوت المدرب، والبرمجية.

  • الدرس المستفاد: إذا كنت تريد بناء ذكاء اصطناعي للغة لا تملك الكثير من البيانات، فلا تكتفِ فقط بجمع كل ما هو موجود على الإنترنت. ركز على إيجاد الموسوعات، الكتب، والمقالات عالية الجودة أولاً. حتى كمية صغيرة من هذه النصوص "الكثيفة" ستعلم الذكاء الاصطناعي أكثر من كومة ضخمة من الأخبار المتكررة.

باخت-طصر: لقد بنوا مكتبة ضخمة ونظيفة للغة البشتو، وأثبتوا أن القليل من النص "الذكي" أفضل من الكثير من النص "المزعج"، وأعطوا الجميع مفاتيح المكتبة حتى يتمكنوا من بناء أدوات أفضل لـ 60 مليون متحدث بالبشتو.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →