← أحدث الأبحاث
💬 NLP

Wiki Dumps to Training Corpora: South Slavic Case

تقدم هذه الورقة منهجية غير مرتبطة بلغة معينة لتحويل ملفات ويكيميديا الخام إلى مجموعات بيانات تدريبية عالية الجودة وغنية لغوياً لسبع لغات سلافية جنوبية، وذلك من خلال استخراج النصوص بشكل منهجي من مشاريع ويكي متعددة وتوظيف التصفية القائمة على الـ n-gram لإزالة المقالات منخفضة الجودة والمتكررة.

المؤلفون الأصليون: Mihailo Škorić

نُشر 2026-04-29
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Mihailo Škorić

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تريد بناء مكتبة ضخمة من القصص، والقصائد، والمقالات الإخبارية لتعليم روبوت كيف يتحدث ويفهم سبع لغات سلافية جنوبية مختلفة (مثل الصربية، والكرواتية، والبلغارية، وغيرها). قررت استخدام ويكيبيديا ومواقعها الشقيقة (مثل ويكيمصدر أو ويكي نيوز) كمصدر لموادك لأنها مجانية ومليئة بالنصوص.

ومع ذلك، إذا قمت فقط بجلب الملفات الخام من هذه المواقع، فأنت لا تحصل على مكتبة من القصص. بل تحصل على مستودع فوضوي مليء بـ:

  • حطام البناء: أكواد حاسوبية مخفية، تعليمات تنسيق، و"مخططات" تخبر الموقع كيف يبدو، لكنها ليست جزءاً من القصة.
  • الزجاج المكسور: روابط مكسورة وأقسام فارغة.
  • النسخ المصنعة آلياً: آلاف المقالات التي تبدو متطابقة تقريباً لأنها تم إنشاؤها تلقائياً من قواعد بيانات بدلاً من كتابتها بواسطة بشر.

هذه الورقة هي دليل حول كيفية تنظيف هذا المستودع الفوضوي وتحويله إلى مكتبة نقية. يقوم المؤلف، ميهايلو شكوريتش، بتقسيم العملية إلى مرحلتين رئيسيتين: التنظيف الكبير ومرشح الجودة.

المرحلة الأولى: التنظيف الكبير (استخراج النصوص)

فكر في بيانات ويكيبيديا الخام كمنزل لا يزال تحت الإنشاء. فيه سقالات، وعلب طلاء، ومخططات في كل مكان. لا يمكنك العيش فيه بعد.

قام المؤلف ببناء "طاقم بناء" متخصص (برنامج حاسوبي) لتجريد المنزل حتى يصل إلى جدرانه الأساسية الصالحة للسكن.

  • تجريد السقالات: يستخدم البرنامج أداة تسمى mwparserfromhell (اسم معقد لأداة تفهم لغة ويكيبيديا السرية) لانتزاع كل الأكواد الحاسوبية، والقوالب، وعلامات التنسيق.
  • إزالة الضجيج: يقوم بحذف قوائم "الفئات" (مثل العلامات الموجودة على ملفات الخزانة)، وينزع أوصاف الصور، ويزيل أقسام "المراجع" التي تبدو كحواشي سفلية ولكنها ليست جزءاً من القصة الرئيسية.
  • تسطيح الجداول: غالباً ما تستخدم ويكيبيديا الجداول لتنظيم البيانات. يقوم البرنامج بتحويل هذه الشبكات المعقدة إلى جمل بسيطة قابلاً للقراءة حتى لا يرتبك الروبوت بسبب خطوط الشبكة.
  • النتيجة: بعد هذه المرحلة، يصبح لديك كومة من النصوص النظيفة والبسيطة. لم يعد موقعاً إلكترونياً؛ إنه مجرد كلمات.

المرحلة الثانية: مرشح الجودة (إزالة النسخ المكررة)

الآن بعد أن حصلت على نص نظيف، هناك مشكلة جديدة. بعض المقالات هي نصوص "زومبي". هذه مقالات تبدو وكأن بشراً كتبوها، لكنها في الواقع تم إنشاؤها تلقائياً بواسطة حاسوب. إنها مكررة، ومملة، وتقول الشيء نفسه مراراً وتكراراً بطرق مختلفة قليلاً.

إذا قمت بتغذية هذه المقالات الـ "زومبي" للروبوت الخاص بك، فسوف يتعلم التحدث في حلقة مكررة وروبوتية. ولحل هذه المشكلة، يستخدم المؤلف استراتيجية المحقق:

  1. التجميع حسب الحي: يقوم البرنامج بتجميع المقالات حسب موضوعها (على سبيل_الغمض، كل المقالات عن "التاريخ" تذهب في غرفة واحدة، وكل ما يتعلق بـ "الرياضة" في غرفة أخرى). من الأسهل العثور على المكررات إذا كنت تقارن التفاح بالتفاح فقط.
  2. مسح "بصمة الإصبع": يقوم البرنامج بتحويل كل مقال إلى "بصمة إصبع" رياضية (متجه). وهو ينظر إلى الكلمات القليلة الأولى من المقال ليرى ما إذا كانت تطابق نمط قالب معين.
  3. اختبار التشابه: يقارن هذه البصمات ببعضها البعض باستخدام خدعة رياضية تسمى MinHashing. تخيل أن لديك كتابين؛ إذا كانا يتشاركان الكثير من الجمل المتطابقة في نفس الترتيب، فمن المرجح أنهما نسخ مكررة.
  4. نقطة القطع: يحسب البرنامج "درجة تشابه". إذا كان المقال مشابهاً جداً لغيره (أعلى من حد معين)، يتم طرده من المكتبة. الأمر يشبه حارس النادي الذي يقول: "تبدو تماماً مثل الجميع في الطابور؛ لن تدخل".

النتائج

اختبرت الورقة هذه الطريقة على سبع لغات سلافية جنوبية. كانت النتائج دراماتيكية:

  • الصربية: كانت تمتلك أكبر قدر من الفوضى للتنظيف. قبل التصفية، كان لديها أكثر من 500,000 مقال. بعد أن قام "الحارس" بعمله، تمت إزالة نصف المقالات تقريباً لأنها مكررة أو مولدة تلقائياً. انخفض عدد الكلمات بنسبة تقارب 60%.
  • البلغارية والسلوفينية: كانت نظيفة بالفعل، لذا فقدت عدداً أقل من المقالات.
  • العائد: النتيجة النهائية هي مكتبة أصغر، ولكنها ذات جودة أعلى بكثير. الكلمات في هذه المكتبات الجديدة تطابق كيف يتحدث البشر الحقيقيون فعلياً، بدلاً من كيفية توليد قاعدة البيانات للنصوص.

لماذا هذا مهم؟

يجادل المؤلف بأنه لكي يتعلم الروبوت اللغة جيداً، فإنه يحتاج إلى قراءة كتابات بشرية حقيقية، وليس حشواً مولداً بواسطة الحاسوب. ومن خلال القيام بهذه العملية المكونة من خطوتين (تنظيف الكود، ثم تصفية النسخ المكررة)، توفر الورقة مجموعة موثوقة وعالية الجودة من الكتب لتدريب نماذج الذكاء الاصطناعي في اللغات السلافية الجنوبية.

باخت اختصار: تعلمنا الورقة كيفية أخذ كومة فوضوية من ويكيبيديا مليئة بالأكواد، وتنظيفها من النفايات الحاسوبية، ثم التخلص من المقالات التي تعتمد على "النسخ واللصق"، تاركة وراءها مجموعة نقية من اللغة البشرية جاهزة ليتعلم منها الروبوت.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →