SomaliWeb v1: A Quality-Filtered Somali Web Corpus with a Matched Tokenizer and a Public Language-Identification Benchmark
تقدم هذه الورقة SomaliWeb v1، وهو عبارة عن مجموعة نصوص صومالية منقحة نوعياً ومُطلقة للعموم تتكون من حوالي 303 مليون رمز (token) مصحوبة بـ tokenizer من نوع BPE-16K متوافق، وأول معيار مرجعي عام لتحديد اللغة، والذي يكشف أيضاً عن عيوب جوهرية في جودة توزيعات البيانات الصومالية متعددة اللغات الموجودة حالياً.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل الإنترنت كمكتبة ضخمة وفوضوية تحتوي على كتب بمئات اللغات المختلفة. لفترة طويلة، كان قسم "اللغة الصومالية" في هذه المكتبة في حالة فوضى عارمة. لم يكن غرفة مخصصة ذات لافتة واضحة؛ بل كانت الكتب الصومالية مبعثرة عشوائياً داخل أكوام ضخمة من اللغات المختلطة، وغالباً ما كانت مختلطة بالقمامة، أو الصفحات الممزقة، أو النسخ المكررة.
SomaliWeb v1 هو المرة الأولى التي يدخل فيها شخص ما إلى تلك المكتبة الفوضوية، ويبني غرفة مخصصة للصومالية وينظمها بشكل صحيح. إليك كيف فعل المؤلفون ذلك، مشروحاً ببساطة:
1. المشكلة: المكتبة "المزعجة"
قبل هذا المشروع، إذا أردت تعليم كمبيوتر فهم اللغة الصومالية، كان عليك التقاط حقيبة ضخمة من النصوص المختلطة من الإنترنت.
- المزيج: كانت تحتوي على الصومالية، ولكنها تحتوي أيضاً على الإنجليزية والفرنسية ولغات أخرى مختلطة بها.
- الضجيج: حتى النسخ "المُنقحة" من هذه الحقائب كانت مليئة بالأخطاء. وجد المؤلفون أن حقيبة واحدة شهيرة (تسمى HPLT v2) كانت تحتوي على:
- 17% نسخ مكررة: مثل وجود نفس الكتاب مطبوعاً 17 مرة ومثبتاً معاً بالدبابيس.
- 56% "Mojibake": وهذا يحدث عندما يبدو النص كأنه طلاسم (على سبيل المثال
éبدلاً منé) لأن الكمبيوتر قرأ الحروف بشكل خاطئ. الأمر يشبه كتاباً تلطخ فيه الحبر ليصبح لغواً لا معنى له. - نسخ شبه متطابقة: كتب متشابهة بنسبة 90%، مع تغيير كلمات قلييرة فقط.
2. الحل: "المصفاة" ذات المراحل الست
بنى المؤلفون آلة مكونة من ست خطوات (خط إنتاج) لتصفية نص الإنترنت الخام للوصول فقط إلى الأشياء الجيدة. فكر في الأمر كعملية غربلة الذهب:
- الخطوة 1: كاشف النسخ المكررة. قاموا بفحص كل وثيقة ورمي النسخ المتطابقة تماماً. النتيجة: أزالوا حوالي 14% من الكومة.
- الخطوة 2: محطة الإصلاح. استخدموا أداة لإصلاح النصوص التي تبدو كـ "طلاسم" واستبعدوا أي شيء قصير جداً (أقل من 50 كلمة). النتيجة: أصلحوا نصف النص المتبقي وأزالوا المقاطع القصيرة عديمة الفائدة.
- الخطوة 3: شرطة اللغة. أجروا اختباراً للتأكد من أن النص هو صومالي بالفعل. إذا كانت الوثيقة معظمها بالإنجليزية، فكان يتم طردها. النتيجة: تمت إزالة قدر ضئيل من "تسرب الإنجليزية".
- الخطوة 4: صائد "النسخ شبه المتطابقة". استخدموا حيلة رياضية ذكية (MinHash) للعثور على الوثائق المتطابقة بنسبة 80% والاحتفاظ بأفضل نسخة منها فقط. النتيجة: أزالوا 10% أخرى من الكومة.
- الخطوة 5: فحص الجودة. قارنوا النص بـ "معيار ذهبي" (ويكيبيديا الصومالية) لمعرفة ما إذا كانت الكلمات والأنماط تبدو صومالية فصيحة وطبيعية. إذا بدا المستند غريباً أو مكسوراً، يتم استبعاده. النتيجة: أزالوا الـ 15% الأدنى من النصوص ذات الجودة الأقل.
- الخطوة 6: التلميع النهائي. قاموا بخلط الوثائق المتبقية، وتقسيمها إلى مجموعة "تدريب" ومجموعة "اختبار"، وأنشأوا مجزئ نصوص (tokenizer) مخصصاً.
3. الأدوات الجديدة: قاموس مخصص
عندما تقرأ الحواسيب النصوص، فإنها تقسم الكلمات إلى قطع صغيرة تسمى "رموز" (tokens).
- الطريقة القديمة: استخدام قاموس عام (مثل قاموس GPT-4) يعني أن الكلمات الصومالية تُقطع إلى قطع صغيرة غير فعالة. الأمر يشبه محاولة أكل بيتزا كبيرة بملعقة صغيرة؛ تحتاج إلى الكثير والكثير من "الملعقات" لإنهاء الوجبة.
- الطريقة الجديدة: بنى المؤلفون قاموساً مخصصاً للصومالية تحديداً.
- النتيجة: قاموسهم أكثر كفاءة بنسبة 40%. يتطلب الأمر 40% أقل من "الملعقات" لقراءة نفس القدر من النص. هذا يوفر المال وقوة الحوسبة لأي شخص يستخدم هذه البيانات لاحقاً.
4. المعيار المرجعي: "اختبار قيادة" لكواشف اللغة
أنشأ المؤلفون أيضاً اختباراً لمعرفة أي برنامج كمبيوتر هو الأفضل في تحديد النصوص الصومالية. اختبروا ثلاث أدوات شهيرة:
- الفائز المفاجئ: الأداة الأقدم، وتسمى
langdetect، حققت أفضل أداء في رصد اللغة الصومالية. - الخاسر: الأداة الأحدث والأكثر تعقيداً (
fastText) فشلت فشلاً ذريعاً، حيث كانت تعتقد غالباً أن الصومالية لغة مختلفة تماماً. - الخلاصة: لا يعني مجرد كون الأداة جديدة أنها أفضل للغات محددة.
ملخص لما تم إصداره
لم يكتفِ المؤلفون بكتابة ورقة بحثية؛ بل أصدروا ثلاث أدوات فعلية للجمهور:
- المتن (Corpus): مجموعة نظيفة وعالية الجودة من 819,000 وثيقة صومالية (حوالي 303 مليون كلمة).
- مجزئ النصوص (Tokenizer): "قاموس" مخصص يقرأ الصومالية بكفاءة أكبر بكثير من القواميس العامة.
- المعيار المرجعي (Benchmark): لوحة نتائج اختبار عامة توضح أي كواشف اللغة تعمل فعلياً للغة الصومالية.
ما لم يفعلوه (وفقاً للورقة البحثية):
لم يقوموا بتدريب روبوت دردشة (Chatbot) أو نموذج لغوي جديد على هذه البيانات بعد. لقد بنوا فقط المكونات (البيانات النظيفة والأدوات) وأثبتوا أن هذه المكونات عالية الجودة. إنهم يدخرون عملية "الطهي" (تدريب النموذج واختبار مدى ذكائه) للإصدار القادم (v2).
باخت-القول: SomaliWeb v1 هي المرة الأولى التي يأخذ فيها شخص ما النص الصومالي الفوضوي والمكسور من الإنترنت، وينظفه، ويرتبه، ويسلمه للباحثين مع مجموعة مخصصة من الأدوات، حتى يتمكنوا أخيراً من بناء ذكاء اصطناعي أفضل للمتحدثين بالصومالية دون الحاجة للقيام بكل عمليات التنظيف بأنفسهم.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.