← أحدث الأبحاث
💬 NLP

A Comparative Study of PyCaret AutoML and CNN-BiLSTM for Binary Hate Speech Detection in Indonesian Twitter

تُظهر هذه الدراسة أن نموذج CNN-BiLSTM يتفوق على أفضل مصنف تقليدي (الغابة العشوائية) من PyCaret AutoML في اكتشاف خطاب الكراهية الثنائي على تويتر الإندونيسي، محققاً دقة أعلى بنسبة 6.6% ودرجة F1 أعلى بنسبة 4.2% من خلال الاستفادة بفعالية من تمثيلات الرموز الكثيفة والسياق ثنائي الاتجاه.

المؤلفون الأصليون: Tanty Widiyastuti, Mayada, Adisty Syawalda Ariyanto, Luluk Muthoharoh, Ardika Satria, Martin Clinton Tosima Manullang

نُشر 2026-05-07
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Tanty Widiyastuti, Mayada, Adisty Syawalda Ariyanto, Luluk Muthoharoh, Ardika Satria, Martin Clinton Tosima Manullang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم كمبيوتر كيفية رصد التغريدات "السامة" على تويتر الإندونيسي. الهدف هو معرفة ما إذا كانت الرسالة القصيرة هي "خطاب كراهية" (سيء) أم مجرد "كلام طبيعي" (جيد).

هذه الورقة البحثية تشبه سباقاً بين مدربين مختلفين يحاولان تدريب طالب لاجتياز هذا الاختبار.

المدربان

المدرب 1: "المنظم الآلي" (PyCaret)
فكر في هذا المدرب كمدير مشروع فائق الكفاءة. هو لا يبتكر طرقاً جديدة للتفكير؛ بل يأخذ صندوق أدوات يحتوي على أساليب كلاسيكية ومثبتة (مثل عد كلمات معينة سيئة أو النظر في تكرار الكلمات) ويجرب بسرعة عشرات الاستراتيجيات المختلفة ليرى أي منها يعمل بشكل أفضل.

  • كيف يعمل: ينظر إلى النص كقائمة من المكونات. إذا كانت التغريدة تحتوي على "كلمة سيئة" معروفة من قاموس، أو إذا ظهرت كلمات معينة معاً بشكل متكرر، فإنه يضع علامة عليها.
  • النتيجة: وجد هذا المدرب أن طريقة تسمى الغابة العشوائية (Random Forest) (والتي تشبه طلب رأي لجنة من صناع القرار للتصويت على ما إذا كانت التغريدة سيئة أم لا) كانت الأفضل من بين المجموعة. حقق دقة بلغت حوالي 77%.

المدرب 2: "محقق السياق" (CNN-BiLSTM)
هذا المدرب هو خبير في التعلم العميق. بدلاً من مجرد عد الكلمات، هو يعلّم الكمبيوتر كيف "يقرأ" التغريدة مثل البشر، من خلال الانتباه لترتيب الكلمات وكيف يتغير معناها بناءً على ما يسبقها أو يلحقها.

  • كيف يعمل: تخيل الجملة كأنها أحجية (بازل). جزء الـ "CNN" يبحث عن الأنماط المحلية الصغيرة (مثل عبارة غاضبة محددة)، بينما جزء الـ "BiLSTM" ينظر إلى الجملة بأكملها من اليسار إلى اليمين ومن اليمين إلى اليسار لفهم السياق. على سبيل المثال، يساعد الكمبيوتر على فهم أن كلمة ما قد تكون سيئة في جملة ما ولكنها غير ضارة في جملة أخرى بسبب وجود كلمة "ليس" أو مزاح قريب منها.
  • النتيجة: بنى هذا المدرب نموذجاً حقق دقة بلغت 83.8%.

شروط السباق

لجعل السباق عادلاً، حرص المؤلفون على أن يبدأ كلا المدربين بنفس المكونات تماماً:

  1. نفس البيانات: استخدموا نفس الـ 13,000+ تغريدة من مجموعة بيانات إندونيسية شهيرة.
  2. نفس التنظيف: قام كلا المدربين بتنظيف التغريدات بنفس الطريقة (إزالة الروابط، إصلاح الكلمات العامية، وتحويل الحروف لصغيرة).
  3. نفس الهدف: كان كلاهما يحاول حل نفس المشكلة الثنائية تماماً: هل هذا خطاب كراهية (نعم/لا)؟

الفائز

فاز "محقق السياق" (CNN-BiLSTM) بالسباق.

  • كان أكثر دقة بنسبة 6.6% من أفضل "منظم آلي".
  • كان أفضل في رصد التغريدات السيئة دون تصنيف الكثير من التغريدات الجيدة بالخطأ.

لماذا فاز المحقق؟

توضح الورقة أن التغريدات الإندونيسية قصيرة جداً وتعتمد غالباً على سياق دقيق.

  • المشكلة: أحياناً تبدو التغريدة غير ضارة إذا اكتفيت بعد الكلمات، لكنها في الواقع خطاب كراهية بسبب طريقة ترتيب الكلمات. أو قد تُستخدم كلمة سيئة بطريقة ليست كراهية.
  • الحل: كان "المنظم الآلي" جيداً في رصد الكلمات السيئة الواضحة، لكنه فاته "الجو العام" أو السياق الدقيق. أما "محقق السياق" فكان أفضل في فهم أن الجمل القصيرة الفوضوية غالباً ما تحتاج إلى قراءتها كقصة كاملة، وليس مجرد قائمة من الأجزاء.

الفخ (تحذير "الفرط في التخصيص" - Overfitting)

لاحظت الورقة أيضاً شيئاً مثيراً للاهتمام حول تدريب المحقق.

  • تعلم المحقق من بيانات التدريب بسرعة كبيرة وبشكل جيد جداً، بل أكثر من اللازم.
  • الأمر يشبه طالباً حفظ الاختبار التجريبي بشكل مثالي، ولكنه قد يواجه صعوبة إذا كانت الأسئلة في الاختبار الحقيقي مختلفة قليلاً. تشير الورقة إلى أن النموذج بدأ يعاني من "الفرط في التخصيص" (حفظ الضجيج أو التفاصيل غير المهمة) قليلاً.
  • الخلاصة: حتى مع كون "المحقق" هو الفائز، يقترح المؤلفون أننا في المستقبل بحاجة لتعليم المحقق أن يكون أكثر حذراً وألا يكتفي بالحفظ فقط، لكي يؤدي بشكل أفضل على تغريدات جديدة لم يسبق له رؤيتها.

الخلاصة النهائية

  • PyCaret (المنظم الآلي): ممتاز إذا كنت تريد حلاً سريعاً، موثوقاً، وسهل الفهم كمعيار أساسي. إنه حل قوي و"جيد بما يكفي".
  • CNN-BiLSTM (محقق السياق): هو الخيار الأفضل إذا كنت تحتاج إلى أعلى دقة ممكنة ومستعد للتعامل مع نظام أكثر تعقيداً يفهم الفروق الدقيقة في النصوص القصيرة والفوضوية.

تخلص الورقة إلى أنه بينما يعد "المنظم الآلي" أداة رائعة لوضع معيار قياسي، فإن "محقق السياق" هو الأداة المتفوقة حالياً لهذه المهمة المحددة وهي كشف خطاب الكراهية على تويتر الإندونيسي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →