← أحدث الأبحاث
💬 NLP

Comparative Analysis of AutoML and BiLSTM Models for Cyberbullying Detection on Indonesian Instagram Comments

تقيم هذه الدراسة وتقارن بين نماذج تعلم الآلة والتعلم العميق للكشف عن التنمر السيبراني في تعليقات إنستغرام الإندونيسية، حيث وجدت أنه بينما يحقق نموذج BiLSTM مع آليات الانتباه أعلى أداء إجمالي، يظل الانحدار اللوجستي بديلاً تنافسياً وفعالاً من حيث الموارد.

المؤلفون الأصليون: Raihana Adelia Putri, Aisyah Musfirah, Anggi Puspita Ningrum, Luluk Muthoharoh, Ardika Satria, Martin Clinton Tosima Manullang

نُشر 2026-04-30
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Raihana Adelia Putri, Aisyah Musfirah, Anggi Puspita Ningrum, Luluk Muthoharoh, Ardika Satria, Martin Clinton Tosima Manullang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل إنستغرام كأنه ساحة مدينة رقمية ضخمة ومزدحمة. وبينما هو مكان لمشاركة الصور والتواصل، إلا أن له جانباً مظلماً: التنمر الإلكتروني. وهذا يحدث عندما يستخدم الناس الإنترنت للمضايقة أو التهديد أو الإهانة. وفي إندونيسيا، تعد هذه مشكلة خطيرة تؤثر على الكثير من الشباب.

هذه الورقة البحثية تشبه تقرير محقق يحاول اكتشاف أفضل طريقة لبناء "حارس أمن رقمي" يمكنه تلقائياً رصد التعليقات المسيئة باللغة الإندونيسية قبل أن تؤذي أي شخص.

إليك قصة تحقيقهم، مقسمة ببساء:

1. المشتبه بهم (البيانات)

جمع الباحثون "قائمة مطلوبين" مكونة من 650 تعليقاً من إنستغرام.

  • المصدر: جاءت من أقسام التعليقات لفنانين ومؤثرين إندونيسيين مشهورين.
  • المزيج: كانت القائمة متوازنة تماماً: 325 تعليقاً مسيئاً (تنمر) و325 تعليقاً لطيفاً (غير تنمر).
  • التحدي: لم تكن هذه مقالات رسمية؛ بل كانت فوضوية، قصيرة، ومليئة باللغة العامية، والاختصارات، والرموز التعبيرية (Emojis) — تماماً كما يتحدث المراهقون في الواقع.

2. طاقم التنظيف (المعالجة المسبقة)

قبل أن تتمكن الحواسيب من قراءة هذه التعليقات، كان لزاماً تنظيفها. تخيل محاولة قراءة كتاب مكتوب بلغة يخطئ الناس فيها في كتابة الكلمات باستمرار أو يمددونها (مثل "baaaanget" بدلاً من "banget").

بنى الباحثون آلة تنظيف خاصة مكونة من ست خطوات:

  1. توحيد الحالة (Case Folding): تحويل كل شيء إلى أحرف صغيرة (ليصبح "Hello" و "hello" شيئاً واحداً).
  2. التنظيف (Cleaning): إزالة الوسوم (Hashtags)، الروابط، وإشارات المنشن (@mentions).
  3. تطبيع العامية (Slang Normalization): إصلاح اللغة العامية (تحويل "bgt" مرة أخرى إلى "banget").
  4. إزالة كلمات التوقف (Stopword Removal): رمي الكلمات الشائعة مثل "و" أو "الـ" التي لا تساعد في تحديد التنمر.
  5. التجذير (Stemming): تقطيع الكلمات للوصول إلى أصلها (تحويل "running" إلى "run").
  6. التقطيع (Tokenization): تقسيم الجملة إلى قطع كلمات فردية.

بدون هذه الخطوة، ستصاب الحواسيب بالارتباك بسبب لغة الإنترنت الفوضوية.

3. المتسابقون (النماذج)

وضع الباحثون نوعين مختلفين من "المحققين" في مواجهة بعضهما البعض ليروا من يمكنه ضبط المتنمرين بشكل أفضل.

الفريق (أ): المحققون الكلاسيكيون (تعلم الآلة - Machine Learning)

هذه هي الطرق التقليدية والموثوقة. إنهم ينظرون إلى الكلمات ويعدون عدد مرات ظهور كلمات "سيئة" معينة.

  • نايف بايز (Naive Bayes): مُخمّن سريع يعتمد على الاحتمالات.
  • الانحدار اللوجستي (Logistic Regression): حاسبة ثابتة ترسم خطاً بين الجيد والسيئ.
  • آلة ناقلات الدعم (SVM): مصنف حاد النظر يحاول إيجال الحدود المثالية بين المجموعتين.
  • الأداة: استخدموا طريقة تسمى TF-IDF، وهي تشبه قلم التحديد (Highlighter) الذي يضع علامات على الكلمات الفريدة والمهمة في الجملة.

الفريق (ب): المفكرون العميقون (التعلم العميق - Deep Learning)

هؤلاء هم محققو الذكاء الاصطناعي المتقدمون الذين يحاولون فهم السياق وتدفق الجملة، وليس فقط الكلمات.

  • Bi-LSTM: نموذج يقرأ الجملة من اليسار إلى اليمين ومن اليمين إلى اليسار في نفس الوقت، مثل قراءة كتاب مع تذكر ما قرأته للتو.
  • Bi-LSTM + Attention: نفس النموذج، ولكن مع "تسليط ضوء" (آلية الانتباه - Attention mechanism). هذا الضوء يخبر النموذج بضر-ورة إعطاء اهتمام إضافي للكلمات الأكثر عاطفية أو أهمية في الجملة.

4. النتائج: من الفائز؟

أجرى الباحثون سباقاً لمعرفة أي نموذج يمكنه تحديد تعليقات التنمر بشكل صحيح.

  • الفائز الكلاسيكي: بين المحققين القدامى، كان الانحدار اللوجستي (Logistic Regression) هو البطل. لقد أصاب بنسبة 85.25% من المرات. كان سريعاً، فعالاً، ولم يكن بحاجة إلى حاسوب خارق لتشغيله.
  • الفائز بالتعلم العميق: نموذج Bi-LSTM مع "تسليط الضوء" (Attention) هو من حصد اللقب الإجمالي. لقد أصاب بنسبة 84.62% من المرات.
    • انتظر، أليس هذا أقل؟ في الواقع، إنه قريب جداً! ساعد "تسليط الضوء" النموذج على فهم فروق المعنى (Nuance) في التنمر بشكل أفضل، حتى لو كانت النسبة المئوية الخام أقل قليلاً من أفضل نموذج كلاسيكي.
    • نموذج Bi-LSTM القياسي (بدون تسليط الضوء) كان أسوأ حالاً (78.46%)، مما يثبت أن "تسليط الضوء" كان أمراً حاسماً.

5. الحكم النهائي

تختتم الورقة ببعض الاستنتاجات الرئيسية:

  • التعلم العميق هو "الأذكى": النموذج المزود بـ "تسليط الضوء" (Bi-LSTM + Attention) هو الأفضل في فهم السياق المعقد والفوضوي للغة العامية الإندونيسية والهجمات العاطفية.
  • تعلم الآلة هو "الأكثر كفاءة": إذا لم يكن لديك حاسوب قوي أو كنت بحاجة إلى شيء يعمل بسرعة كبيرة، فإن الانحدار اللوجستي الكلاسيكي هو خيار قوي وعملي للغاية. لقد كان أداؤه قريباً جداً من الذكاء الاصطناعي المعقد ولكنه أخف بكثير.
  • التنظيف هو المفتاح: تؤكد الدراسة أنه إذا لم يتم تنظيف العامية وإصلاح الأخطاء المطبعية أولاً، فإن أذكى ذكاء اصطناعي سيفشل.

القيود (الملاحظات الدقيقة)

كان المؤلفون صادقين بشأن حدود دراستهم:

  • عينة صغيرة: استخدموا فقط 650 تعليقاً. الأمر يشبه الحكم على ذوق بلد كامل في الموسي الموسيقى بناءً على استطلاع لـ 650 شخصاً فقط. عينة أكبر ستجعل النتائج أكثر موثوقية.
  • مصدر محدد: جاءت جميع التعليقات من صفحات فنانين مشهورين. قد يبدو التنمر مختلفاً على صفحة شخص عادي.
  • تصنيفات بسيطة: قاموا فقط بتصنيف التعليقات كـ "تنمر" أو "غير تنمر". لم يقوموا بتفصيلها أكثر (على سبيل المثال: "التنمر على الجسد" مقابل "خطاب الكراهية").

باختتصار: للإمساك بالمتنمرين عبر الإنترنت في تعليقات إنستغرام الإندونيسية، تحتاج إلى طاقم تنظيف جيد أولاً. ثم يمكنك الاختيار بين محقق كلاسيكي سريع وموثوق (الانحدار اللوجيستي) أو ذكاء اصطناعي فائق الذكاء ومدرك للسياق مع تسليط ضوء (Bi-LSTM + Attention)، اعتماداً على قوة الحوسبة التي تملكها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →