← أحدث الأبحاث
💬 NLP

A Fusion of context-aware based BanglaBERT and Two-Layer Stacked LSTM Framework for Multi-Label Cyberbullying Detection

تقترح هذه الورقة بنية دمج مبتكرة تجمع بين نموذج BanglaBERT-Large المدرك للسياق وبين شبكة LSTM مكدسة ذات طبقتين لمعالجة تحديات الكشف عن التنمر السيبراني متعدد الملصقات في لغة البنغالية ذات الموارد المنخفضة، وذلك من خلال النمذجة المشتركة للسياق الدلالي والاعتمادات التسلسلية.

المؤلفون الأصليون: Mirza Raquib, Asif Pervez Polok, Kedar Nath Biswas, Rahat Uddin Azad, Saydul Akbar Murad, Nick Rahimi

نُشر 2026-02-27
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Mirza Raquib, Asif Pervez Polok, Kedar Nath Biswas, Rahat Uddin Azad, Saydul Akbar Murad, Nick Rahimi

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل الإنترنت كأنه ساحة مدينة رقمية ضخمة وصاخبة. في هذه الساحة، يتحدث الناس، ويتشاركون النكات، ويتواصلون. ولكن في بعض الأحيان، تصبح الساحة صاخبة بالمتنمرين، والتهديدات، والكراهية. إن اكتشاف هذا السلوك السيئ يشبه محاولة العثج من بضع تفاحات فاسدة في برميل ضخم، ولكن مع لمسة مختلفة: التفاحة الواحدة يمكن أن تكون فاسدة بطرق متعددة في آن واحد. فقد تكون تهديداً وخطاب كراهية في نفس الوقت.

تقدم هذه الورقة البحثية "حارس أمن رقمي" جديداً فائق الذكاء، مصمماً خصيصاً للغة البنغالية (التي يتحدث بها الملايين في بنغلاديش والهند). وإليك كيف يعمل، مقسماً إلى مفاهيم بسيطة:

1. المشكلة: خطأ "المقاس الواحد الذي يناسب الجميع"

كان حراس الأمن القدامى (نماذج الذكاء الاصطناعي) مثل البوابين الذين لا يمكنهم سوى الصراخ: "هذا تهديد!" أو "هذا خطاب كراهية!". لكنهم لم يستطيعوا التعامل مع تعليق يجمع بين الاثنين.

  • الواقع: قد يكون التعليق المسيء الواحد إهانة للدين، وتهديداً للسلامة، وسبام (رسائل مزعجة) في آن واحد.
  • الخلل: حاولت النماذج القديمة اختيار تصنيف واحد فقط. فإذا اختارت "تهديد"، فقد تغفل عن جزء "خطاب الكراهية"، مما يسم يسمح للمحتوى الخطير بالتسلل.
  • الفجوة: معظم هؤلاء الحراس تم تدريبهم على اللغة الإنجليزية. اللغة البنغالية معقدة، ولم يكن هناك الكثير من الحراس الأذكياء المدربين على التحدث بها بطلاقة.

2. الحل: فريق "العقل الفائق"

بنى المؤلفون نظاماً جديداً يعمل كأنه فريق من محققين اثنين يعملان معاً.

المحقق (أ): "سيد السياق" (BanglaBERT)

تخيل BanglaBERT كأمين مكتبة قرأ كل كتاب في المكتبة البنغالية.

  • ماذا يفعل: يفهم معنى ودقة الكلمات. هو يعلم أن كلمة مثل "نار" يمكن أن تعني ناراً حقيقية، أو سيارة رائعة، أو إهانة، اعتماداً على الجملة.
  • الاستعارة: إنه مثل شخص يفهم "جو" المحادثة. هو يقرأ الجملة بأكملة دفعة واحدة ليفهم الصورة الكبيرة.

المحقق (ب): "متتبع القصة" (Stacked LSTM)

تخيل LSTM (الذاكرة الطويلة قصيرة المدى) كشخص يمتلك ذاكرة ممتازة لـ ترتيب الأحداث.

  • ماذا يفعل: يتذكر ما قيل قبل وما قيل بعد كلمة معينة. في الجملة، الترتيب مهم. "أنت شخص جيد" جملة لطيفة. "أنت شخص، جيد" جملة غير منطقية.
  • الاستعارة: إنه مثل مشاهدة مشهد سينمائي مشهداً تلو الآخر. هو يلتقط تدفق القصة، مما يساعده على رصد متى تتحول الجملة ببطء إلى تهديد.

الاندماج السحري

تجمع الورقة بين هذين المحققين.

  • يمنح BanglaBERT النظام فهماً عميقاً لـ معنى الكلمات.
  • يمنح LSTM النظام إحساساً بـ كيفية تدفق الكلمات معاً عبر الزمن.
  • النتيجة: يغذيان النتائج إلى "قاضٍ" نهائي (طبقة التصنيف) يمكنه القول: "هذا التعليق هو تهديد بنسبة 90%، وخطاب كراهية بنسبة 80%، وسبام بنسبة 10%"، كل ذلك في وقت واحد.

3. التعامل مع "اللعبة غير العادلة" (عدم توازن الفئات)

في العالم الحقيقي، هناك تعليقات "لطيفة" أكثر بكثير من التعليقات "السيئة". الأمر يشبه امتلاك 1000 تفاحة جيدة و5 تفاحات فاسدة فقط. إذا دربت الحارس على التفاح الجيد فقط، فلن يعرف كيف يبدو شكل التفاح الفاسد.

  • الحل: استخدم الباحثون تقنية تسمى Oversampling (زيادة العينات). تخيل أخذ صور لـ 5 تفاحات فاسدة وصنع 100 نسخة منها حتى يراها الحارس بما يكفي ليتعلم شكلها. هذا يوازن التدريب بحيث لا يتجاهل الذكاء الاصطناعي التعليقات النادرة ولكن الخطيرة.

4. النتائج: بطل جديد

اختبر الفريق "عقلهم الفائق" الجديد على مجموعة بيانات من تعليقات وسائل التواصل الاجتماعي الحقيقية.

  • الدرجة: حقق دقة بلغت 94.31%.
  • المقارنة: تفوق على أفضل النماذج السابقة (الحراس القدامى) بهامش صغير ولكنه مهم.
  • الإثبات: لم يختبروه مرة واحدة فقط؛ بل مرروه عبر "اختبار جهد" (التحقق المتقاطع خماسي الطيات) للتأكد من أنه يعمل باستمرار، وليس بمحض الصدفة.

5. جعل النظام جديرًا بالثقة (الذكاء الاصطناعي القابل للتفسير)

أحد أروع الأجزاء هو أن هذا النظام لا يعطي إجابة فحسب، بل يشرح لماذا.

  • الاستعارة: تخيل أن الذكاء الاصطناعي يسلط الضل على كلمات محددة في التعليق جعلته يصرخ "متنمر!" أو "تهديد!".
  • لماذا يهم ذلك: هذا يشبه المعلم الذي يوضح خطوات حله في اختبار الرياضيات. هذا يساعد البشر على الثقة في الذكاء الاصطناعي لأنهم يستطيعون رؤية الكلمات التي أطلقت الإنذار بالضبط.

الملخص

تتحدث هذه الورقة عن بناء حارس أمن ذكي وثنائي اللغة للإنترنت البنغالي. من خلال الجمع بين "خبير سياق" (يفهم المعنى) مع "متتبع قصة" (يفهم التدفق)، وتعليمه كيفية رصد أنواع متعددة من التنمر في آن واحد، خلقوا نظاماً أكثر دقة، وعدلاً، وموثوقية مما سبق. إنها خطوة كبيرة نحو جعل المساحات عبر الإنترنت أكثر أماناً لملايين المتحدثين بالبنغالية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →