Sentiment Analysis of AI Adoption in Indonesian Higher Education Using Machine Learning and Transformer-Based Models
تقيم هذه الدراسة مشاعر الطلاب الإندونيسيين تجاه اعتماد الذكاء الاصطنا finally في التعليم العالي من خلال مقارنة نماذج تعلم الآلة التقليدية بنموذج DistilBERT القائم على تقنية Transformer، حيث وجدت أنه بينما يحقق DistilBERT دقة متفوقة (84.78%) عبر التقاط السياق بشكل أفضل، يظل نموذج SVM بديلاً تنافسياً وفعالاً بدقة بلغت 82.14%.
المؤلفون الأصليون:Happy Syahrul Ramadhan, Ahmad Sahidin Akbar, Karin Yehezkiel Sinaga, Luluk Muthoharoh, Ardika Satria, Martin C. T. Manullang
تخيل حرمًا جامعيًا صاخبًا في إندونيسيا، حيث يضج الطلاب بآراء حول أداة جديدة وقوية: الذكاء الاصطناعي (AI). البعض يراه عصا سحرية للتعلم؛ والبعض الآخر يخشى أن يكون وسيلة غش ستدمر تفكيرهم النقدي. أراد الباحثون في هذه الورقة البحثية الاستماع إلى هذا "الضجيج" ومعرفة ما يشعر به الطلاب بالضبط. لم يكتفوا بسؤال عدد قليل من الناس؛ بل جمعوا أكثر من 2000 رأي مكتوب واستخدموا نوعين مختلفين من "الآذان الرقمية" للاستماع إليهم وتصنيفهم إلى سعيد/داعم أو قلق/سلبي.
إليكم كيف فعلوا ذلك، مشروحًا ببساطة:
الأذنان الرقميتان (المنهجيات)
اختبر الباحثون طريقتين لفهم آراء الطلاب هذه، مثل مقارنة أمين مكتبة سريع وفعال مقابل بروفيسور عميق التفكير.
1. أمين المكتبة السريع (تعلم الآلة باستخدام SVM)
كيف يعمل: تستخدم هذه الطريقة تقنية تسمى TF-IDF. تخيل أخذ كل كلمة كتبها الطالب وعدّ عدد مرات ظهورها. إذا كتب طالب "الذكاء الاصطناعي رائع"، فإن النظام يسجل أن كلمة "رائع" هي كلمة قوية بالنسبة له. إنه يعامل النص كحقيبة من الكلمات، بحثًا عن كلمات مفتاحية محددة تشير إلى السعادة أو القلق.
الأداة: استخدموا نموذجًا يسمى SVM (آلة ناقلات الدعم). فكر في SVM كفرز حاد وفعال للغاية. فهو يرسم خطًا في الرمل للفصل بين الكلمات "الإيجابية" والكلمات "السلبية". إنه سريع، ولا يحتاج إلى الكثير من قدرة الحوسبة، وهو بارع في رصد الأنماط في قوائم الكلمات البسيطة.
النتيجة: كان هذا "الأمين" جيدًا جدًا! لقد أصاب حوالي 82% من الآراء. كان أفضل الطرق التقليدية، مما يثبت أنه ليس من الضروري دائمًا امتلاك كمبيوتر خارق للحصول على قراءة جيدة للجمهور.
2. البروفيسور عميق التفكير (المحول باستخدام DistilBERT)
كيف يعمل: يستخدم هذا الأسلوب DistilBERT، وهو نوع من الذكاء الاصطناعي القائم على "المحولات" (Transformers). بخلاف أمين المكتبة الذي يكتفي بعدّ الكلمات، يقرأ البروفيسور الجملة كاملة ويفهم السياق. هو يعلم أن جملة "الذكاء الاصطناعي ليس رائعًا" تختلف تمامًا عن "الذكاء الاصطناعي رائع"، رغم اشتراكهما في نفس الكلمات. إنه يفهم الفروق الدقيقة، والنبرة، والمعنى الخفي.
الأداة: DistilBERT هو نسخة "مخففة" من عقل ذكاء اصطناعي ضخم. إنه يشبه بروفيسورًا قرأ الإنترنت بأكمله ولكنه صغير بما يكفي ليتناسب مع جهاز كمبيوتر محمول قياسي.
النتيجة: كان هذا "البروفيسور" هو البطل، حيث حقق حوالي 85% من الآراء بشكل صحيح. كان أفضل قليلاً من أمين المكتبة لأنه فهم المشاعر وراء الكلمات، وليس مجرد الكلمات نفسها.
إعداد التجربة
البيانات: جمعوا 2,295 تعليقًا من الطلاب. كانت منافسة عادلة: نصف الطلاب تقريبًا كانوا سلبيين (قلقون بشأن الغش أو فقدان المهارات)، والنصف الآخر كانوا إيجابيين (متحمسون لكفاءة التعلم).
الاختبار: قسموا البيانات إلى ثلاث مجموعات:
التدريب (80%): لتعليم النماذج.
التحقق (10%): لمراجعة واجباتهم المنزلية.
الاختبار (10%): الامتحان النهائي لمعرفة من تعلم بالفعل.
المواجهة: من الفائز؟
المتنافس
الأسلوب
النتيجة النهائية (الدقة)
السرعة
LightGBM
السريع الخاطف
~50% (أخطأ الهدف)
سريع جدًا
Random Forest
لاعب الفريق
~59% (جيد، لكن ليس رائعًا)
سريع
SVM
أمين المكتبة الفعال
82.14%
سريع
DistilBERT
البروفيسور العميق
84.78%
أبطأ (يستغرق دقائق للتدريب)
الفائز: حصد DistilBERT الميدالية الذهبية بأعلى دقة. لقد أثبت أن فهم سياق الجملة يمنحك قراءة أفضل للمشاعر البشرية.
الوصيف: جاء SVM في المركز الثاني. ورغم أنه لم يفز، إلا أن الورقة تشير إلى أنه لا يزال "بديلًا قويًا ومنخفض التكلفة". إذا كنت بحاجة إلى إجابة سريعة ولا تملك كمبيوترًا خارقًا، فإن أمين المكتبة (SVM) لا يزال خيارًا موثوقًا للغاية.
الخلاصة
تخلص الورقة إلى أنه بينما يعد "البروفيسور العميق" (DistilBERT) الأكثر دقة في فهم مشاعر الطلاب الإندونيسيين تجاه الذكاء الاصطناعي في مدارسهم، فإن "أمين المكتبة الفعال" (SVM) لا يزال أداة قوية جدًا وأسرع بكثير وأقل تكلفة في التشغيل.
أخيرًا، لم يتوقف الباحثون عند الأرقام فحسب. بل بنوا تطبيق ويب مباشرًا (باستخدام أداة تسمى Gradio) حيث يمكن لأي شخص كتابة جملة، وسيقوم النظام فورًا بإخباره ما إذا كان الشعور إيجابيًا أم سلبيًا، مع درجة ثقة كاملة. إنه يشبه امتلاك خاتم رقمي لتغيير الحالة المزاجية لآراء الطلاب.
باختصار: لفهم مشاعر الطلاب تجاه الذكاء الاصطناعي، يمكنك استخدام فرز سريع يعتمد على الكلمات المفتاحية (SVM) أو قارئ ذكي يدرك السياق (DistilBERT). القارئ الذكي يفوز في الدقة، لكن الفرز السريع لا يزال أداة مفيدة جدًا.
إليك ملخص تقني مفصل لورقة البحث بعنوان "تحليل المشاعر تجاه تبني الذكاء الاصطناعي في التعليم العالي الإندونيسي باستخدام تعلم الآلة والنماذج القائمة على المحولات (Transformer-Based Models)."
1. بيان المشكلة
أدى التبني السريع للذكاء الاصطناعي (AI) في التعليم العالي الإندونيسي إلى توليد مزيج معقد من آراء الطلاب، تتراوح بين دعم كفاءة التعلم والمخاوف المتعلقة بالنزاهة الأكاديمية، والاعتماد المفرط، وتآكل مهارات التفكير النقدي.
الفجوة: بينما يعد تحليل المشاعر أداة قياسية لقياس الرأي العام، إلا أن هناك نقصاً في الدراسات المقارنة التي تقيم فعالية تعلم الآلة الكلاسيكي (ML) مقابل التعلم العميق القائم على المحولات (Transformer-based deep learning) خصيصاً للنصوص باللغة الإندونيسية في سياق تبني الذكاء الاصطناعي في التعليم.
الهدف: إجراء تحليل منهجي لآراء الطلاب الإندونيسيين حول الذكاء الاصطناعي وتحديد أي نهج نمذجة (التعلم الآلي القائم على TF-IDF مقابل التعلم العميق القائم على المحولات) يقدم أداءً فائقاً لتصنيف المشاعر الثنائي (إيجابي مقابل سلبي) في هذا المجال المحدد.
2. المنهجية
أ. بناء مجموعة البيانات
المصدر: استخدمت الدراسة مجموعة بيانات هجينة تجمع بين 1,154 رأياً خاماً للطلاب حول الذكاء الاصطناعي في التعليم العالي مع 1,141 عينة من قاموس معجمي إيجابي/سلبي.
الحجم الإجمالي: 2,295 عينة مصنفة.
توزيع الفئات: مجموعة البيانات متوازنة تقرياً:
سلبي: 1,158 عينة (50.46%)
إيجابي: 1,137 عينة (49.54%)
المعالجة المسبقة: تضمنت تنظيف النصوص تحويل الحروف إلى حالة صغرى (lowercasing)، وإزالة الروابط/الإشارات/الوسوم/علامات الترقيم، وتطبيع الكلمات غير القياسية، ومعالجة الحروف المتكررة.
ب. سير العمل التجريبي
تم تقسيم البيانات بنسبة 80:10:10 لمجموعات التدريب، والتحقق، والاختبار. تم تنفيذ مسارين متميزين:
1. مسار تعلم الآلة (الأساس المرجعي)
استخراج الميزات: تم تحويل النصوص إلى ناقلات TF-IDF باستخدام الـ unigrams والـ bigrams.
النماذج التي تم تقييمها:
LightGBM: نموذج تعزيز تجميعي (تم ضبطه بـ n_estimators=100 و max_depth=10).
الغابة العشوائية (Random Forest): نموذج تجميعي موازي (تم ضبطه بـ n_estimators=100 و max_depth=20).
آلة ناقلات الدعم (SVM): مصنف يعتمد على النواة باستخدام نواة RBF (C=1.0).
الاختيار: تم اختيار النماذج بناءً على دقة التحقق، حيث تم اختيار SVM كأفضل ممثل لتعلم الآلة للمقارنة النهائية.
2. مسار التعلم العميق (المحولات - Transformer)
النموذج:DistilBERT (distilbert-base-uncased)، وهو نسخة مخففة ومقطرة من BERT مصممة للحفاظ على الأداء مع تقليل التكلفة الحسابية.
البنية: مشفر مكون من ست طبقات مع آليات الانتباه الذاتي (self-attention).
الإعدادات:
طول التسلسل الأقصى: 128 توكن (token).
حجم الدفعة (Batch size): 64.
المُحسّن (Optimizer): AdamW بمعدل تعلم قدره 1×10−6.
التنظيم (Regularization): إسقاط (Dropout) بنسبة 0.5، واضمحلال الوزن (Weight Decay) بنسبة 0.001.
التدريب: 100 حقبة (epoch) مع التوقف المبكر (Early Stopping) بناءً على مقياس F1 للتحقق (الصبر = 5).
ج. مقاييس التقييم
تم تقييم الأداء باستخدام الدقة (Accuracy)، والدقة المحددة (Precision)، والاستدعاء (Recall)، ومقياس F1-score.
3. النتائج الرئيسية
أ. أداء تعلم الآلة
LightGBM: أدى أداءً ضعيفاً (دقة الاختبار: 49.67%، F1: 48.46%)، مما يشير إلى معاناته مع ميزات TF-IDF المتفرقة وعالية الأبعاد في هذا السياق.
الغابة العشوائية (Random Forest): أظهر تحسناً متوسطاً (دقة الاختبار: 58.61%، F1: 56.48%) لكنه ظل أدنى من SVM.
آلة ناقلات الدعم (SVM): برز كأفضل نموذج تعلم آلي كلاسيكي.
دقة التحقق: 87.25%
دقة الاختبار:82.14%
درجة F1 للاختبار:82.14%
ملاحظة: أظهر SVM متانة في التعامل مع بيانات النصوص عالية الأبعاد، حيث صنف بشكل صحيح 377 من أصل 459 عينة اختبار.
ب. أداء المحولات (DistilBERT)
دقة الاختبار:84.78%
درجة F1 للاختبار:84.75% (الموزونة)
تفصيل الفئات:
درجة F1 للفئة السلبية: 0.8548
درجة F1 للفئة الإيجابية: 0.8402
ملاحظة: أظهر DistilBERT انحيازاً طفيفاً نحو استدعاء أعلى للعينات السلبية، لكنه حافظ على دقة متوازنة عبر الفئات. أشارت خسارة التدريب (0.28) وخسارة التحقق (0.36) إلى تعميم جيد دون فرط في التخصيص (overfitting) شديد.
ج. التحليل المقارن
فجوة الأداء: تفوق DistilBERT على أفضل نموذج تعلم آلي (SVM) بنسبة 2.64% في الدقة و 2.61% في درجة F1.
مقايضة الكفاءة:
SVM: سريع جداً في وقت التدريب (0.210 ثانية).
DistilBERT: وقت تدريب أطول بكثير (22.8 دقيقة) بسبب المعالجة المكثفة لوحدة معالجة الرسومات (GPU).
الاستنتاج حول النماذج: بينما تلتقط نماذج المحولات سياقاً دلالياً أغنى مما يؤدي إلى دقة أعلى، يظل SVM بديلاً تنافسياً للغاية ومنخفض التكلفة لتصنيف المشاعر بكفاءة.
4. المساهمات الرئيسية
التحليل الخاص بالسياق: يوفر أدلة تجريبية حول كيفية إدراك طلاب الجامعات الإندونيسيين لتبني الذكاء الاصطناعي، مما يعالج فجوة في أدبيات معالجة اللغات الطبيعية (NLP) المحلية.
المقارنة المنهجية: يقدم معياراً صارماً يقارن بين نهج TF-IDF/SVM التقليدي ونماذج المحولات الحديثة (DistilBERT) للنصوص الإندونيسية التعليمية.
إنشاء مجموعة بيانات: تم تنسيق ومعالجة مجموعة بيانات متوازنة مكونة من 2,295 عينة إندونيسية تركز خصيصاً على الذكاء الاصطناعي في التعليم العالي.
النشر العملي: تم نشر النموذج الأفضل أداءً (DistilBERT) كتطبيق ويب تفاعلي باستخدام Gradio و Hugging Face Spaces، مما يسمح بالتنبؤ بالمشاعر في الوقت الفعلي مع درجات الثقة.
5. الأهمية والعمل المستقبلي
الأهمية: تثبت هذه الدراسة أنه بينما توفر نماذج التعلم العميق (المحولات) دقة فائقة من خلال فهم السياق، فإن النماذج الكلاسيكية مثل SVM لا تزال قابلة للتطبيق في البيئات محدودة الموارد. يساعد هذا المؤسسات التعليمية في اختيار الأدوات المناسبة لصنع السياسات بناءً على ملاحظات الطلاب.
الاتجاهات المستقبلية:
توسيع حجم مجموعة البيانات.
إدخال فئة محايدة للتصنيف ثلاثي الاتجاهات.
استخدام نماذج مدربة مسبقاً خاصة باللغة الإندونيسية (مثل IndoBERT) بدلاً من distilbert-base-uncased المتمحور حول اللغة الإنجليزية.
إجراء تحليل المشاعر القائم على الجوانب (Aspect-based sentiment analysis) لتحديد مخاوف محددة (مثل النزاهة مقابل كفاءة التعلم) بدلاً من مجرد القطبية العامة.