← أحدث الأبحاث
⚡ electrical engineering

Improving Requirements Classification with SMOTE-Tomek Preprocessing

تُظهر هذه الدراسة أن تطبيق المعالجة المسبقة باستخدام SMOTE-Tomek بالتزامن مع التحقق المتقاطع لـ K-fold الطبقي على مجموعة بيانات PROMISE يحسن بشكل كبير دقة تصنيف المتطلبات الوظيفية وغير الوظيفية، مما يرفع أداء الانحدار اللوجستي من خط أساس بنسبة 58.31% إلى 76.16%.

المؤلفون الأصليون: Barak Or

نُشر 2026-05-28
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Barak Or

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك أمين مكتبة تحاول فرز كومة ضخمة من الملاحظات المختلطة إلى حاويتين رئيسيتين: "أشياء يجب على النظام القيام بها" (وظيفية) و "كيف يجب أن يتصرف النظام" (غير وظيفية، مثل أن يكون سريعاً، أو آمناً، أو سهل الاستخدام).

المشكلة هي أن الكومة فوضوية. معظم الملاحظات تدور حول "الأمان" أو "سهولة الاستخدام"، ولكن هناك حفنة قليلة فقط من الملاحظات حول "قابلية النقل" (نقل النظام إلى أجهزة كمبيوتر مختلفة). إذا تركت جهاز كمبيوتر يقوم بفرز هذه الكومة ببساطة، فسوف يصبح كسولاً. سيخمن "الأمان" لكل شيء تقريباً لأنه يرى ذلك كثيراً. وسيتجاهل تماماً الملاحظات النادرة لأنه لم يرَ ما يكفي منها ليتعلم شكلها.

هذه الورقة البحثية تتحدث عن تعليم الكمبيوتر كيف يكون أمين مكتبة أفضل عبر إصلاح الفوضى في الكومة قبل البدء في عملية الفرز.

المشكلة: "الفئة غير المتوازنة"

استخدم الباحثون مجموعة شهيرة مكونة من 969 ملاحظة برمجية (مجموعة بيانات PROMISE).

  • المشكلة: الملاحظات غير متوازنة بشكل كبير. بعض الفئات تحتوي على 125 ملاحظة، بينما تحتوي فئات أخرى على 12 ملاحظة فقط.
  • النتيجة: بدون مساعدة، سيصبح "عقل" الكمبيوتر (نماذج تعلم الآلة) منحازاً. سيصبح خبيراً في رصد الملاحظات الشائعة ولكنه سيء جداً في رصد الملاحظات النادرة. في هذه الدراسة، حقق نموذج كمبيوتر قياسي حوالي 58% فقط من الملاحظات بشكل صحيح.

الحل: وصفة "SMOTE-Tomek"

لإصلاح ذلك، استخدم المؤلفون وصفة خاصة لتنظيف وموازنة البيانات مكونة من خطوتين تسمى SMOTE-Tomek. فكر في الأمر كطاهٍ يجهز المكونات لحساء تنقص بعض الخضروات فيه.

  1. SMOTE (الطاهي الاصطناعي):
    بدلاً من مجرد تصوير الملاحظات النادرة القليلة (وهو أمر ممل ولا يساعد كثيراً)، يعمل SMOTE كطاهٍ مبدع. ينظر إلى ملاحظتين نادرتين متشابهتين و"يطبخ" ملاحظة جديدة وهمية تقع بينهما تماماً.
  • مثال توضيحي: إذا كان لديك ملاحظتان تقولان "يجب أن يكون النظام سريعاً"، فإن SMOTE ينشئ ملاحظة جديدة تقول "يجب أن يكون النظام سريعاً واستجابته سريعة". إنه يملأ الفجوات حتى يرى الكمبيوتر أمثلة كافية لتعلم النمط.
  1. Tomek Links (فلتر الضجيج):
    أحياناً، عندما تصنع ملاحظات جديدة، قد تنشئ بالخطأ بعض الملاحظات المربكة أو الفوضوية (مثل ملاحظة تبدو وكأنها تنتمي لـ "الأمان" و"سهولة الاستخدام" في آن واحد). يعمل Tomek كمحرر صارم؛ فهو يجد هذه الملاحظات المربكة والحدودية ويقوم بالتخلص منها لجعل الفئات أكثر وضوحاً.
  • مثال توضيحي: إذا كانت الملاحظة غامضة جداً بحيث يمكن أن تنتمي لفئتين مختلفتين، يقوم المحرر بإزالتها حتى لا يرتبك الكمبيوتر بشأن مكان انتمائها.

التجربة: "الاختبار العادل"

لم يكتفِ الباحثون برمي جميع الملاحظات في الخلاط. بل استخدموا طريقة تسمى Stratified K-Fold Cross-Validation.

  • مثال توضيحي: تخيل أن لديك مجموعة أوراق لعب ذات أشكال مختلفة. تريد اختبار مهارة لاعب. ستقسم المجموعة إلى 10 أكوام. ستترك اللاعب يتدرب على 9 أكوام (حيث تستخدم "الطاهي الاصطناعي" لإضافة المزيد من الأوراق) ثم تختبره على الكومة العاشرة (التي تظل دون مساس ونقية). ستقوم بتدوير هذه العملية بحيث تحصل كل كومة على دورها كاختبار.
  • لماذا يهم هذا: هذا يضمن أن الكمبيوتر لا يغش عن طريق حفظ إجابات الاختبار. إنه يثبت أن الكمبيوتر قد تعلم القواعد فعلياً.

النتائج: فوز كبير للمنطق

لقد اختبروا العديد من "الأدمغة" (الخوارزميات) المختلفة في هذه المهمة.

  • قبل الإصلاح: أفضل أداء (Linear SVM) حقق حوالي 71% من الصحة. أما نموذج "الانحدار اللوجستي" (Logistic Regression) البسيط (نموذج منطقي بسيط) فقد حقق 58% فقط.
  • بعد الإصلاح (SMOTE-Tomek): قفز نموذج الانحدار اللوجستي البسيط إلى دقة 76.16%!

لماذا كان النموذج البسيط هو الفائز؟
وجدت الورقة أن النموذج البسيط أصبح أكثر استقراراً.

  • بدون الإصلاح: كان النموذج في حالة ذعر. كان يصرخ: "هذه الكلمة تعني 'قابلية النقل'!" ويعطيها وزناً هائلاً، لمجرد أنه رأى أمثلة قليلة جداً عليها.
  • مع الإصلاح: هدأ النموذج. تعلم رؤية متوازنة. أدرك أن: "حسناً، 'قابلية النقل' عادة ما تتضمن كلمات مثل 'متصفح'، 'نظام'، و'تشغيل'، ولكن لا توجد كلمة واحدة هي المفتاح السحري".

الخلاصة

تظهر هذه الدراسة أنك لست بحاجة دائماً إلى "عقل" معقد ومكلف (مثل التعلم العميق Deep Learning الذي يتطلب كميات هائلة من البيانات والطاقة) لفرز المتطلبات البرمجية.

إذا كان لديك مجموعة بيانات صغيرة وفوضوية، يمكنك الحصول على نتائج ممتازة من خلال:

  1. تنظيف البيانات (إزالة الملاحظات المربكة).
  2. تخليق أمثلة جديدة (ملء الفجوات للفئات النادرة).
  3. استخدام نموذج بسيط وقابل للتفسير (مثل الانحدار اللوجستي) الذي يمكنه شرح سبب اتخاذه لقرار ما.

تخلص الورقة إلى أن هذا النهج يجعل الكمبيوتر أمين مكتبة أكثر موثوقية، وقادراً على رصد حتى أندر أنواع المتطلبات البرمجية بدقة عالية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →