When Unseen Attacks Look Normal: Open-Set Evaluation, Feature Observability, and Protocol-Invariant Detection in Mobile Ad Hoc Networks
تُثبت هذه الورقة أنه في حين تفشل نماذج تعلم الآلة القياسية في اكتشاف الهجمات غير المرئية في الشبكات اللاسلكية من نوع (Mobile Ad Hoc Networks) بسبب اعتمادها على التوزيعات المتغيرة، فإن ميزة بسيطة ثابتة البروتوكول —وهي عدّ جيران التوجيه الذين ليس لديهم إطارات مفككة— تحقق كشفًا مثاليًا لهجمات الثقب الدودي (wormhole attacks) من خلال تحديد الانتهاكات الهيكلية بدلاً من الشذوذ الإحصائي.
في عالم الشبكات اللاسلكية المتنقلة (MANETs) الفوضوي، تتواصل الأجهزة مع بعضها البعض دون وجود برج مركزي أو بنية تحتية ثابتة لتوجيهها. تخيل مجموعة من المتنزهين في غابة كثيفة، يحمل كل منهم جهاز راديو. لإرسال رسالة عبر المجموعة، يجب على أحد المتنزهين تمريرها إلى جار له، والذي يمررها بدوره إلى آخر، حتى تصل إلى وجهتها. هذا النظام مفيد للغاية في حالات الإغاثة من الكوارث أو العمليات العسكرية حيث لا توجد أبراج اتصال، ولكنه هش أيضاً. ولأن كل جهاز يعمل كمرسل ومرحل في آن واحد، فإن جهازاً واحداً غير مخلص يمكن أن يخرب المحادثة بأكملها؛ إذ يمكنه التظاهر بأنه جار متعاون، أو سرقة الرسائل، أو ببساطة إلقائها في التراب. لسنوات، حاول الباحثون بناء "كلاب حراسة رقمية" لرصد هؤلاء الخونة. لقد قاموا بتدريب برامج حاسوبية للتعرف على أنواع محددة من السلوك السيئ، مثل الجهاز الذي يتوقف فجأة عن تمرير الرسائل أو الجهاز الذي يغرق الشبكة بطلبات وهمية. وعادة ما تُختبر هذه البرامج لمعرفة مدى قدرتها على فرز المعتدين المعروفين عن الصالحين. وإذا استطاع البرنامج التمييز بين اللص والمتنزه، فإنه يُعتبر ناجحاً.
ومع ذلك، تشير دراسة جديدة إلى أن طريقة الاختبار هذه ناقصة بشكل خطير. فقد اكتشف الباحثون، الذين عملوا باستخدام محاكاة حاسوبية دقيقة لمائة جهاز متحرك، أن البرنامج قد يكون ممتازاً في رصد خمسة أنواع محددة من الهجمات التي تدرّب عليها، ومع ذلك يكون أعمى تماماً تجاه نوع سادس لم يره من قبل. في تجاربهم، أنشأوا سيناريو يتضمن خمسة أنواع مختلفة من التخريب: "الثقب الأسود" الذي يبتلع جميع حركة المرور، و"الثقب الرمادي" الذي يسقط نصف الرسائل، و"الثقب النابض" (Sinkhole) الذي يخدع الأجهزة لتوجيه حركة المرور إلى طريق مسدود، وهجوم "الإغراق" الذي يسد الشبكة بالضجيج، وهجوم "الثقب الدودي" (Wormhole) الذي ينشئ نفقاً سرياً بين جهازين بعيدين. لقد دربوا سبعة أساليب كشف مختلفة للتعرف على هذه التهديدات الخمسة. وعندما اختبر الباحثون هذه الأساليب فقط على الهجمات التي سبق رؤيتها، حققت البرامج دقة عالية جعلت جميعها تبدو وكأنها فائزة. لكن الاختبار الحقيقي جاء عندما أخفوا نوعاً واحداً من الهجمات عن بيانات التدريب وطلبوا من البرامج العثور عليه وسط حركة مرور طبيعية.
كانت النتائج مذهلة. فالبرامج الأكثر تطوراً، والتي استخدمت شبكات عصبية معقدة تشبه تلك التي تشغل تقنيات التعرف على الصور، فشلت فشلاً ذريعاً. فعند مواجهة هجمات الإغراق، والثقب النابب، والثقب الدودي غير المرئية، صنفت هذه الشبكات العصبية المعتدين السيئين بالإجماع كأجهزة طبيعية وغير ضارة. لقد كانت واثقة جداً من إجاباتها الخاطئة لدرجة أن درجات الثقة لديها كانت لا تختلف عن درجات إجاباتها الصحيحة. وفي الواقع، بالنسبة لهجمات الثقب الأسود والإغراق، كان أداء هذه البرامج الذكية أسوأ من التخمين العشوائي. وكان الأسلوب الوحيد الذي أظهر أي قدرة حقيقية على رصد التهديدات غير المعروفة هو نهج أبسط يعتمد على "غابة من أشجار القرار". نجح هذا الأسلوب لأنه، على عكس الشبكات العصبية، استطاع استشعار أنه ينظر إلى شيء لا يفهمه؛ فعندما لا تتوافق البيانات مع تدريبه، كانت الأشجار في "غابته" تختلف مع بعضها البعض، مما خلق إشارة من عدم اليقين افتقرت إليها البرامج الأخرى.
كما كشفت الدراسة عن خلل جوهري في كيفية بناء هذه المحاكاة غالباً. فأحد الهجمات، وهو الثقب الدودي، تم رصده في البداية بدقة شبه كاملة، لكن الباحثين أدركوا أن هذا كان وهماً. فقد منحت المحاكاة أجهزة الكشف وصولاً إلى الإحداثيات الفيزيائية الدقيقة لكل جهاز، مما سمح لها بقياس المسافة الحقيقية بين الجيران. أما في العالم الحقيقي، فلا يمكن للجهاز معرفة موقعه الدقيق أو الموقع الدقيق للآخرين، بل يمكنه فقط تقدير المسافة بناءً على قوة إشارة الراديو. وعندما أزال الباحثون هذا "الاختصار" وأجبروا أجهزة الكشف على الاعتماد فقط على المعلومات القابلة للملاحظة، انهارت كفاءة الأداء في هجوم الثقب الدودي؛ إذ لم تعد أجهزة الكشف قادرة على التمييز بين الجهاز الطبيعي ونقطة نهاية الثقب الدودي.
ولحل هذه المعضلة، وجد الباحثون نوعاً مختلفاً من الأدلة لا يتطلب معرفة مواقع الأجهزة. فقد لاحظوا أنه في هجوم الثقب الدودي، يعمل جهازيان كنقاط نهاية للنفق، فيظهران كجيران في جدول توجيه الشبكة رغم أنهما لم يسمعا إشارات الراديو الخاصة ببعضهما البعض فعلياً. في الشبكة الطبيعية، لا يدرج الجهاز جاراً في قائمته إلا إذا استلم منه رسالة بنجاح. لذا وضع الباحثون قاعدة بسيطة: إذا رأى الجهاز جاراً في قائمته لم يسمع صوته قط، فهذا هو الثقب الدودي. هذا الملاحظة الواحدة، التي تعتمد على قاعدة أساسية لكيفية عمل البروتوكول في الشبكة، فصلت بين المهاجمين في الثقب الدودي وبين جميع الأجهزة الأخرى بدقة تامة في كل اختبار.
تخلص الورقة البحثية إلى أن الطريقة الحالية لتقييم الأنظمة الأمنية مضللة. فالنظام الذي يسجل درجات عالية في الهجمات المعروفة قد يكون عديم الفائدة ضد الهجمات الجديدة. وتظهر الدراسة أن اختيار كيفية تعبير النظام عن ثقته يهم أكثر من تعقيد النموذج نفسه. فقد ثبت أن فحصاً بسيطاً لخرق بروتوكول الشبكة كان أكثر فعالية من نموذج تعلم معقد في حالة هجوم الثقب الدودي، بينما كان هناك حاجة لنوع مختلف من النماذج لرصد هجوم الإغراق. ويجادل الباحثون بأن اختبار الأمن يجب أن يتجاوز مجرد التحقق مما إذا كان النظام يعرف الحيل القديمة، بل يجب أيضاً اختبار كيفية استجابة النظام عندما يواجه نوعاً جديداً تماماً من المشاكل، لضمان أن "كلاب الحراسة الرقمية" يمكنها بالفعل أن تنبح عندما ترى شيئاً لم تره من قبل.
ملخص تقني: عندما تبدو الهجمات غير المرئية طبيعية
بيان المشكلة
تفتقر الشبكات المتنقلة ذات الطبوغرافيا المتغيرة (MANETs) إلى البنية التحتية الثابتة والسلطة المركزية، مما يجعل بروتوكولات التوجيه هي سطح الهجوم الأساسي. تُقيم أنظمة كشف التسلل (IDS) الحالية لهذه الشبكات في الغالب كمسائل تصنيف "مجموعة مغلقة" (closed-set)، حيث يتم تدريب النماذج واختبارها على مجموعة ثابتة ومعروفة من فئات الهجمات. يفترض هذا الإطار أن الكواشف المنشورة ستواجه فقط الهجمات التي تم تدريبها صراحةً على التعرف عليها.
ومع ذلك، في حالات النشر الواقعي، يجب على النموذج المدرب على الفصل بين خمس فئات معروفة أن يتعامل مع هجوم سادس غير مرئي. يبحث هذا البحث فيما يحدث عندما يواجه النموذج هجوماً لم يره من قبل. وتحديداً، يتساءل البحث عما إذا كانت مقاييس المجموعة المغلقة القياسية (مثل الدقة أو مقياس F1) يمكنها التنبؤ بموثوقية سلوك النموذج تجاه التهديدات غير المرتئية، وما إذا كانت إشارات الثقة القياسية (مثل أقصى احتمال لـ softmax) يمكنها التمييز بين فئة معروفة وهجوم غير معروف.
المنهجية
أجرى المؤلفون تقييماً محكماً باستخدام عمليات محاكاة ns-3 تضمنت 120 تشغيلاً لـ 100 عقدة تتحرك عبر مسار عشوائي (random waypoint) في مجال مساحته 1500×1500 متر. استخدمت الشبكة بروتوكول التوجيه AODV عبر معيار IEEE 802.11b.
التصميم التجريبي:
الهجمات: تم تنفيذ خمسة هجمات توجيه: الثقب الأسود (Black Hole)، الثقب الرمادي (Grey Hole)، الثقب الخاطف (Sinkhole)، الإغراق (Flooding)، والثقب الدودي (Wormhole).
النماذج: تم تقييم سبعة كواشف على ميزات وتقسيمات بيانات متطابقة: شجرة القرار (Decision Tree)، k-NN، SVM، الغابة العشوائية (Random Forest - 300 شجرة)، CNN-1D، LSTM، وGRU. بالإضافة إلى ذلك، تم تدريب مشفر تلقائي (Autoencoder) يعتمد على GRU على حركة المرور السليمة (benign) فقط.
بروتوكول التقييم:
المجموعة المغلقة (Closed-Set): تحقق تقاطع وثاقي رباعي (4-fold cross-validation) قياسي على جميع الهجمات المعروفة.
المجموعة المفتوحة (Open-Set - Leave-One-Attack-Out): تم استبعاد كل هجوم من التدريب بالتناوب. ثم تم اختبار النموذج على الهجوم غير المرئي لقياس قدرته على كشف الجدة (novelty).
تسجيل عدم اليقين (Uncertainty Scoring): تمت مقارنة ثلاثة درجات للجدة:
أقصى احتمال لـ softmax (الخط المرجعي القياسي).
اختلاف تصويت المجموعة (Ensemble Vote Disagreement) (بالنسبة للغابة العشوائية).
خطأ إعادة البناء (Reconstruction Error) (بالنسبة للمشفر التلقائي).
إمكانية ملاحظة الميزات (Feature Observability): ميزت الدراسة بين الميزات التي يمكن للعقدة المنشورة ملاحظتها (حالة البروتوكول، قوة الإشارة المستلمة RSSI) والميزات المستمدة من المحاكي (الإحداثيات الهندسية الحقيقية).
المساهمات الرئيسية
فك الارتباط بين أداء المجموعة المغلقة والمجموعة المفتوحة: تظهر الدراسة أن الأداء العالي في المجموعة المغلقة لا يرتبط بالقدرة في المجموعة المفتوحة. وبينما حققت سبعة كواشف نطاقاً ضيقاً من مقياس F1 الكلي (0.878–0.944) للهجمات المعروفة، إلا أن أداءها على الهجمات غير المرئية تباين بشكل هائل (AUROC من 0.10 إلى 0.98).
فشل إشارات الثقة العصبية: فشلت البنى العصبية (CNN, LSTM, GRU) باستمرار في تحديد الهجمات غير المرئية. فقد نسبت الهجمات غير المرئية إلى الفئة "الطبيعية" بثقة عالية (تعيين بالإجماع في كثير من الحالات)، وانخفضت قيم أقصى احتمال لـ softmax لديها إلى ما دون مستوى الصدفة (AUROC 0.10–0.25) لعدة هجمات.
اختلاف التصويت كإشارة للجدة: كانت نموذج الغابة العشوائية هو الاستثناء. حيث عمل اختلاف أصواتها (نسبة الأشجار التي صوتت للفئة الفائزة) كتقدير قوي لعدم اليقين، محققاً درجات AUROC بلغت 0.982 في الثقب الأسود، و0.934 في الثقب الرمادي، و0.965 في الإغراق.
فخ "الثقب الدودي" وثوابت البروتوكول:
اعتمدت النتائج الأولية لكشف الثقب الدودي (AUROC 0.950) على ميزات المسافة الهندسية المستمدة من إحداثيات المحاكي الحقيقية، وهي غير متوفرة عند النشر الفعلي.
أدى حذف هذه الميزات المستمدة من المحاكي فقط إلى انخفاض الأداء إلى مستوى الصدفة (AUROC 0.571).
حدد المؤلفون ثابتاً بروتوكولياً قابلاً للنشر: وهو عدد جيران التوجيه الذين لم تقم العقدة بفك تشفير إطار منهم مطلقاً (ν). في حركة المرور الصادقة، تكون هذه القيمة دائماً صفراً. في نفق الثقب الدودي، تسجل النهايات أطرافاً لم "تسمعها" من قبل.
حقق وضع عتبة لهذا الإحصائي الملحوظ وحده AUROC 1.000 لكشف الثقب الدودي، متفوقاً على جميع النماذج المتعلمة.
محدودية الكشف القائم على إعادة البناء: توضح الدراسة سبب فشل المشفرات التلقائية في كشف الثقب الدودي (Wormhole) والثقب الرمادي (Grey Hole) عند استخدام الميزات القابلة للملاحظة. يكتشف خطأ إعادة البناء الانحرافات عن التوزيع؛ وإذا كانت الميزة ثابتة في حركة المرور السليمة (مثل ν=0)، فإن النموذج يتعلم إعادة بناء هذا الثابت بشكل مثالي. أما الشذوذ فهو انتهاك لقيد صارم، وليس مجرد سحب غير عادي من توزيع، مما يجعل خطأ إعادة البناء غير فعال بدون وضع عتبة مباشرة.
النتائج
المجموعة المغلقة: تراوحت السبعة كواشف في نطاق F1 كلي قدره 0.066 (من 0.878 إلى 0.944). كان أداء الغابة العشوائية هو الأفضل، لكن الاختلافات لم تكن ذات دلالة إحصائية عبر طيات (folds) التحقق، مما يشير إلى أن مقاييس المجموعة المغ closed-set لا يمكنها ترتيب الكواشف بشكل موثوق لهذه المشكلة.
المجموعة المفتوحة (الهجمات غير المرئية):
الشبكات العصبية: نسبت الهجمات غير المرئية إلى الفئة "الطبيعية" بالإجماع. على سبيل المثال، تم تصنيف 19/19 من عقد الإغراق و20/20 من عقد الثقب الخاطف كحركة طبيعية.
الغابة العشوائية: نجحت في فصل هجمات الثقب الأسود، والثقب الرمادي، والإغراق غير المرئية عن حركة المرور الطبيعية باستخدام اختلاف التصويت.
المشفر التلقائي: نجح في كشف الإغراق (AUROC 0.996) والثقب الخاطف (AUROC 0.996) لكنه فشل في الثقب الرمادي (AUROC 0.374) والثقب الدودي (AUROC 0.571 بدون الهندسة).
الثقب الدودي: لم يحقق أي مصنف تمييزي درجة قابلة للاستخدام (أفضلها كان LSTM بنسبة 0.637). فقط الثابت البروتوكولي (ν>0) حقق فصلاً تاماً.
إمكانية ملاحظة الميزات: تسبب حذف الميزات الهندسية المستمدة من المحاكي في انخفاض درجة كشف الثقب الدودي من 0.950 إلى 0.571، مما يسلط الضوء على خطر الإفراط في التخصيص (overfitting) لآثار المحاكاة.
الأهمية والادعاءات
يجادل البحث بأن نموذج التقييم الحالي لكشف التسلل في شبكات MANET غير كافٍ. تكمن الأهمية الرئيسية في ثلاث نتائج:
دقة المجموعة المغلقة هي مؤشر سيء لمتانة المجموعة المفتوحة. يمكن للنموذج أن يكون دقيقاً للغاية في الهجمات المعروفة بينما يكون أعمى تماماً تجاه الهجمات غير المرئية.
اختيار آلية عدم اليقين أكثر أهمية من بنية النموذج نفسه. وفر اختلاف تصويت الغابة العشوائية إشارة جدة قابلة للاستخدام حيث فشلت احتمالات softmax للشبكات العصبية فشلاً ذريعاً.
ثوابت البروتوكول يمكن أن تتفوق على النماذج المتعلمة. بالنسبة للهجمات التي تنتهك القيود الصارمة (مثل نفق الثقب الدودي)، فإن التحقق البسيط من ثابت بروتوكولي هو الأفضل من نمذجة توزيع الحركة الطبيعية.
يخلص المؤلفون إلى أنه يجب الإبلاغ عن نتائج كشف التسلل في شبكات MANET جنباً إلى جنب مع تقييمات "ترك هجوم واحد خارج المجموعة" (leave-one-attack-out) للكشف عن نقاط الضعف. علاوة على ذلك، يجب التعامل مع اختيار درجة الثقة أو الجدة كقرار تصميم أساسي، وليس مجرد تفصيل تنفيذي، لأنها تحدد بشكل جوهري ما إذا كان النظام قادراً على كشف "غير المرئي".