SOC Copilot: A Complete, Lightweight, and Explainable Multi-Model Anomaly Detection Engine for Security Log Analysis
تقدم هذه الورقة SOC Copilot، وهو محرك خفيف الوزن، يعمل على المعالج المركزي فقط، وغير خاضع للإشراف للكشف عن الشذوذ متعدد النماذج، يدمج بين غابة العزل المحسنة ومُشفّر تلقائي عميق مع قابلية التفسير القائمة على SHAP لتحقيق دقة بنسبة 99.84% في تحليل سجلات أمن HDFS دون الحاجة إلى بيانات مصنفة أو بنية تحتية لوحدات معالجة الرسومات.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تنتج أنظمة الكمبيوتر الحديثة كل يوم حجماً هائلاً من السجلات الرقمية المعروفة باسم "السجلات" (logs). هذه السجلات هي ملاحظات تلقائية تكتبها الآلات حول أنشطتها الخاصة، حيث تتبع كل شيء بدءاً من تسجيل دخول مستخدم وصولاً إلى نقل ملف عبر شبكة. وفي المنظمات الكبيرة، تتراكم هذه السجلات بالملايين، مما يخلق تدفقاً ضخماً وفوضوويًا من المعلومات. وتُكلف فرق الأمن، المعروفة باسم مراكز العمليات الأمنية (SOC)، بمراقبة هذا التدفق لرصد علامات المشاكل. وتكمن المشكلة في أن الحجم كبير جداً بحيث لا يمكن للبشر قراءته، كما أن الطريقة القديمة في البحث عن المشاكل —وهي التحقق من أنماط سلوكية معينة ومعروفة سيئة— تفشل عندما يستخدم المهاجمون أساليب جديدة وغير مرئية. وعندما تتعرض الأنظمة للارتباك، فإنها إما تغفل عن التهديدات الحقيقية أو تطلق إنذارات لأحداث غير ضارة، مما يترك المحللين في حالة من الإنهاك والارتباك. والهدف من أبحاث الأمن الحديثة هو بناء نظام يمكنه تصفية هذا الضجيج تلقائياً، والعثور على الأحداث النادرة والغريبة التي تشير إلى هجوم، وشرح سبب العثور عليها بدقة، وكل ذلك دون الحاجة إلى أجهزة باهظة الثمن ومتخصصة أو فريق من الخبراء لتصنيف كل مثال على جريمة.
قام فريق من الباحثين ببناء أداة تسمى "SOC Copilot" لحل هذه المشكلة تحديداً. لقد أنشأوا نظاماً كاملاً يعمل على معالجات الكمبيوتر القياسية، مما يعني أنه لا يتطلب بطاقات رسوميات ضخمة ومستهلكة للطاقة مثل التي تحتاجها العديد من أدوات الذكاء الاصطناعي المتقدمة. وبدلاً من الاعتماد على قاعدة بيانات للهجمات المعروفة، يتعلم نظامهم كيف يبدو السلوك "الطبيعي" ويقوم بتمييز أي شيء ينحرف عن هذا النمط. اختبر الباحثون محركهم على مجموعة بيانات ضخمة تضم أكثر من أحد عشر مليون سطر من السجلات من نظام ملفات "Hadoop Distributed File System"، وهو تقنية شائعة لتخزين كميات هائلة من البيانات. وقد قاموا بمعالجة هذه البيانات إلى تنسيق يمكن إدارته، من خلال تجميع الأحداث ذات الصلة في كتل وتحويلها إلى قائمة مكونة من ثمانية وخمسين خاصية مختلفة، مثل عدد مرات ظهور نوع معين من الرسائل أو مدة تسلسل الأحداث.
يعتمد جوهر نظامهم على طريقتين مختلفتين للبحث عن المشاكل، تعملان معاً مثل خبيرين بتخصصات مختلفة. الطريقة الأولى هي أداة إحصائية تبحث عن القيم المتطرفة، وتحدد نقاط البيانات التي تبتعد كثيراً عن الحشد. أما الطريقة الثانية فهي شبكة عصبية، وهي نوع من البرامج الحاسوبية المصممة لتعلم كيفية ضغط المعلومات ثم إعادة بنائها. فإذا واجه البرنامج نمطاً لم يسبق له رؤيته، فإنه يعاني في إعادة بنائه، وهذا العناء يصبح إشارة إلى وجود خطأ ما. وقد درب الباحثون كلتا الطريقتين فقط على أمثلة من السلوك الطبيعي والآمن؛ فلم يعرضوا عليهما أي أمثلة لهجمات خلال مرحلة التعلم، مما يسمح للنظام باكتشاف أنواع جديدة من التهديدات التي لم تُشاهد من قبل.
ولجعل النظام موثوقاً، لم يكتفِ الباحثون بجعل الطريقتين تصوتان على قرار ما، بل قاموا أولاً بتعديل الدرجات من كل طريقة حتى يمكن مقارنتها بشكل عادل، ثم دمجوهما باستخدام استراتيجية وزن محددة تم تحديدها من خلال الاختبار على مجموعة بيانات منفصلة. والنتيجة النهائية هي درجة واحدة تخبر النظام بمدى ريبة كتلة السجلات. وإذا تجاوزت الدرجة خطاً معيناً، يقوم النظام بتمييزها كحالة شاذة. ومن الأهمية بمكان أن النظام لا يكتفي بالقول "هذا سيء"، بل يقدم شرحاً مفصلاً لقراره، مسلطاً الضوء على الخصائص التي تسببت بالضبط في إطلاق الإنذار. كما أنه يحدد مستوى الخطورة، والذي يتراوح من منخفض إلى حرج، مما يساعد المحللين البشريين على تحديد التنبيهات التي يجب التحقيق فيها أولاً.
عندما اختبر الفريق نظامهم النهائي على مجموعة من البيانات التي لم يسبق له رؤيتها، كانت النتائج دقيقة للغاية. فمن بين أكثر من أربعة وستين ألف كتلة من السجلات، حدد النظام الصحيح تقريباً كل حالة شاذة، ولم يخطئ إلا في حالة واحدة. كما حافظ أيضاً على انخفاض الإنذارات الكاذبة، حيث صنف جزءاً ضئيلاً جداً فقط من النشاط الطبيعي على أنه مشبوه. وقد أثبت الجمع بين الطريقتين أنه أقوى من كل واحدة منهما على حد وِحدها؛ فبينما كانت الشبكة العصبية هي الكاشف الفردي الأفضل، إلا أن الطريقة الإحصائية رصدت عدداً قليلاً من التهديدات التي فاتتها الشبكة. ومن خلال دمجهما معاً، حقق النظام مستوى من الدقة نادراً ما يوجد في هذا المجال، حيث وصل إلى ما يقرب من 99% في جميع مقاييس الأداء الرئيسية.
كما بنى الباحثون لوحة تحكم مرئية تسم تسمح للمحللين البشريين بالتفاعل مع النظام. تعرض هذه الواجهة التنبيهات، ودرجات الخطورة، والتفسيرات لسبب رفع كل تنبيه. كما توضح قوالب السجلات المحددة التي أطلقت الإنذار والخصائص التي ساهمت أكثر في اتخاذ القرار. وتعد هذه الشفافية أمراً حيوياً لأنها تسم الله الإنسان بالوثوق في حكم الآلة وفهم سياق التهديد. وقد بُني النظام بأكمله ليكون خفيف الوزن وقابلاً للتفسير، معالِجاً بذلك الشكاوى الشائعة بأن الأدوات الأمنية القوية إما أن تكون مكلفة جداً للتشغيل أو غامضة جداً للفهم.
تؤكد الدراسة أنه من الممكن بناء محرك أمني فعال للغاية دون الاعتماد على قدرات حوسبة ضخمة أو مجموعات بيانات ضخمة مصنفة للهجمات المعروفة. فمن خلال التركيز على التعلم غير الخاضع للإشراف، حيث يتعلم النظام شكل السلوك الطبيعي، ومن خلال الجمع بين طرق كشف متعددة، أنشأ الفريق أداة دقيقة ومفهومة في آن واحد. وقد أثبتوا أنه يمكن تدريب نظام على بيانات طبيعية، وضبطه من خلال معايرة دقيقة، ونشره للإمساك بكل حالة شاذة تقريباً في تدفق هائل من السجلات. ولا يدعي العمل أنه يحل كل المشاكل الأمنية، ويقر بأنه يعمل حالياً بشكل أفضل على هذا النوع المحدد من بيانات السجلات، ومع ذلك، فإنه يقدم نموذجاً عملياً واضحاً لكيفية الانتقال من مجرد فحص القواعد التفاعلي إلى الكشف الاستباقي والذكي عن الحالات الشاذة الذي يمكن فهمه والثوق به من قبل الأشخاص الذين يحتاجون لاستخدامه.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.