OntoLogX: Ontology-Guided Knowledge Graph Extraction from Cybersecurity Logs with Large Language Models
يُعد OntoLogX وكيل ذكاء اصطناعي ذاتي التشغيل يستفيد من النماذج اللغوية الكبيرة، والتوليد المعزز بالاسترجاع، والتصحيح التكراري الموجه بالأنطولوجيا لتحويل سجلات الأمن السيبراني غير المهيكلة إلى رسوم بيانية معرفية متماسكة ومستندة إلى الأنطولوجيا لضمان دقة الربط مع تكتيكات MITRE ATT&CK.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك محقق يحاول حل جريمة، ولكن بدلاً من الحصول على شهادات واضحة للشهود، تم تسليمك جبلًا من الملاحظات الممزقة، والإيصالات المكتوبة بخط اليد، والرسائل اللاسلكية المشوشة من مئات الضباط المختلفين. هذا هو بالضبط ما يواجهه خبراء الأمن السيبراني عندما ينظرون إلى سجلات النظام (system logs). هذه السجلات هي الآثار الرقمية التي تتركها الحواسيب، لكنها فوضوية، وغير منظمة، وغالبًا ما تُكتب بلغة مختصرة ومربكة تختلف من جهاز إلى آخر.
تقدم هذه الورقة البحثية OntoLogX، وهو "محقق ذكاء اصطناعي ذاتي التشغيل" مصمم لتنظيف هذه الفوضى وتحويل تلك الملاحظات العشوائية إلى خريطة واضحة ومنظمة لما حدث.
إليك كيف يعمل OntoLogX، مشروحًا عبر تشبيهات بسيطة:
1. المشكلة: "الملاحظات الممزقة"
سجلات النظام تشبه كومة من الورق الممزق. فهي تحتوي على أدلة قيمة حول المتسللين (من هم، وماذا حاولوا فعله، وكيف فعلوا ذلك)، لكن المعلومات مبعثرة، وغير متسقة، وصعبة القراءة. تحاول الأدوات التقليدية فرز هذه البيانات باتباع قواعد جامدة (مثل قائمة التحقق)، ولكن المتسللين مبدعون ويغيرون تكتيكاتهم، لذا فإن قائمة التحقق غالبًا ما تفشل.
2. الحل: "المترجم الذكي" (OntoLogX)
OntoLogX هو وكيل ذكاء اصطناي يعمل كمترجم ومنظم فائق الذكاء. مهمته هي أخذ مدخل سجل واحد فوضوي وتحويله إلى رسم بياني معرفي (Knowledge Graph) منظم.
- الرسم البياني المعرفي: فكر في هذا كشجرة عائلة أو خريطة مترو أنفاق. بدلاً من كتلة نصية، يقوم بربط "نقاط" محددة (مثل مستخدم، وحاسوب، ووقت، وإجراء) بـ "خطوط" واضحة توضح كيفية ارتباطها ببعضها البعض.
- الأنطولوجيا (المخطط الهيكلي): لضمان رسم الخريطة بشكل صحيح، يستخدم OntoLogX أنطولوجيا خفيفة الوزن. تخيل هذا كمخطط معماري صارم أو تعليمات بناء قطع "ليغو" (LEGO). إنها تخبر الذكاء الاصطناعي بالضبط ما هي أنواع القطع (العقد) والارتباطات (العلاقات) المسموح بها، مما يضمن أن الخريطة النهائية منطقية وتتبع القواعد.
3. كيف يعمل: العملية المكونة من ثلاث خطوات
لا يعتمد OntoLogX على التخمين فحسب؛ بل يستخدم روتينًا ذكيًا مكونًا من ثلاث خطوات لضمان الدقة:
الخطوة 1: "المكتبة المرجعية" (التوليد المعزز بالاسترجاع - Retrieval Augmented Generation)
قبل أن يحاول الذكاء الاصطناعي ترجمة سجل جديد، يبحث في بنك ذاكرته الخاص (قاعدة بيانات لسجلات تم حلها سابقًا) للعثور على أمثلة مشابهة. الأمر يشبه محققًا ينظر في ملفات القضايا السابقة ليرى كيف تم توثيق جرائم مماثلة. يساعد هذا الذكاء الاصطناعي على فهم السياق وتجنب إعادة اختراع العجلة.الخطوة 2: "مرحلة المسودة" (التوليد - Generation)
باستخدام الأمثلة المرجعية و"تعليمات الليغو" الصارمة (الأنطولوجيا)، يقوم الذكاء الاصطناعي بإنشاء مسودة خريطة. يحاول استخراج التفاصيل الرئيسية: من فعل ذلك؟ متى؟ ما هي الأداة التي استخدمها؟الخطوة 3: "المفتش" (التصحيح التكراري - Iterative Correction)
هذه هي شبكة الأمان الأكثر أهمية. بمجرد إعداد المسودة، يقوم مفتش رقمي (باستخدام أداة تسمى SHACL) بفحصها مقابل المخطط الهيكلي.- إذا ارتكب الذكاء الاصطناعي خطأً (على سبيل المثال، ربط النقاط بشكل خاطئ أو أغفل قطعة مطلوبة)، يرسل المفتش المسودة مرة أخرى إلى الذكاء الاصطناعي مع ملاحظة: "أصلح هذا".
- يحاول الذكاء الاصطناعي مرة أخرى. ويكرر هذه الحلقة حتى تصبح الخريطة مثالية وتتبع جميع القواعد. إذا لم يتمكن من إصلاحها بعد محاولات قليلة، فإنه يعترف بالفشل ويترك ذلك المدخل فارغًا بدلاً من إنشاء خريطة مزيفة.
4. الصورة الكبيرة: توصيل النقاط
بمجرد أن يقوم OntoLogX بتنظيف آلاف مدخلات السجلات الفردية، فإنه يجمعها في "جلسات" (مثل تجميع كل الملاحظات من محاولة اقتحام محددة). ثم يستخدم الذكاء الاصطناعي للمرة الأخيرة للنظر في الصورة الكاملة والإجابة على سؤال رفيع المستوى: "ما هو هدف المتسلل؟"
يقوم بربط هذه الأنشطة بإطار عمل MITRE ATT&CK، وهو بمثابة قاموس عالمي لتكتيكات المتسللين. بدلاً من القول "قام المتسلل بتشغيل أمر ما"، يمكن لـ OntoLogX أن يقول: "كانت هذه محاولة وصول أولي (Initial Access) تبعها تصعيد صلاحيات (Privilege Escalation)". هذا يحول البيانات الخام إلى معلومات استخباراتية قابلة للتنفيذ يمكن لفرق الأمن استخدامها بالفعل.
5. ما وجدته الورقة البحثية
اختبر المؤلفون OntoLogX على نوعين من البيانات:
- مجموعات البيانات العامة: للتأكد من أنه يعمل على سجلات قياسية ومعروفة.
- مصائد المخترقين (Honeypots) الواقعية: وهي خوادم وهمية يتم إعدادها لجذب المتسللين. سجلات هذه المصائد هي نشاط "الأشرار" الصافي.
النتائج:
- الدقة: نجح النظام في تحويل السجلات الفوضوية إلى خرائط نظيفة تتبع القواعد.
- أفضل مع المساعدة: عمل النظام بشكل أفضل عندما استخدم "مكتبته المرجعية" (الاسترجاع) و"المفتش" (التصحيح). بدون هذه الأدوات، ارتكب الذكاء الاصطناعي المزيد من الأخطاء.
- أهمية النموذج: ليست كل عقول الذكاء الاصطناعي متساوية. عمل النظام بشكل أفضل مع النماذج الجيدة في اتباع التعليمات الصارمة (مثل النماذج الموجهة نحو الأكواد البرمجية)، بدلاً من النماذج المخصصة لسرد القصص الإبداعية.
- كشف التكتيكات: عند التنبؤ بما كان يحاول المتسللون فعله، كان OntoLogX أفضل بكثير في رصد الهجمات المعقدة متعددة الخطوات مقارنة بالأنظمة التي تقرأ السجلات الخام مباشرة.
ملخص
باختصار، OntoLogX هو أداة تأخذ لغة سجلات الكمبيوتر المربكة والمضطربة وترجمتها إلى خريطة واضحة، منظمة، ومحققة للهجمات السيبرانية. إنه يستخدم كتاب قواعد صارم، ويتعلم من الأمثلة السابقة، ويدقق في عمله الخاص لضمان أن المعلومات الاستخباراتية النهائية موثوقة بما يكفي ليتخذ خبراء الأمن إجراءات بناءً عليها.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.