TIJERE: A Novel Threat Intelligence Joint Extraction Model Based on Analyst Expert Knowledge
تقدم هذه الورقة البحثية نموذج TIJERE، وهو نموذج مبتكر لاستخراج الكيانات والعلاقات بشكل مشترك يستفيد من المعرفة الخبيرة للمحللين ونموذج +SecureBERT مضبوط الدقة ضمن إطار عمل لوسم المتواليات المتعددة لتحقيق أداء رائد في مجال استخبارات التهديدات السيبرانية، إلى جانب إصدار أول مجموعة بيانات موسومة بشكل مشترك متاحة للجمهور، DNRTI-JE، لمعالجة الفجوات الحالية في التحليل الآلي للتهديدات.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك محقق تحاول حل قضية جريمة سيبرانية ضخمة. لديك آلاف التقارير الشرطية الفوضوية وغير المنظمة المكتوبة بمزيج من المصطلحات التقنية والأوصاف الغامضة. هدفك هو بناء خريطة ضخمة ومنظمة (رسم بياني معرفي - Knowledge Graph) توضح بالضبط من فعل ماذا لـ مَن ومتى.
على سبيل المثال، تحتاج إلى معرفة أن "APT29" (مجموعة مخترقين) استخدمت "Mimikatz" (أداة) لـ الهجوم على "بنك XYZ" (ضحية).
تقدم هذه الورقة أداة جديدة تسمى TIJERE للمساعدة في أتمتة هذا العمل التحقيقي. وإليك كيف تعمل، مشروحة ببساطة:
المشكلة: نهج "خط الإنتاج" مقابل نهج "المفصل"
في السابق، كانت الحواسيب تحاول حل هذه المشكلة في خطوتين منفصلتين (مثل خط تجميع في مصنع):
- الخطوة 1: إيجاد جميع أسماء الأشخاص، المجموعات، والأدوات (التعرف على الكيانات المسماة - Named Entity Recognition).
- الخطوة 2: النظر في تلك الأسماء وتخمين كيفية ارتباطها ببعضها البعض (استخراج العلاقات - Relation Extraction).
الخلل: إذا ارتكبت الخطوة الأولى خطأً صغيراً (مثل تحديد أداة على أنها شخص)، فإن هذا الخطأ ينتقل إلى الخطوة الثانية، مما يؤدي إلى إفساد الخريطة بأكملها. كما أن الجمل في التقارير السيبرانية غالباً ما تكون فوضوية. قد تقول جملة واحدة: "استخدمت APT29 الأداة A للهجوم على البنك X"، ولكنها تشير أيضاً ضمنياً إلى أن "الأداة A استُخدمت بواسطة APT29". هنا يرتبك الحاسوب بشأن أي من هذه الروابط هو الصحيح، خاصة عندما تظهر نفس الكلمات في أدوار مختلفة.
الحل: TIJERE (نظام "المحقق الخبير")
يغير TIJERE قواعد اللعبة عبر القيام بالخطوتين في آن واحد في عقل موحد واحد. لكنه لا يعتمد فقط على النص الخام؛ بل يستخدم ثلاث حيل ذكية ليعمل كخبير بشري:
1. "ورقة الغش" للمعرفة الخبيرة (ميزات المجال الخبير - Expert Domain Features)
تخيل أنك تقرأ جملة: "استخدمت APT29 أداة Mimikatz."
- الحاسوب العادي يرى "APT29" و"Mimikatz" كمجرد كلمات عشوائية. قد يعتقد أن "Mimikatz" هو اسم شخص لأنه لا يعرف ماهيته.
- TIJE RE لديه ورقة غش خاصة. هو يعلم أن "APT29" هي مجموعة مخترقين وأن "Mimikatz" هي أداة.
- التشبيه: الأمر يشبه إعطاء الحاسوب نظارات تبرز نوع كل كائن. بمجرد أن يرى "مجموعة مخترقين" و"أداة"، يدرك فوراً أن العلاقة هي على الأرجح "استخدام"، لأن المخترقين يستخدمون الأدوات. هذا يمنع الحاسوب من الارتباك بسبب الكلمات الغامضة.
2. "قلم التحديد" (قناع الكيان - Entity Mask)
في جملة طويلة ومعقدة تحتوي على العديد من الأسماء، يصعب على الحاسوب معرفة أي اسمين يتحدثان عن بعضهما البعض.
- TIJERE يستخدم قلم تحديد رقمي. عندما ينظر إلى العلاقة بين "APT229" و"Mimikatz"، فإنه يحدد فقط هاتين الكلمتين ويحول كل شيء آخر في الجملة إلى "ضجيج خلفية".
- التشبيه: الأمر يشبه معلماً يشير بمؤشر ليزر إلى طالبين محددين في فصل دراسي مزدحم لطرح سؤال عليهما، متجاهلاً الجميع الآخرين. هذا يساعد الحاسوب على التركيز بدقة على الزوج المعني.
3. استراتيجية "النسخ المتعددة" (توسيم متعدد التسلسلات - Multisequence Labeling)
هذا هو الابتكار الأكبر للورقة البحثية. عادةً، يقرأ الحاسوب الجملة مرة واحدة ويحاول تخمين جميع العلاقات دفعة واحدة.
- TIJERE يأخذ جملة واحدة وينشئ نسخاً منفصلة ومخصصة لكل زوج من العناصر الموجودة في تلك الجملة.
- التشبيه: تخيل أن لديك جملة تحتوي على ثلاثة أزواج من المشتبه بهم. بدلاً من مطالبة الحاسوب بحل اللغز بأكمله دفعة واحدة، يقوم TIJERE بإنشاء ثلاث نسخ منفصلة من الجملة.
- النسخة (أ) تقول: "إليك الزوج (APT29، Mimikatz). ما هي العلاقة بينهما؟"
- النسخة (ب) تقول: "إليك الزوج (APT29، البنك). ما هي العلاقة بينهما؟"
- النسخة (ج) تقول: "إليك الزوج (Mimikatz، البنك). ما هي العلاقة بينهما؟"
- من خلال تقسيم المشكلة إلى هذه الأسئلة الأصغر والأكثر تركيزاً، يتوقف الحاسوب عن الشعور بالارتباك بسبب العلاقات "المتداخلة".
القاموس الخاص (SecureBERT+)
تستخدم تقارير الأمن السيبراني لغة محددة للغاية (مثل "EternalBlue" أو "Spear-phishing") التي لا تفهمها الحواسيب العادية جيداً. يستخدم TIJERE نسخة خاصة من نموذج لغوي تسمى SecureBERT+.
- التشبيه: فكر في هذا كتدريب الحاسوب على قاموس مكتوب خصيصاً للجواسيس والمخترقين، بدلاً من قاموس لغة إنجليزية قياسي. هذا يساعده على فهم "اللغة العامية" لعالم الإنترنت.
النتائج: خريطة جديدة وورقة تقييم جديدة
لإثبات فعالية هذا العمل، قام المؤلفون بشيئين:
- بناء مجموعة بيانات جديدة (DNRTI-JE): أخذوا تقارير موجودة وقاموا بتسميتها يدوياً بالأسماء والعلاقات معاً. هذه هي المرة الأولى التي يتم فيها نشر مجموعة بيانات "موسومة بشكل مشترك" للجمهور في مجال الأمن السيبراني.
- اختبار النموذج: عندما قاموا بتشغيل TIJERE مقابل الطرق الأخرى، كان الفائز بوضوح.
- حدد الأسماء (الكيانات) بشكل صحيح بنسبة 93% من المرات.
- حدد العلاقات بشكل صحيح بنسبة 98% من المرات.
الملخص
فكر في TIJERE كمحقق خارق لا يكتفي بقراءة التقرير فحسب، بل يفهم أيضاً أنواع الشخصيات المشاركة، ويستخدم قلم تحديد للتركيز على الأزواج الصحيحة، ويقسم الجمل المعقدة إلى مقابلات بسيطة (واحد لواحد). ومن خلال دمج ذلك مع "قاموس مخترقين" متخصص، فإنه يبني خريطة لتهديدات سيبرانية أكثر دقة من أي وقت مضى.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.