← أحدث الأبحاث
💻 computer science

From IOCs to Regex: Automating CTI Operationalization for SOC with LLMs

تقدم هذه الورقة البحثية IOCRegex-gen، وهو نظام مؤتمت يعتمد على النماذج اللغوية الكبيرة (LLM) يقوم بتحويل مؤشرات الاختراق (IoCs) من تقارير استخبارات التهديدات السيبرانية (CTI) إلى تعبيرات نمطية (regular expressions) دقيقة دلالياً وصحيحة تركيبياً من خلال آلية واعية بالمجموعات ومسار تحقق تكراري، محققاً معدل إصابة بنسبة 99.1% ومقللاً بشكل كبير من الجهد اليدوي في العمليات الأمنية.

المؤلفون الأصليون: Pei-Yu Tseng, Lan Zhang, ZihDwo Yeh, Xiaoyan Sun, Xushu Dai, Peng Liu

نُشر 2026-04-15
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Pei-Yu Tseng, Lan Zhang, ZihDwo Yeh, Xiaoyan Sun, Xushu Dai, Peng Liu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة البحث بعنوان "من مؤشرات الاختراق (IOCs) إلى التعبيرات النمطية (Regex): أتمتة تشغيل استخبارات التهديدات السيبرانية لمركز العمليات الأمنية (SOC) باستخدام النماذج اللغوية الكبيرة (LLMs)" باستخدام لغة بسيطة وتشبيهات إبداعية.

الصورة الكبيرة: مشكلة "الضياع في الترجمة"

تخيل أنك حارس أمن (محلل SOC) في ناطحة سحاب ضخمة. كل يوم، تتلقى كومة من "ملصقات المطلوبين" (تقارير استخبارات التهديدات السيبرانية) من وكالات أمنية أخرى. تصف هذه الملصقات الأشرار وتعطيك أدلة حول كيفية رصدهم، مثل: "سيحاول اللص الدخول من الباب الخلفي باستخدام مفتاح أحمر يحمل اسم '11.bat'."

في العالم الرقمي، تُسمى هذه الأدلة مؤشرات الاختراق (IOCs).

المشكلة:
ملصقات "المطلوبين" مكتوبة بلغة بشرية عادية. لكن كاميرات المراقبة وأنظمة الإنذار لديك (السجلات/Logs) لا تتحدث الإنجليزية (أو أي لغة بشرية)، بل تتحدث فقط كوداً آلياً صارماً يسمى التعبيرات النمطية (Regular Expressions أو Regex).

لإمساك اللص، عليك ترجمة الدليل المكتوب باللغة البشرية ("مفتاح أحمر باسم '11.bat'") إلى كود معقد يقول: "ابحث عن أي ملف ينتهي بـ .bat، ولكن تجاهل الرقم المحدد، لأن اللص قد يغيره إلى '12.bat' غداً."

حالياً، يتعين على المحللين البشريين القيام بهذه الترجمة يدوياً. وهي عملية بطيئة، مملة، وعرضة للأخطاء. إذا تعب المحلل، فقد يكتب الكود بشكل خاطئ، وينفذ اللص خطته ويتجاوز نظام الإنذار.

الحل: الروبوت "المدقق الخارق"

قام مؤلفو هذه الورقة ببناء نظام ذكاء اصطناعي جديد يسمى IOCRegex-gen. فكر فيه كأنه روبوت "مترجم خارق" يأخذ الأدلة المكتوبة باللغة البشرية ويكتب فوراً الكود الآلي المثالي لنظام الإنذار.

لكن هنا تكمن المشكلة: الذكاء الاصطعي العادي (مثل برامج الدردشة البسيطة) سيء في هذا الأمر. إذا طلبت من ذكاء اصطناعي عادي كتابة الكود، فقد يرتبك، أو يكتب رموزاً غير مفهومة، أو يجعل الكود فضفاضاً للغاية (مثل قول "ابحث عن أي ملف"، مما سيؤدي لتفعيل الإنذار في كل مرة يفتح فيها شخص ما مستنداً نصياً).

حل نظام المؤلفين هذه المشكلة باستخدام خدعتين خاصتين:

الخدعة الأولى: "المحدد الذكي" (إيجاد مجموعات الالتقاط)

تخيل أن الدليل هو: "يستخدم اللص الملف C:\Users\Public\11.bat."
الخبير البشري يعرف أن C:\Users\Public هو جزء قياسي وغير قابل للتغيير في الكمبيوتر (مثل عنوان المبنى)، بينما 11.bat هو الجزء الذي يمكن للص thief تغييره (مثل الاسم المكتوب على المفتاح).

  • الطريقة القديمة: قد يحاول الذكاء الاصطناعي البسيط مطابقة السلسلة النصية بأكملها بدقة. إذا غير اللص الاسم إلى 12.bat فلن يعمل الإنذار.
  • الطريقة الجديدة: يستخدم النظام رسم بياني معرفي (Knowledge Graph) (وهو بمثابة موسوعة رقمية ضخمة لكيفية عمل أجهزة كمبيوتر ويندوز) لمعرفة أي الأجزاء "ثابتة" وأيها "متغيرة".
    • يقوم بتحديد C:\Users\Public كـ مجموعة التقاط (Capture Group) (الجزء الذي يجب أن نراه حتماً).
    • ويتعامل مع 11.bat كـ مجموعة غير ملتقطة (Non-Capture Group) (الجزء الذي يمكن أن يتغير).
    • النتيجة: يكتب الروبوت كوداً يقول: "ابحث عن العنوان C:\Users\Public متبوعاً بـ أي اسم ملف ينتهي بـ .bat."

الخدعة الثانية: "المحرر ذاتي التصحيح" (الاستنتاج التكراري)

حتى مع وجود "المحدد الذكي"، قد يرتكب الذكاء الاصطناعي أخطاء. لذلك، يستخدم النظام حلقة استنتاج (Reasoning Loop).

  1. المسودة: يكتب الذكاء الاصطناعي مسودة الكود.
  2. الاختبار: تحاول أداة "تصحيح الأخطاء" (Debugger) تشغيل الكود مقابل الدليل الأصلي.
  3. التغذية الراجعة: إذا فشل الكود، تخبر الأداة الذكاء الاصطناعي: "لقد نسيت الشرطة المائلة المائلة (backslash)!" أو "لقد جعلت الكود فضفاضاً جداً؛ إنه يطابق ملفات بريئة أيضاً!".
  4. إعادة المحاولة: يقوم الذكاء الاصطناعي بإصلاح الكود ويحاول مرة أخرى.
  5. التقييم: أخيراً، يقوم النظام بإنشاء خمس نسخ مختلفة من الكود ويختار النسخة "المثالية" (Goldilocks version)—ليست شديدة الصرامة، وليست فضفاضة جداً، بل متوازنة تماماً.

النتائج: ما مدى جودة هذا الروبوت؟

اختبر الباحثون هذا النظام على أكثر من 3,000 تقرير تهديد حقيقي وقارنوه بـ 2,400 مثال لهجوم حقيقي من إطار عمل شهير لاختبار الأمن (MITRE ATT&CK).

  • الدقة: نجح النظام في كشف 99.1% من الهجمات الحقيقية.
  • الإنذارات الكاذبة: لم يطلق إنذاراً كاذباً إلا في 0.8% من الحالات فقط.
  • المقارنة: عندما قارنوا هذا النظام الذكي بمجرد سؤال ذكاء اصطناعي قياسي لـ "كتابة الكود"، كان النظام الذكي أفضل بنسبة 30%.

لماذا يهم هذا الأمر؟

تخيل عالم الأمن الحالي كمكتبة تصل إليها "ملصقات مطلوبين" جديدة كل ثانية. الحراس البشريون لا يمكنهم قراءتها جميعاً بالسرعة الكافية، وهم يصابون بالتعب.

تقدم هذه الورقة البحثية أمين مكتبة روبوتياً يمكنه:

  1. قراءة الملصق فوراً.
  2. فهم الفرق بين عنوان المبنى وبين تنكر اللص المتغير.
  3. كتابة كود الإنذار المثالي تلقائياً.
  4. مراجعة عمله بنفسه لضمان كماله قبل تسليمه للحراس.

يسمح هذا لفرق الأمن بالتوقف عن قضاء ساعات في كتابة الكود يدوياً والبدء في التركيز على إيقاف المخترقين فعلياً. إنه يحول "استخبارات التهديدات" (المعلومات) إلى "دفاع قابل للتنفيذ" (حماية مؤتمتة) بسرعة لا يمكن للبشر مضاهاتها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →