← أحدث الأبحاث
🤖 AI

Retrieval-Augmented LLMs for Security Incident Analysis

تقدم هذه الورقة نظاماً للجيل المعزز بالاسترجاع (RAG) يعمل على تعزيز تحليل الحوادث الأمنية من خلال الجمع بين التصفية المستهدفة القائمة على الاستعلام وبين الاستدلال الدلالي للنماذج اللغوية الكبيرة (LLM) لإعادة بناء تسلسلات الهجوم بدقة وتحديد المؤشرات من مصادر سجلات متنوعة، مما يثبت أن هذا النهج يحقق استدعاءً ودقةً عاليين مع تقليل التكاليف بشكل كبير مقارنة بالنماذج المرجعية التي لا تستخدم تقنية (RAG).

المؤلفون الأصليون: Xavier Cadet, Aditya Vikram Singh, Harsh Mamania, Edward Koh, Alex Fitts, Dirk Van Bruggen, Simona Boboila, Peter Chin, Alina Oprea

نُشر 2026-03-20
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Xavier Cadet, Aditya Vikram Singh, Harsh Mamania, Edward Koh, Alex Fitts, Dirk Van Bruggen, Simona Boboila, Peter Chin, Alina Oprea

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك محقق يحاول حل جريمة ضخمة وقعت داخل مدينة عملاقة وصاخبة (وهي شبكة الكمبيوتر الخاصة بك). كل يوم، يسير الملايين من الناس في الشوارع، ويشترون القهوة، ويتحدثون مع جيرانهم. معظم هذا النشاط هو حياة طبيعية. ولكن في مكان ما وسط هذا البحر من ملايين المعاملات، يتسلل لص ويقوم بسرقة محفظة ثم يلوذ بالفرار.

مهمتك هي العثور على اللص.

المشكلة: الكثير من الضجيج، وقليل من الوقت

في الأيام الخوالي، كان محللو الأمن مثل المحققين الذين يتعين عليهم قراءة كل فاتورة، وكل شريط كاميرا مراقبة، وكل سجل مكالمات هاتفية من المدينة بأكملها للعثين على اللص.

  • الواقع: تترك الهجمة السيبرانية وراءها ملايين "الإيصالات" الرقمية (السجلات/Logs).
  • المشكلة: هناك الكثير من الإيصالات. لا يمكن للإنسان قراءتها جميعًا؛ إذ يصابون بالتعب، وقد يفوتون الأدلة، ويتمكن اللص من الهروب. كما أن اللص ذكي؛ فهو لا يترك علامة تقول "أنا اللص"، بل يخفي آثاره وسط الأنشطة الطبيعية.

الحل: مساعد محقق ذكي (RAG + LLM)

تقدم الورقة البحثية نظامًا جديدًا يعمل كـ مساعد محقق فائق الذكاء. إنه يجمع بين أداتين قويتين:

  1. المصفاة (RAG): أداة تقوم بمسح ملايين الإيصالات بسرعة وتحتفظ فقط بتلك التي تبدو مشبوهة.
  2. العقل (LLM): ذكاء اصطناعي عالي الذكاء يقرأ تلك الإيصالات المشبوهة القليلة ويروي لك القصة الكاملة لما حدث.

إليك كيف يعمل ذلك، خطوة بخوة، باستخدام تشبيه المدينة الخاص بنا:

1. "المصفاة الذكية" (التصفية المستهدفة القائمة على الاستعلام)

بدلاً من إعطاء الذكاء الاصطناعي مكتبة الكتب بأكملها (جميع السجلات)، يقوم النظام أولاً بطرح أسئلة محددة على أمين المكتبة.

  • الطريقة القديمة: "اقرأ كل كتاب في المكتبة". (بطيئة جدًا، وضجيج كثير).
  • الطريقة الجديدة: "أرني فقط الكتب المتعلقة بـ 'المحافظ المسروقة' و'تحركات السيارات الغريبة'".
  • كيف يعمل: يستخدم النظام قائمة معدة مسبقًا من "الأنماط المشبوهة" (مثل البحث عن نوع معين من الهويات المزيفة أو سيارة تسير في دوائر). يقوم بتصفية ملايين عمليات شراء القهوة الطبيعية ويحتفظ فقط بالـ 100 إيصال التي تبدو غريبة.

2. "باني السياق" (التوليد المعزز بالاسترجاع - RAG)

الآن أصبح لدى الذكاء الاصطناعي كومة صغيرة من الإيصالات المشبوهة. لكن إيصالًا من الساعة 9:00 صباحًا قد لا يكون منطقيًا بدون الإيصال الذي يليه في الساعة 9:05 صباحًا.

  • يأخذ النظام تلك الـ 100 إيصال مشبوهة ويرتبها في قصة متماسكة. يربطها معًا مثل قطع الأحجية (البازل).
  • يستخدم تقنية تسمى RAG (التوليد المعزز بالاسترجاء). فكر في هذا كأن الذكاء الاصطناعي لديه "ورقة غش" أو "محرك بحث" بجانبه مباشرة. عندما يحاول الذكاء الاصطناعي حل اللغز، فهو لا يخمن فحما، بل يبحث عن الأدلة المحددة التي يحتاجها من ورقة الغش الخاصة به ليدعم إجابته.

3. "الذكاء الاصطناعي المحقق" (النموذج اللغوي الكبير - LLM)

أخيرًا، يقرأ الذكاء الاصطناعي (النموذج اللغوي الكبير) هذه القصة المختارة والمنظمة. ولأنه ليس مثقلًا بملايين الإيصالات العادية، يمكنه التركيز على الأدلة.

  • يجيب على أسئلة مثل: "من هو اللص؟" "إلى أين ذهب؟" "ما هي الأدوات التي استخدمها؟"
  • هو لا يكتفي بالقول: "حدثت سرقة فحسب"، بل يقول: "كان اللص مستخدمًا يُدعى 'جون' على جهاز الكمبيوتر 'Desk-5'. لقد قام بتحميل تحديث مزيف، ثم اتصل بخادم سري في دولة أخرى لسرقة البيانات".

النتائج: السرعة، الدقة، والتكلفة

اختبر الباحثون هذا النظام ضد هجمات سيبرانية حقيقية (مثل البرمجيات الخبيثة والاختراقات الشبكية المعقدة) وقارنوا بين نماذج ذكاء اصطناعي مختلفة (مثل Claude و DeepSeek و GPT).

  • الدقة: حصلت أفضل نماذج الذكاء الاصطناعي على 100% من الأدلة بشكل صحيح. لقد وجدوا الأجهزة المصابة والخوادم السرية للمهاجمين.
  • فشل "عدم وجود مصفاة": عندما حاولوا تغذية الذكاء الاصطناعي بجميع السجلات الخام دون استخدام المصفاة، ارتبك الذكاء الاصطناعي. استطاع العثين على الضحية ولكنه أغفل المهاجمين تمامًا بسبب "الضجيج" الذي طغى على الإشارة. الأمر يشبه محاولة سماع همسة وسط إعصار.
  • توفير التكاليف: وجدوا أن أحد نماذج الذكاء الاصطناعي (DeepSeek) كان بذكاء النموذج الأكثر تكلفة (Claude) ولكنه يكلف 15 مرة أقل. إنه يشبه الحصول على محرك سيارة فيراري بسعر سيارة هوندا سيفيك.
  • المتخصص مقابل العام: ومن المثير للاهتمام، أن الذكاء الاصطناعي المدرب خصيصًا على "الأمن" لم يكن أفضل من الذكاء الاصطناعي العام الذكي. اتضح أن القدرة على الاستنتاج والربط بين الأمور أهم من مجرد معرفة المصطلحات الأمنية.

لماذا يهم هذا؟

هذا النظام يغير قواعد اللعبة لفرق الأمن.

  • قبلًا: كان المحللون يغرقون في البيانات، ويفوتون الهجمات، ويعانون من الاحتراق الوظيفي.
  • الآن: يعمل النظام كعامل مضاعف للقوة. فهو يفلتر الضجيج، وينظم الأدلة، ويخبر المحلل البشري بالضبط ما حدث، ولماذا حدث، وكيفية إيقافه.

باختصار: تصف الورقة البحثية نظامًا يحول جبلًا فوضويًا من الضجيج الرقمي إلى قصة واضحة ومقروءة، مما يسمح للخبراء البشريين بالإمساك بمجرمي الإنترنت بشكل أسرع، وأرخص، وبدقة أكبر من أي وقت مضى.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →