← أحدث الأبحاث
🤖 machine learning

Can LLMs Handle WebShell Detection? Overcoming Detection Challenges with Behavioral Function-Aware Framework

تقيم هذه الورقة قدرات مختلف النماذج اللغوية الكبيرة في اكتشاف ملفات الـ WebShell وتطرح إطار عمل "الكشف القائم على الوعي بالوظائف السلوكية" (BFAD)، الذي يحسن أداء الكشف بشكل كبير من خلال تركيز التحليل على الوظائف الحساسة أمنياً وتحسين التعلم داخل السياق، مما يمكّن النماذج اللغوية الكبيرة من التفوق على أدوات الكشف الحالية الأكثر تطوراً.

المؤلفون الأصليون: Feijiang Han, Jiaming Zhang, Chuyi Deng, Jianheng Tang, Yunhuai Liu

نُشر 2026-02-13
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Feijiang Han, Jiaming Zhang, Chuyi Deng, Jianheng Tang, Yunhuai Liu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك حارس أمن في مكتبة ضخمة وفوضوية (الإنترنت). مهمتك هي العثور على بضعة كتب محددة تحتوي على تعليمات لتفجير المبنى (WebShells)، مع تجاهل ملايين الكتب الطبيعية تماماً (الكود البرمجي السليم).

المشكلة هي أن الكتب السيئة غالباً ما تكون:

  1. ضخمة: بعضها يمتد لآلاف الصفحات.
  2. مخبأة: التعليمات الخطيرة مدفونة في أعماق النصوص، محاطة بنصوص مملة.
  3. متنكرة: مكتوبة بشفرات سرية أو لغات مشفرة (التمويه/Obfuscation).

لسنوات، استخدم حراس الأمن طريقتين رئيسيتين:

  • كتاب القواعد: "إذا رأيت كلمة 'انفجار'، قم بالقبض عليه". (من السهل جداً خداع هذه الطريقة؛ فالأشرار ببساطة يغيرون الكلمة إلى 'تفجير بمواد متفجرة').
  • دليل التدريب: عرض آلاف الأمثلة للكتب السيئة على الحارس ليتعلم النمط. (هذا يستغرق وقتاً طويلاً للتحديث ويفشل عندما يظهر نوع جديد من الكتب السيئة).

مؤخراً، وصل نوع جديد من الحراس: الذكاء الاصطناوي الفائق (النماذج اللغوية الكبيرة أو LLMs). يمكن لهذه الأنظمة من الذكاء الاصطناعي قراءة وفهم أي لغة تقريباً. ولكن عندما حاول الباحثون استخدامها للعثور على هذه الكتب السيئة، اصطدموا بحائط مسدود.

المشكلة: فخ "المعلومات الزائدة عن الحد"

وجد الباحثون أن مجرد تقديم كتاب ضخم وفوضوي للذكاء الاصطناعي لا يعمل بشكل جيد.

  • مشكلة "الطول المفرط": إذا كان الكتاب يتكون من 1000 صفحة، فقد يقرأ الذكاء الاصطناعي أول 100 صفحة فقط. إذا كانت تعليمات القنبلة في الصفحة 900، فسوف يفتقدها الذكاء الاصطناعي تماماً.
  • مشكلة "التشتت": الذكاء الاصطناعي ذكي، لكنه يتشتت بسهثير. قد يرى كلمة غير ضارة مثل "قتل" (والتي تُستخدم في ألعاب الفيديو) ويعتقد: "أوه لا، هذه قنبلة!" (إنذار كاذب). أو قد يرى قنبلة حقيقية مخبأة خلف جدار من النصوص ويعتقد: "هذا يبدو آمناً" (تهديد فائت).

لاحظ الباحثون نمطاً مثيراً للاهتمام:

  • الأنظمة الضخمة (Big AIs): كانت حذرة للغاية. نادراً ما تطلق إنذارات كاذبة، لكنها تفوت الكثير من القنابل الحقيقية لأنها كانت مفرطة في الحذر.
  • الأنظمة الصغيرة (Small AIs): كانت مرتابة للغاية. تمسك بكل القنابل تقريباً، لكنها أيضاً تعتقل أمناء مكتبات أبرياء لمجرد أنهم استخدموا كلمة "قتل" في نص برمجي للعبة.

الحل: إطار العمل "المدرك للسلوك والوظائف" (BFAD)

لإصلاح ذلك، بنى الباحثون مجموعة أدوات خاصة تسمى BFAD. تخيل الأمر كأنك تمنح الذكاء الاصطناعي عدسة مكبرة عالية التقنية وورقة غش مصممة خصيصاً للعثور على القنابل.

إليك كيف يعمل BFAD، باستخدام تشبيهات بسيطة:

1. "مرشح الوظائف الحرجة" (جهاز كشف المعادن)

بدلاً من جعل الذكاء الاصطناعي يقرأ الكتاب بأكمله، يعمل BFAD مثل جهاز كشف المعادن عند مدخل المكتبة. يقوم بمسح النص بحثاً عن عناصر "معدنية" محددة—وهي وظائف PHP خطيرة مثل exec (لتشغيل أمر) أو eval (لتشغيل كود).

  • لماذا يساعد هذا؟ إنه يتجاهل القصة المملة عن قطة، ويركز فقط على الصفحات التي تحتوي على "المعدن" (الكود الخطير). هذا يحل مشكلة "الطول المفرط".

2. "استخراج السياق الواعي" (قلم التحديد/الهايلايتر)

بمجرد أن يجد جهاز كشف المعادن مكاناً مشبوهاً، لا يكتفي BFAD بإظهار الكلمة المفردة للذكاء الاصطناعي، بل يحدد "نافذة" صغيرة من النص حول تلك الكلمة (السياق).

  • لماذا يساعد هذا؟ إنه يخبر الذكاء الاصطناعي: "مهلاً، انظر إلى أمر exec هذا. هل يُستخدم لتشغيل فيروس، أم أنه مجرد تحديث نظام غير ضار؟" هذا يساعد الذكاء الاصطناعي على فهم النية، وليس فقط الكلمة.

3. "توصيف السلوك الوظيفي الموزون" (ورقة الغش لـ "أشباه الأشياء")

هذا هو الجزء الأذكى. عندما يحتاج الذكاء الاصطناعي إلى تحديد ما إذا كان الملف سيئاً، فإنه ينظر إلى "ورقة غش" من الأمثلة السابقة (العروض التوضيحية) للتعلم منها.

  • الطريقة القديمة: يختار الذكاء الاصطناعي أمثلة عشوائية أو أمثلة تبدو متشابهة في الظاهر (مثل كتابين لهما نفس نوع الخط).
  • طريقة BFAD: يختار الذكاء الاصطناعي أمثلة متشابهة سلوكياً. إذا كان الملف الحالي يحاول سرقة البيانات، فإن الذكاء الاصطناعي يبحث عن ملفات سابقة حاولت أيضاً سرقة البيانات، حتى لو بدت مختلفة في الظاهر.
  • التشبيه: تخيل أنك تبحث عن لص يسرق التفاح الأحمر.
    • الطريقة القديمة: تظهر للحارس صورة لص يسرق تفاحة حمراء، ولص آخر يسرق كرة حمراء. سيصاب الحارس بالارتباك.
    • طريقة BFAD: تظهر للحارس صورة لص يسرق تفاحة حمراء، ولص آخر يسرق تفاحة حمراء من متجر مختلف. سيتعلم الحارس السلوك (سرقة التفاح الأحمر)، وليس مجرد الشيء نفسه.

النتائج: نهاية سعيدة

عندما اختبر الباحثون هذا النظام الجديد:

  • الأنظمة الضخمة (Big AIs): أصبحت أفضل بكثير في الإمساك بالقنابل التي كانت تفوتها، دون زيادة في الإنذارات الكاذبة.
  • الأنظمة الصغيرة (Small AIs): أصبحت أكثر ذكاءً، وتوقفت عن اعتقال أمناء المكتبات الأبرياء.
  • بشكل عام: جعل النظام الجديد حراس الذكاء الاصطناعي يؤدون بشكل أفضل من حراس "كتاب القواعد"، وحتى أفضل من حراس "دليل التدريب" الأكثر تقدماً.

الخلاصة

تخلص الورقة البحثية إلى أنه بينما يعد الذكاء الاصطناعي قوياً، فإنه ليس عصا سحرية. لا يمكنك مجرد إلقاء مشكلة فوضوية أمامه وتوقع إجابة مثالية. يجب عليك توجيه الذكاء الاصطناعي من خلال:

  1. تركيز انتباهه على الأجزاء الخطيرة.
  2. تزويده بالسياق الصحيح.
  3. إظهار الأمثلة الصحيحة له ليتعلم منها.

من خلال القيام بذلك، يمكننا تحويل هذه الأنظمة فائقة الذكاء إلى حراس أمن موثوقين للعالم الرقمي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →