ملخص تقني: إطار عمل CyberLLM للأمن السيبراني في قطاع السيارات
1. بيان المشكلة
أدى الانتقال إلى المركبات المعرفة برمجياً (SDVs) إلى توسيع سطح الهجوم في قطاع السيارات بشكل كبير، مما أدى إلى ظهور ثغرات عبر الكود المصدري، وسجلات وقت التشغيل (runtime logs)، وطبوغرافيات النشر. وبينما توفر النماذج اللغوية الكبيرة (LLMs) القدرة على الاستنتاج عبر هذه المصنفات غير المتجانسة واقتراح الحلول، فإن تطبيقها في البيئات الحرجة للسلامة يواجه تحديين رئيسيين:
- الطبيعة الاحتمالية: قد تقع النماذج اللغية الكبيرة في فخ "الهلوسة" بإنشاء نتائج وهمية أو تفويت مشكلات حقيقية، مما يجعلها غير موثوقة كقاعدة وحيدة لاتخاذ القرارات الأمنية.
- قيود السلامة: يجب ألا تقوم الوكلاء المستقلون (autonomous agents) الذين يعملون على المركبات بتنفيذ أي إجراءات غير آمنة أو غير مصرح بها، حتى عند تعرض المدخلات للتلاعب العدائي (مثل حقن الأوامر - prompt injection أو تسميم الذاكرة - memory poisoning).
تعالج الأدوات الحالية عادةً هذه الطبقات بشكل منعزل باستخدام ماسحات تعتمد على القواعد أو المراجعات اليدوية، وتفتقر إلى القدرة على الاستنتاج عبر الطبقات أو العمل بشكل مستقل مع وجود إشراف. وهناك حاجة إلى إطار عمل يوازن بين الكشف المستقل وبين غلاف سلامة حتمي وقابل للتدقيق.
2. المنهجية: إطار عمل CyberLLM
إن CyberLLM هو إطار عمل متعدد الوكلاء، يتم تنسيقه بواسطة نموذج لغوي كبير، ومصمم للكشف التلقائي عن الثغرات وتنفيذ عمليات الإصلاح تحت حماية سلامة تشغيلية رسمية. يعمل النظام وفق مسار يعتمد على مخطط (schema-driven pipeline)، حيث يشتق كل وكيل من نموذج BaseAgent مشترك، مما يضمن توثيق المصدر (provenance) لجميع المدخلات.
أ. بنية الكشف متعددة الطبقات
تدمج مرحلة الكشف التحليل الحتمي مع صقل النماذج اللغية الكبيرة لتحقيق استدعاء (recall) عالٍ دون التضحية بالدقة (precision):
- الأرضية الحتمية (Deterministic Floor): طبقة تعمل دائماً وتتكون من:
- قواعد Regex: أنماط متعددة الأسطر وغير حساسة لحالة الأحرف للكود.
- محللات AST: تنفيذ معزول لأدوات مثل Bandit (للغة Python) وSemgrep (للغات الأخرى).
- فحوصات مخطط الطبوغرافيا (Topology Graph Checks): تحليل ثابت لملفات YAML الخاصة بالنشر مقابل الثوابت (على سبيل المثال، وجود جهات خارجية تمتلك حواف كتابة - write edges - إلى الذاكرة).
- محللات السجلات (Log Analyzers): كواشف زمنية/إحصائية للأنماط الشاذة مثل محاولات الاختراق بالقوة الغاشمة (brute-force) أو قنوات DNS الخفية.
- مرحلة صقل النموذج اللغوي الكبير (LLM Refinement Pass): يتم حقن النتائج الحتمية كـ "سياق" (context) في ماسحات النماذج اللغية الكبيرة. ويتم توجيه النموذج بصرامة لتنقيح أو شرح أو توسيع النتائج الموجودة بدلاً من اختراع نتائج جديدة. كما تستهدف مرحلة "ناقد الاكتمال" (completeness critic) تحديداً العيوب الدلالية (مثل سباق البيانات - data races، أو ثغرة TOCTOU) التي لا يمكن لـ regex اكتشافها.
- الدمج: يتم إلغاء تكرار النتائج؛ حيث تعمل الطبقة الحتمية كحقيقة أرضية (ground truth)، بينما يضيف النموذج اللغوي قيمة فقط عندما يحدد مواقع جديدة فعلياً.
ب. محرك القرار والاستجابة
يقوم "وكيل القرار" (Decision Agent) بتجميع النتائج، وتصنيفها باستخدام تصنيف أصول متمحور حول الإنسان (سبعة فئات)، واختيار استجابة متدرجة (لا يوجد/ناعمة/متوسطة/قوية).
- الذاكرة والتغذية الراجعة: يستعلم الوكيل من مخزن ذاكرة موقع (signed) عبر الجلسات للبحث عن حوادث مماثلة سابقة. يمكن للسابقة أن ترفع درجة الاستجابة، لكنها لا يمكن أبداً أن تخفضها. إذا تم رفض محاولة سابقة، يقوم النظام تلقائياً بتصعيد درجة الاستجابة.
- توليد الإجراءات: يقوم "مولد الإجراءات" (Action Generator) ببناء خطة إصلاح. وهو يعتمد على "كتيب تعليمات" (playbook) حتمي مرتبط بمعرف قاعدة (rule-ID-keyed). قد يضيف "محدد أدوات" (tool-selector) اختياري يعمل بالنموذج اللغوي خطوات من سجل أدوات بأسلوب MCP، ولكن يُسمح فقط بالأدوات التي تقتصر على القراءة أو المراقبة أو التحقق؛ وتُمنع الإجراءات التدميرية.
ج. حارس السلامة أثناء التشغيل (Runtime Security Guard)
قبل تنفيذ أي إجراء، يقوم SecurityGuard بفرض أربعة خصائص أمنية سياقية (مشتقة من Siu et al. [1]) و"أوراكل" (oracle) مستقل لمحاذاة الإجراء:
- محاذاة المهمة (Task Alignment): الهدف يقع ضمن المجموعة المسموح بها.
- محاذاة الإجراء (Action Alignment): نوع الإجراء متوافق مع الهدف.
- تفويض المصدر (Source Authorization): جميع المدخلات تنشأ من مصادر موثقة.
- عزل البيانات (Data Isolation): الإجراءات تكتب فقط في الوجهات الموثوقة.
- الأوراكل (Ha): يقوم نموذج لغوي كبير مستقل (judge) بالتحقق مما إذا كان الإجراء المقترح يخدم بالفعل الهدف المعلن. يمكن لهذا "الأوراكل" فقط تشديد القرار (الموافقة ← الرفض)، ولا يمكنه أبداً تخفيفه، مما يضمن أن الماسح الذي تعرض للاختراق لا يمكنه فرض إجراء غير آمن.
- التعامل مع الرفض: إذا تم رفض إجراء ما، يقوم النظام بتحفيز إعادة التخطيط مع رفع درجة الاستجابة بدلاً من تنفيذ إصلاح قد يكون غير آمن.
د. مسار الهجوم المتماثل
لتقييم جودة الدفاع، يتضمن CyberLLM مسار فريق أحمر (red-team) يحاكي وكلاء الدفاع. يقوم هذا المسار بتوليد سكربتات استغلال غير تدميرية وتعتمد على نماذج تجريبية فقط (مثل حقن Shell أو تجاوز المسار - path traversal) بناءً على نفس قاعدة القواعد. وهذا يسمح بقياس كل من الهجوم والدفاع على سيناريوهات متطابقة دون تنفيذ استغلالات فعلية.
3. المساهمات الرئيسية
يوضح البحث أربع مساهمات رئيسية:
- تصميم الكشف متعدد الطبقات: تدفق موحد يدمج regex، ومحللات AST، ومخططات الطبوغرافيا مع مرحلة صقل بالنموذج اللغوي الكبير، حيث تعمل الأرضية الحتمية على ضبط وتقييد النموذج اللغوي.
- محرك القرار والاستجابة: آلية تختار تخفيفات متدرجة، وترفع مستوى الثقة عبر الذاكرة الموقعة والتغذية الراجعة لإعادة التخطيط، وتنفذ الخطط عبر سجل أدوات مع التحقق من كل خطوة وإمكانية التراجع.
- حارس السلامة أثناء التشغيل: طبقة فرض رسمية تطبق أربع خصائص أمنية سياقية و"أوراكل" مستقل لمحاذاة الإجراء لمنع الإجراءات غير الآمنة، حتى لو تم اختراق المكونات العليا.
- مسار الهجوم المتماثل والمعيار المرجعي: نظام لتوليد وإعادة تشغيل الاستغلالات للقياس جنباً إلى جنب، ويتم تقييمه على مجموعة بيانات مصنفة يدوياً من وحدات التحكم الإلكترونية (ECU) في السيارات.
4. النتائج التجريبية
تم تقييم إطار العمل على معيار مستقل وموثق يتكون من تسع وحدات ECU أصلية (بلغات C، C++، Rust) تحتوي على 47 ثغرة متعددة الطبقات، بالإضافة إلى وحدتي تحكم نظيفتين للمقارنة.
- الطبقة الحتمية (الوضع السريع - Fast Mode): غطت 34.0% (16/47) من الثغرات المسجلة مع دقة 100% (صفر من الإيجابيات الكاذبة على الوحدات النظيفة).
- الطبقة المعززة بالنموذج اللغوي (الوضع العميق - Deep Mode): من خلال إضافة صقل النموذج اللغوي ومراحل الاكتمال، ارتفع التغطية إلى حوالي 70% (33/47) مع درجة F1 بلغت 0.83.
- الحفاظ على الدقة: حافظ الوضع العميق على دقة 100% في الوحدات النظيفة. لم يتسبب صقل النموذج اللغوي في أي إيجابيات كاذبة؛ بل ساهم بشكل أساسي في تحسين الاستدعاء (recall) في حالات العيوف المنطقية متوسطة الخطورة وعيوب حرمان الخدمة (DoS) (مثل السباقات الخفية - subtle races، وأخطاء الـ off-by-one) التي فاتتها أنماط regex.
- تفصيل اللغات: كانت التحسينات متسقة عبر لغات C وC++ وRust، حيث عززت مرحلة النموذج اللغوي بشكل كبير اكتشاف العيوب الدلالية المعقدة.
5. الأهمية والادعاءات
يزعم البحث أن CyberLLM يثبت أن وكلاء النماذج اللغية الكبيرة يمكنهم القيام بدفاع سيبراني مستقل ومفيد عندما يتم تغليفهم بغلاف سلامة حتمي وقابل للتدقيق.
- الموازنة بين الاستقلالية والسلامة: يحل إطار العمل التوتر بين استقلالية النماذج اللغية الكبيرة وقيود السلامة من خلال ضمان عدم تنفيذ أي إجراء ما لم يستوفِ خصائص أمنية سياقية رسمية.
- مساهمة قابلة للقياس: توضح النتائج القيمة المحددة للنموذج اللغوي: فهو يضاعف تقريباً قدرة الاستدعاء (recall) للأرضية الحتمية دون إدخال أي إيجابية كاذبة واحدة على الكود السليم.
- المتانة: تم تصميم النظام بحيث أنه حتى لو تعرض الماسح للتعرض لمدخلات عدائية، فإن الحارس المستقل وآليات الذاكرة تمنع الالتزام بأي إجراءات غير آمنة.
- النظرة المستقبلية: يشير المؤلفون إلى أنه بينما يعد النهج الحالي (الذي يعتمد على التحليل الساكن أولاً) فعالاً، فإن العمل المستقبلي سيدمج خوادم أدوات حية، والربط المعزز بالاسترجاع (RAG) مع قواعد بيانات CVE، والتحقق مقابل منصات اختبار عالية الدقة للمركبات المعرفة برمجياً (مثل CARLA).
يخلص البحث إلى أن الجمع بين صقل النماذج اللغية الكبيرة المرتكز على الأرضية، والذاكرة غير القابلة للتلاعب، والإنفاذ الرسمي أثناء التشغيل، يوفر مساراً قابلاً للتطبيق نحو أمن سيبراني ذاتي وآمن في قطاع السيارات.