ملخص تقني: Trident – كيف يتم كسر التعلم التعزيزي العميق
بيان المشكلة
تنتشر أنظمة الدفاع السيبراني المستقلة القائمة على التعلم التعزيزي العميق (DRL) بشكل متزايد لمراقبة الشبكات واستعادة المضيفين المخترقين في الوقت الفعلي. ومع ذلك، فإن متانتها ضد التهديدات التكيفية لا تزال غير مدروسة بشكل كافٍ. تعتمد التقييمات الحالية بشكل حصري تقريبًا على "وكلاء أحمر" (red agents) ثابتين يعتمدون على قواعد استدلالية (heuristics) ذات بصمات سلوكية ثابتة. ونتيجة لذلك، تطور سياسات الدفاع (DRL) استجابات مشروطة ضمنيًا بهذه الأنماط الثابتة، مما يخلق نقاط عمياء منهجية تفشل طرق التقييم التقليدية في كشفها.
في الوقت نفسه، بينما حقق التعلم التعزيزي بالمكافآت القابلة للتحقق (RLVR) تقدمًا في قدرات الاستنتاج لنماذج اللغات الكبيرة (LLMs) في مجالات مثل الرياضيات وهندسة البرمجيات، إلا أن دمج هذا النهج في الأمن السيبراني قد تعثر بسبب نقص بيئات الاختبار المناسبة. توفر مجموعات البيانات الحالية للأمن السيبراني عادةً مجموعات بيانات ثابتة أو تحديات معزولة من نوع "التقط العلم" (CTF)، وهي تفتقر إلى التفاعلات المستمرة ومتعددة الخطوات المطلوبة لتدريب الوكلاء ضد المدافعين النشطين والمتكيفين. هناك فجوة حرجة في البنية التحتية القادرة على توفير بيئات عدائية مستقرة وقابلة للتكرار مع إشارات مكافأة قابلة للتحقق لتدريب الوكلاء الأحمر القائمين على نماذج اللغات (LLM) عبر تقنية RLVR.
المنهجية
لمعالجة هذه الفجوات، قدم المؤلفون Trident، وهو إطار عمل ديناميكي للفريق الأحمر يتكون من بنية تحتية للاختبار، ومجموعة بيانات، وبنية وكيل (agentic architecture).
1. اختبار وبيانات Trident
يعمل Trident عبر محاكيين عاليي الدقة: CybORG CAGE 4 (الذي ينمذج شبكة عسكرية مجزأة مع مدافعين متعددين الوكلاء متعاونين) و CyberWheel (الذي يربط الهجمات بتقنيات MITRE ATT&CK الواقعية).
- البنية التحتية: يستخدم الإطار خوادم تجريبية (sandbox) معزولة ومحواة (containerized) تعتمد على بنية العميل والخادم. تُرسل سياسات الهجوم المولدة إلى هذه البيئات التجريبية، وتُنفذ أصليًا ضد مدافعي DRL، وتُعيد سجلات تنفيذ حتمية وقابلة للتحقق.
- مجموعة البيانات: أنشأ المؤلفون مجموعة بيانات تضم أكثر من 13,000 مسار تفاعل بين الفريق الأحمر والأزرق عالية الدقة. يتم تسلسل هذه المسارات إلى سجلات لغوية طبيعية مهيكلة، تلتقط الملاحظات الجزئية، والاستخبارات المتباينة للمضيف، ونتائج الإجراءات، لتكون بمثابة الأساس لتدريب RLVR اللاحق.
2. بنية وكيل Trident (Trident Agentic)
يعيد Trident Agentic صياغة مشكلة تدريب الوكيل الأحمر من عملية ماركوف لاتخاذ القرار جزئي الملاحظة والموزع (Dec-POMDP) إلى مشكلة "مقامن سياقية" (Contextual Bandit) باستخدام نموذج "الكود كسياسات" (Code-as-Policies). تتكون البنية من ثلاث وحدات متخصصة:
- ملخص السجلات (Log Summarizer): وحدة هجينة تستخدم التحليل القائم على القواعد ونموذج لغوي كبير مجمد لضغط سجلات التنفيذ الخام. تقوم بجمع الأحداث الجوهرية (مثل عمليات الاختراق الناجحة، أو تصعيد الامتيازات) مع أخذ عينات من المحاولات الفاشلة، لتوليد ملخص دلالي كثيف للمخطط.
- المخطط (πθ): المكون الوحيد القابل للتدريب (نموذج لغوي كبير بـ 7 مليارات بارامتر). يستقبل الملخص المضغوط كـ "سياق"، ويولد استراتيجية هجوم عالية المستوى في تمريرة أمامية واحدة، مُخرجًا حمولة JSON مهيكلة. يتم تحسينه عبر تحسين السياسة النسبية الجماعية (GRPO) باستخدام مكافآت قابلة للتحقق مستمدة من تنفيذ البيئة التجريبية.
- المبرمج (Coder): نموذج لغوي كبير مجمد يقوم بترجمة استراتيجية JSON الخاصة بالمخطط إلى كود بايثون قابل للتنفيذ. يستخدم آلية تصحيح قائمة على شجرة الإعراب المجردة (AST) وحلقة إصلاح ذاتي تكرارية (حتى K=3 محاولات) لتصحيح أخطاء الصيغة قبل النشر، مما يضمن عدم معاقبة المخطط على الضجيج الناتج عن التنفيذ العرضي.
3. تصميم المكافأة
يستخدم النظام دالة مكافأة كثيفة وقابلة للتحقق مستمدة مباشرة من سجلات التنفيذ:
- المعالم الإيجابية (R+): مكافآت موزونة للتقدم في سلسلة القتل (مثل تأثير النظام، تصعيد الامتيازات) مع تعزيزها بمعامل كفاءة بناءً على نسبة الإنجاز إلى الخطوات.
- الأحداث السلبية (R−): عقوبات على عمليات الاختراق الفاشلة، والإجراءات غير الصالحة، والضجيج التشغيلي.
- عقوبات التنفيذ: تُطبق عقوبات صارمة على أخطاء الصيغة، أو فشل وقت التشغيل، أو محاولات الوصول إلى المستويات الداخلية غير المرئية للمحاكي (مثل أعلام الخداع/decoy flags)، مما يضمن اعتماد الوكيل على الاستدلال السلوكي بدلاً من الوصول إلى الحالة المميزة.
المساهمات الرئيسية
- اختبار وبيانات Trident: أول اختبار للفريق الأحمر عبر بيئات متعددة يمتد من CAGE 4 إلى CyberWheel، والذي يوفر تنفيذًا في بيئة معزولة للمكافآت القابلة للتحقق ضد مدافعي DRL الأحياء. ويتضمن مجموعة بيانات تضم أكثر من 13,000 مسار مصممة خصيصًا لدعم تدريب RLVR.
- Trident Agentic: بنية وكيل مكونة من ثلاثة أجزاء تستفيد من نموذج "الكود كسياسات" لتمكين التوليد المباشر لاستراتيجيات هجوم قابلة للتنفيذ. ومن خلال معاملة توليد الاستراتيجية كمسألة "مقامن سياقية"، يتجنب الإطار التعقيد الحسابي للتخطيط خطوة بخطوة في نماذج POMDP.
- الأدلة التجريبية على هشاشة DRL: يثبت الإطار أن المدافعين المستقلين الحاليين هم أكثر هشاشة تجاه المهاجمين المتكيفين مما أشارت إليه التقييمات الثابتة سابقًا.
النتائج التجريبية
قيم المؤلفون Trident Agentic مقابل أفضل وكلاء DRL (الجانب الأزرق) المتاحة حاليًا (بما في ذلك متغيرات GNN و HMARL و MARL) في كل من CAGE 4 و CyberWheel.
- انخفاض الأداء: خفّض Trident Agentic الأداء الدفاعي لوكلاء الجانب الأزرق بمتوسط 522% مقارنة بالنماذج المرجعية الاستدلالية الافتراضية.
- المقارنة مع النماذج المرجعية:
- الاستدلالات الثابتة (Static Heuristics): فشلت وكلاء الفريق الأحمر التقليدية في كشف نقاط الضعف في السياسات المتعلمة.
- النماذج الصفرية/سلسلة الأفكوان (Zero-Shot/CoT): بينما أظهرت أساليب التلقين الصفري وسلسلة الأفكوان (CoT) بعض التحسن مقارنة بالنماذج المرجعية الثابتة، إلا أنها كانت أقل أداءً بكثير من نموذج Trident Agentic المدرب عبر RLVR.
- النماذج الرائدة (Frontier Models): تفوق نموذج بقوة 7 مليارات بارامتر تم تدريبه عبر RLVR (Trident Agentic) على أداء النماذج واسعة النطاق (مثل GPT-4o) المستخدمة في وضع التلقين الصفري، مما يسلط الضوء على فعالية تدريب RLVR المخصص للمهام مقارنة بمجرد حجم النموذج الخام.
- السلوكيات الناشئة: اكتشف الوكلاء المدربون بشكل مستقل نواقل هجوم جديدة لم تستطع الاستدلالات الثابتة تمثيلها، بما في ذلك:
- تجنب الخداع (Decoy Avoidance): في CyberWheel، تعلم الوكيل إلغاء الهجمات على المضيفين الذين يظهرون فشلاً متكررًا، مما مكنه من تحديد وتجنب المصائد (honeypots) بفعالية.
- تحديد الأولويات التكيفي للحالة (Adaptive State Prioritization): في CAGE 4، تعلم الوكيل إعطاء الأولوية للأهداف عالية القيمة (مثل الوصول إلى Root/User) على حساب الاستطلاع الأساسي، مع تغيير التركيز ديناميكيًا بناءً على حالة الشبكة.
الأهمية والادعاءات
يزعم البحث أن Trident يكشف عن فجوة تقييم جوهرية في الدفاع السيبراني المستقل: الممارسات الحالية تقلل بشكل حرج من تقدير ضعف مدافعي DRL أمام المهاجمين التوليديين والمتكيفين. ومن خلال إثبات أن نموذج لغوي صغير مفتوح المصدر بـ 7 مليارات بارامتر يمكنه تفكيك الدفاعات المتطورة بشكل منهجي، يجادل المؤلفون بأن على المجال تجاوز تقييم الخصم الثابت.
يُقدم Trident ليس فقط كأداة هجومية، بل كبنية تحتية ضرورية لـ "التطور المشترك" للهجوم والدفاع السيبراني. إن تصميم البيئة التجريبية المستقل عن المحاكي (Simulator-agnostic) والقائم على بروتوكول REST يسمح بدمج بيئات أعلى دقة، مما يتيح تدريب مدافعي الجانب الأزرق ليكونوا أكثر متانة ضد التهديدات التوليدية والمتكيفة. ويؤكد المؤلفون أن الشفافية بشأن هذه القدرات أمر ضروري لدفع تطوير أنظمة دفاعية متكيفة وموجهة بالتعلم التعزيزي (RL) قبل أن يتم نشر استراتيجيات الهجوم هذه بشكل مستقل من قبل الخصوم.