MARD: A Multi-Agent Framework for Robust Android Malware Detection
إن MARD هو إطار عمل متعدد الوكلاء يستفيد من النماذج اللغوية الكبيرة لتنسيق أدوات التحليل الحتمية عند الطلب عبر آلية تفاعل قائمة على ReAct، مما يحقق كشفاً قوياً، وقابلاً للتفسير، وفعالاً من حيث التكلفة لبرمجيات أندرويد الخبيثة بدقة عالية وتعميم قوي ضد انزياح المفاهيم دون الحاجة إلى ضبط دقيق خاص بالمجال.
المؤلفون الأصليون:Xueying Zeng, Youquan Xian, Sihao Liu, Xudong Mou, Yanze Li, Lei Cui, Bo Li
تخيل أنك تحاول الإيقاع بمجموعة من المزورين المحترفين الذين يغيرون تنكراتهم باستمرار للتسلل إلى مبنى آمن.
الطريقة القديمة (الذكاء الاصطناعي التقليدي) لسنوات، حاول حراس الأمن (نماذج الذكاء الاصطناعي التقليدية) الإمساك بهؤلاء المزورين من خلال النظر إلى أحذيتهم، أو قبعاتهم، أو ألوان معاطفهم (سمات سطحية مثل أوامر برمجية محددة).
المشكلة: أدرك المزورون ذلك بسرعة، فبدأوا في ارتداء أحذية أو قبعات مختلفة كل يوم. ارتبك الحراس الذين تدربوا على صور قديمة؛ فإما أن يفوتوا المزورين تماماً، أو يبدأون في اعتقال الأبرياء الذين تصادف ارتداؤهم لقبعة حمراء. وهذا ما يسمى بـ "انزياح المفهوم" (concept drift)—القواعد تتغير باستمرار، والحراس القدامى لا يستطيعون المواكبة.
الطريقة الجديدة (MARD) قام الباحثون وراء هذه الورقة البحثية ببناء نظام جديد يسمى MARD. بدلاً من توظيف حارس يحفظ الملابس عن ظهر قلب، قاموا ببناء وكالة تحقيق تستخدم عقلاً ذكياً للغاية (نموذج لغوي كبير - LLM) يعمل جنباً إلى جنب مع فريق من الأدوات المتخصصة وعالية التقنية.
إليك كيف يعمل MARD، خطوة بخطاً:
1. هيكل وكالة التحقيق
MARD ليس مجرد روبوت واحد، بل هو فريق من ثلاثة عملاء متخصصين يعملون معاً:
العميل 1: الكشاف (الفحص الشامل - Macro Screening)
ماذا يفعل: قبل النظر في التفاصيل الفوضوية، يتحقق الكشاف بسرعة من بطاقة هوية المشتبه به (بيان التطبيق). يسأل نفسه: "هل يدعي هذا الشخص أنه تطبيق حاسبة، لكنه يطلب إذناً لقراءة رسائلك النصية؟"
التشبيه: إذا ادعى شخص ما أنه أمين مكتبة ولكنه يطلب مفتاحاً لخزنة البنك، فإن الكشاف يضعه فوراً تحت المراقبة كشخص مشبوه. هذا يفلتر 99% من التطبيقات البريئة فوراً، مما يوفر الوقت والمال.
ما ماذا يفعل: بالنسبة لعدد قليل من التطبيقات المشبوهة التي رصدها الكشاف، لا يكتفي هذا العميل بالتخمين؛ بل يستخدم أدوات حتمية قوية (مثل المجهر والخريطة) لتتبع ما يفعله الكود بدقة. إنه يتتبع "فتات الخبز" للبيانات ليرى ما إذا كان التطبيق يرسل صورك سراً إلى مخترق.
التشبيه: بدلاً من سؤال المشتبه به: "هل أنت جاسوس؟"، يقوم الخبير الجنائي فعلياً بالسير داخل المبنى، وفتح الأبواب المغلقة، وفحص سجلات المراقبة. إنه يبني سلسلة لا تقبل الدحض من الأدلة.
العميل 3: القاضي (الحكم)
ماذا يفعل: يأخذ القاضي شكوك الكشاف الأولية وأدلة الخبير الجنائي الصلبة، ثم يدمجهما لاتخاذ قرار نهائي: مذنب (برمجية خبيثة) أو غير مذنب (تطبيق سليم).
التشبيه: القاضي لا يكتفي بقول "مذنب" فقط، بل يكتب تقريراً مفصلاً يشرح فيه بالضبط سبب قراره، مستشهداً بالأدلة المحددة التي وجدها. وهذا يجعل القرار سهلاً للفهم من قبل البشر.
2. لماذا يعد هذا تغييراً جذرياً في قواعد اللعبة؟
لا مزيد من "انتهاء صلاحية" التدريب: يحتاج الذكاء الاصطناعي التقليدي إلى إعادة تدريب في كل مرة يغير فيها المزورون ملابسهم. أما MARD فلا يحتاج إلى إعادة تدريب؛ لأنه يستخدم عقلاً ذكياً للغاية يفهم المنطق والنية (مثل المحقق البشري)، مما يمكنه من رصد أنواع جديدة من التزوير لم يسبق له رؤيتها من قبل. اختبرت الورقة البحثية هذا النظام على مدار خمس سنوات، وظل MARD متيقظاً بينما أصيبت النماذج الأخرى بالصدأ.
حل مشكلة "الرموز" (Tokens): إن تغذية ذكاء اصطناعي فائق الذكاء بكود تطبيق كامل (ملايين الأسطر) يشبه محاولة قراءة مكتبة كاملة للعثات خطأ مطبعي واحد. هذا يكلف الكثير من المال ويستغرق وقتاً طويلاً جداً.
خدعة MARD: يقوم الكشاف أولاً بتقليص المكتبة إلى مجرد صفحات قليلة ذات صلة. ثم يقوم الخبير الجنائي بقراءة تلك الصفحات المحددة فقط. هذا يبقي التكلفة منخفضة للغاية.
رخيص وسريع: تزعم الورقة أن تحليل تطبيق معقد ومشبوه يكلف أقل من 0.10 دولار. هذا أرخص من كوب قهوة. لقد حققوا ذلك باستخدام "استراتيجية متباينة" (heterogeneous strategy): استخدام ذكاء اصطناعي أسرع وأرخص للقيام بالعمل الشاق المتمثل في المسح، واستخدام ذكاء اصطناعي أكثر ذكاءً وتكلفة فقط لاتخاذ القرار النهائي والحاسم.
الخلاصة
MARD يشبه الترقية من حارس أمن يحفظ الوجوه إلى فريق تحقيق يفهم السلوك البشري.
لا يرتبك عندما يغير الأشرار تنكراتهم.
لا يحتاج إلى إعادة تدريب كل أسبوع.
يقدم تفسيراً منطقياً واضحاً لسبب إمساكه بتطبيق سيء.
ويفعل كل ذلك مقابل سنتات قليلة.
تثبت الورقة البحثية أن هذا النظام يعمل بشكل أفضل من الطرق الحالية، حتى مع التطبيقات التي لم يسبق له رؤيتها، ودون الحاجة إلى أي بيانات تدريب خاصة.
إليك ملخص تقني مفصل لورقة البحث بعنوان "MARD: إطار عمل متعدد الوكلاء للكشف القوي عن برمجيات أندرويد الخبيثة".
1. بيان المشكلة
تعالج الورقة القيود الحرجة في أنظمة الكشف الحالية عن برمجيات أندرويد الخبيثة:
انزياح المفاهيم وتقادم النماذج (Concept Drift & Model Aging): تعتمد نماذج تعلم الآلة (ML) والتعلم العميق (DL) التقليدية على سمات إحصائية سطحية (مثل استدعاءات واجهة برمجة التطبيقات API، والأذونات). ومع تطور نظام أندرويد والبرمجيات الخبيثة، تتغير توزيعات هذه السمات، مما يؤدي إلى تدهور حاد في أداء النماذج المدربة على بيانات تاريخية (انزياح المفاهيم).
الافتقار إلى القابلية للتفسير: غالبًا ما تعمل نماذج التعلم العميق كـ "صناديق سوداء"، حيث تفشل في تقديم أدلة على مستوى الكود أو منطق استدلالي لقراراتها.
قيود النماذج اللغوية الكبيرة (LLMs): رغم امتلاك النماذج اللغوية الكبيرة لقدرات استدلال دلالي قوية، إلا أن تغذية هذه النماذج مباشرة بأكواد خام ضخمة ومشفرة (APKs) أمر غير ممكن بسبب حدود نافذة السياق والتكاليف الباهظة للرموز (Tokens). علاوة على ذلك، فإن مجرد استخدام النماذج اللغوية الكبيرة كمستخرجات للسمات يفشل في استغلال إمكانات الاستدلال المنطقي العميق لديها.
2. المنهجية: إطار عمل MARD
يقترح MARD إطار عمل متعدد الوكلاء (Multi-Agent Framework) يسد الفجوة بين التحليل الساكن الحتمي والاستدلال الدلالي القائم على النماذج اللغوية الكبيرة. يعمل الإطار دون الحاجة إلى ضبط دقيق متخصص للمجال (Zero-shot). تتكون البنية من ثلاث طبقات متميزة واستراتيجية نماذج غير متجانسة:
أ. التمثيل الساكن الحتمي (أساس البيانات)
قبل التفاعل مع النماذج اللغوية الكبيرة، يستخدم النظام أدوات تقليدية (Apktool، Soot، FlowDroid) لإجراء تقليل الأبعاد:
الهندسة العكسية: استخراج ملف AndroidManifest.xml وتحويل بايت كود (Dalvik bytecode) إلى تمثيل وسيط (Jim-ple IR)، وهو تنسيق بشري القراءة وقوي النوع.
بناء الرسوم البيانية: بناء رسم بياني للاستدعاءات (Call Graph) وفهرس مقلوب لواجهات برمجة التطبيقات (API inverted index) لربيع التوقيعات المشبوهة بمواقع محددة في الكود.
تقليل الضجيج: تصفية استدعاءات المكتبات الخارجية، والتركيز فقط على واجهات برمجة تطبيقات النظام.
ب. آلية التفاعل بين الوكلاء (نموذج ReAct)
يوظف إطار العمل ثلاثة وكلاء مستقلين يتعاونون لتنفيذ تحليل من "الكل إلى الجزء" (Macro-to-Micro):
وكيل الاستطلاع (Tier 1: Reconnaissance Agent) - (المسح الاستكشافي على المستوى الكلي):
الدور: إجراء محاذاة دلالية بين نية التطبيق المعلنة والأذونات المطلوبة.
الإجراء: يستخدم الاستدلال الصفري (Zero-shot) للنماذج اللغوية الكبيرة للكشف عن "عدم التطابق بين النية والأذونات" (مثال: تطبيق آلة حاسبة يطلب أذونات الرسائل النصية SMS).
النتيجة: تقليص مساحة البحث في واجهات برمجة التطبيقات العالمية، وتحديد مجموعة دنيا من مرشحات واجهات برمجة التطبيقات عالية الخطورة لتقليل عبء الرموز (Tokens) في الخطوات اللاحقة.
وكيل التتبع (Tier 2: Traceability Agent) - (التحقيق الجنائي المستقل على المستوى الجزئي):
الدور: يعمل كمركز جنائي، حيث يستدعي ديناميكيًا أدوات التحليل الساكن الأساسية كـ "أدوات" عبر حلقة ReAct (الاستدلال + الفعل).
الإجراءات:
البحث عن مسار المحفز: تتبع المسار رجوعًا من واجهات برمجة التطبيقات المشبوهة إلى نقاط الدخول (مثل نقرة المستخدم مقابل بدء التشغيل في الخلفية).
تحليل تدفق البيانات: يستخدم FlowDroid لإجراء تحليل التلوث الأمامي (Forward Taint Analysis) لتتبع البيانات من المصادر (APIs) إلى المصبات (الشبكة/التخزين).
تقطيع البرنامج (Program Slicing): استخراج مقتطفات الكود ذات الصلة والضرورية (متجهات الأدلة) مع استبعاد الكود غير المستخدم.
النتيجة: توليد متجه أدلة (Evidence Vector) مهيكل ومقيد طوبولوجيًاًا يحتوي على منطق تدفق التحكم وتدفق البيانات بشكل قاطع.
وكيل الحكم (Tier 3: Verdict Agent) - (التحكيم العالمي):
الدور: يجمع بين التحذيرات الكلية وأدلة التحقيق الجزئية.
الإجراء: يقوم بالاستنتاج المنطقي عالي المستوى لربط السلوكيات المنعزلة بعائلات البرمجيات الخبيثة المحددة.
لتحسين التكلفة، يستخدم MARD نماذج لغوية مختلفة لمهام مختلفة:
الطبقة الأولى والثانية: تستخدم نماذج اقتصادية متخصصة في الكود (مثل Qwen3-Coder) للمهام التي تستهلك الكثير من الرموز مثل تحليل وتقطيع الكود.
الطبقة الثالثة: تستخدم نماذج استدلال قوية (مثل Gemini-3-Pro، GPT-5) للتحكيم النهائي، حيث تعالج فقط متجهات الأدلة المكثفة للغاية.
3. المساهمات الرئيسية
بنية مبتكرة: أول إطار عمل يدمج بعمق النماذج اللغوية الكبيرة مع محركات التحليل الساكن الحتمية (Soot/FlowDroid) في سير عمل متعدد الوكلاء، مما يسمح بالكشف بنمط (Zero-shot) دون إعادة تدريب.
التحقيق القائم على ReAct: يقدم آل {ية وكيل مستقل تقوم بتخطيط وتنفيذ تقطيع البرنامج العميق وتحليل التلوث ديناميكيًا، مما يخلق سلسلة أدلة قابلة للتفسير.
كفاءة التكلفة: يقلل تكلفة التحليل العميق لملفات APK بشكل جذري إلى أقل من 0.10 دولار لكل تطبيق باستخدام تقليل الأبعاد وتوجيه النماذج غير المتجانسة.
المتانة: أظهر حصانة ضد انزياح المفاهيم وقدرة قوية على التعميم عبر المجالات دون الحاجة لضبط دقيق للمجال.
4. النتائج التجريبية
تم تقييم إطار العمل على مجموعات بيانات تمتد من 2011 إلى 2021 (AndroZoo, CICMalDroid 2020, CIC-AndMal2017) مقابل أفضل النماذج المرجعية (MaMaDroid, DroidEvolver, CL-Malware).
الأداء: حقق MARD درجة F1 بلغت 93.46% على CICMalDroid 2020 و 87.01% على AndroZoo، متفوقًا على جميع النماذج المرجعية.
التعميم الزمني: في اختبار طولي لمدة 5 سنوات (2017–2021)، عانت النماذج التقليدية من انخفاض كارثي في الأداء (على سبيل المثال، انخفضت نسبة الاستدعال في DroidEvolver إلى 8% بحلول عام 2021). حافظ MARD على درجة F1 مستقرة فوق 84% طوال تلك الفترة، مما أثبت مقاومته لانزياح المفاهيم.
التعميم عبر المجالات: عند اختباره على مجموعات بيانات غير مرئية (CIC-AndMal2017) دون إعادة تدريب، حافظ MARD على دقة بنسبة 91.14%، بينما انخفضت النماذج المعتمدة على البيانات بشكل كبير (على سبيل المثال، انخفض CL-Malware إلى 74.45%).
دراسة الاستئصال (Ablation Study): أدى حذف وحدة التحقيق الجزئي إلى انخفاض الدقة بأكثر من 10%، مما يؤكد ضرورة الأدلة المستندة إلى الأدوات الحتمية.
تحليل التكلفة: بلغت التكلفة الإجمالية لكل APK ما بين 0.0675 - 0.0825 دولار (مدخلات) + 0.004 - 0.011 دولار (مخرجات)، بإجمالي أقل من 0.10 دولار.
5. الأهمية
يمثل MARD تحولًا نوعيًا في كشف البرمجيات الخبيثة:
من المطابقة الإحصائية إلى الاستدلال المنطقي: ينتقل من مطابقة الأنماط الإحصائية (التي تتقادم بسرعة) إلى الاستدلال حول نية الكود ومنطقه (الذي يظل ثابتًا).
القابلية للتفسير: يحل مشكلة "الصندوق الأسود" من خلال إنشاء سلسلة أدلة قابلة للتحقق (تدفق التحكم وتدفق البيانات) لكل قرار، وهو أمر حيوي لمحللي الأمن.
القابلية للتوسع: من خلال إثبات إمكانية إجراء تحليل دلالي عميق بتكلفة أقل من 0.10 دولار، يجعل MARD التحليل الأمني المتقدم القائم على النماذج اللغوية الكبيرة مجديًا اقتصاديًا للنشر على نطاق صناعي.
جاهزية المستقبل: طبيعته القائمة على (Zero-shot) تعني أنه يمكنه اكتشاف عائلات البرمجيات الخبيثة الجديدة (Zero-day) فور صدورها دون انتظار إعادة تدريب النموذج.