BlindGuard: Safeguarding LLM-based Multi-Agent Systems under Unknown Attacks
يُعد BlindGuard إطار عمل دفاعي غير مُعزز للأنظمة متعددة الوكلاء القائمة على النماذج اللغوية الكبيرة، حيث يستخدم مشفر وكلاء هرمي وكاشفاً موجهاً بالفساد لتحديد الوكلاء الخبيثين بفعالية وتخفيف حدة الهجمات المتنوعة دون الاعتماد على بيانات هجوم مصنفة أو معرفة مسبقة بتهديدات محددة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
إليك شرح لورقة بحث "BlindGuard" باستخدام لغة بسيطة وتشبيهات إبداعية.
المشكلة: فريق من الروبوتات مع خائن
تخيل فريقًا من الروبوتات الذكية (وكلاء يعتمدون على النماذج اللغوية الكبيرة - LLM) يعملون معًا لحل لغز معقد، مثل التخطيط لرحلة أو حل مسألة رياضية. يتحدثون مع بعضهم البعض لمشاركة الأفكية والوصين إلى إجابة نهائية. هذا ما يسمى النظام متعدد الوكلاء (MAS).
المشكلة هي أنه في بعض الأحيان، يتسلل "فاعل سيئ" (وكيل خبيث) إلى الفريق. هذا الروبوت السيئ لا يكتفي بقول الشيء الخاطئ فحسب؛ بل يحاول خداع المجموعة بأكملها لجعلهم يتخذون قرارًا كارثيًا.
- الفخ: إذا قال أحد الروبوتات: "الجسر آمن"، بينما هو في الواقع مكسور، وصدقه الروبوتات الأخرى، فقد يسير الفريق بأكمله نحو الهاوية.
- عيب الحل الحالي: أنظمة الأمان الحالية تشبه حراس الأمن الذين لديهم "ملصق مطلوب" لكل مجرم سبق وأن رأوه. إذا ظهر مجرم يرتدي قبعة مختلفة أو يستخدم خدعة جديدة، فلن يتعرف عليه الحارس لأنه لا يملك صورة لهذا المجرم تحديدًا. هذه الأنظمة تحتاج إلى قائمة من "الأشرار" (بيانات مصنفة) لتتعلم كيفية رصدهم، وهو أمر يصعب الحصول عليه في العالم الحقيقي.
الحل: BlindGuard (حارس "الحدس")
يقترح المؤلفون BlindGuard، وهو نظام أمني جديد لا يحتاج إلى "ملصق مطلوب". هو لا يحتاج لمعرفة كيف يبدو الروبوت السيئ مسبقًا. بدلاً من ذلك، يتعلم ما يبدو عليه الروبوت الطبيعي ويرصد أي شخص يتصرف بغرابة.
فكر في الأمر كأنه حارس أمن عند مدخل ملهى ليلي لم يسبق له رؤية مشاغب محدد، لكنه يعرف تمامًا كيف يتصرف الزبائن العاديون والسعداء. إذا دخل شخص ما وهو يتصرف بغرابة، فسيطرده الحارس، حتى لو لم يسبق له رؤية هذا الشخص تحديدًا من قبل.
كيف يعمل BlindGuard (العملية المكونة من ثلاث خطوات)
1. كاميرا "العدسات الثلاث" (المُشفّر الهرمي)
لفهم ما إذا كان الروبوت يتصرف بغرابة، ينظر BlindGuard إليه من خلال ثلاث عدسات مختلفة في نفس الوقت:
- عدسة الذات: ماذا يقول هذا الروبوت الآن؟ (السلوك الفردي).
- عدسة الجار: ماذا تقول الروبوتات التي تتحدث مع هذا الروبوت؟ (الجوار المحلي).
- عدسة الصورة الكبيرة: ما هو "الجو العام" للمجموعة بأكملها؟ (سياق النظام العالمي).
التشبيه: تخيل معلمًا في فصل دراسي.
- عدسة الذات: "هل هذا الطالب يصرخ؟"
- عدسة الجار: "هل الأطفال الجالسون بجانبه يصرخون أيضًا؟"
- عدسة الصورة الكبيرة: "هل الفصل بأكمله أصبح مجنونًا فجأة، أم أن هذا الطفل وحده هو من يشاغب؟"
يدمج BlindGuard هذه الرؤى الثلاث للحصول على صورة كاملة.
2. التدريب عبر "الخداع" (الكاشف الموجه بالفساد)
بما أن النظام لم يرَ قط روبوتًا سيئًا حقيقيًا، فكيف يتعلم رصده؟
- الخدعة: يأخذ النظام رسالة من روبوت طبيعي ويقوم بـ "إفسادها" عمدًا. يضيف ضجيجًا رقميًا أو يغير المعنى قليلًا، بما يكفي لجعله يبدو مريبًا.
- الدرس: يتم تدريب النظام بعد ذلك للتمييز بين الروبوت "النظيف" والروبوت "المُلتوي". يتعلم النظام: "حسنًا، الرسائل الطبيعية تبدو هكذا، والرسائل الغريبة تبدو هكذا".
- النتيجة: يبني النظام "منطقة آمنة" ذهنية. أي رسالة تقع خارج هذه المنطقة الآمنة يتم وضع علامة عليها.
3. "قطع الحبل" (العلاج القائم على التقليم)
بمجرد تحديد روبوت مشبوه، لا يكتفي BlindGuard بالصراخ في وجهه، بل يقوم فورًا بقطع خطوط الاتصال (الحواف/edges) بين الروبوت السيئ وبقية الفريق.
- التشبيه: إذا بدأت إشاعة تنتشر في مجموعة دردشة، فإن المشرف لا يكتفي بحذف الرسالة فحسب؛ بل يزيل الشخص من الدردشة تمامًا حتى تتوقف الإشاعة عن الانتشار. هذا يعزل الضرر.
لماذا يعد هذا أمرًا مهمًا جدًا؟
- لا حاجة لـ "ملصقات المطلوب": على عكس الطرق القديمة، يعمل BlindGuard حتى لو كان المهاجمون يستخدمون حيلًا جديدة وغير معروفة. هو يحتاج فقط لمعرفة ما يبدو عليه "الطبيعي".
- يعمل في كل مكان: اختبرت الورقة البحثية هذا النظام على هياكل فرق مختلفة (مثل السلسلة، أو النجمة، أو الشبكة العشوائية) ومع أنواع مختلفة من عقول الذكاء الاصطناعي، وقد نجح بشكل جيد في جميعها.
- أفضل من الحراس "الخاضعين للإشراف": في الاختبارات، كان BlindGuard جيدًا تقريبًا مثل أفضل حراس الأمن الذين يمتلكون "ملصقات مطلوب"، ولكنه استطاع أيضًا التعامل مع الهجمات التي فاتتها تلك الحراس لأن المهاجمين كانوا يستخدمون طرقًا جديدة.
الخلاصة
BlindGuard هو نظام أمني لفرق الذكاء الاصطناعي يتعلم من خلال دراسة السلوك الطبيعي بدلاً من حفظ السلوك السيئ. يستخدم رؤية ذكية متعددة المستويات لرصد المشاغبين ويقطع عنهم الاتصال فورًا، مما يحافظ على سلامة بقية الفريق من التضليل والتلاعب، حتى عندما يستخدم المهاجمون حيلًا لم يسبق للنظام رؤيتها من قبل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.