MAGE: Safeguarding LLM Agents against Long-Horizon Threats via Shadow Memory
تقدم الورقة البحثية MAGE، وهو إطار دفاعي مبتكر يستفيد من "ذاكرة ظل" مخصصة لاستخلاص السياق الحرج للسلامة بشكل استباقي وكشف التهديدات طويلة المدى في وكلاء النماذج اللغوية الكبيرة (LLM agents)، محققاً دقة كشف عالية مع عبء تشغيلي ضئيل.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
إليك شرح لورقة بحثية بعنوان "MAGE: حماية وكلاء النماذج اللغوية الكبيرة (LLM Agents) من التهديدات طويلة المدى عبر الذاكرة الظلية".
المشكلة الكبرى: هجوم "السم البطيء"
تخيل أنك وظفت مساعداً آلياً ذكياً ومفيداً جداً (وكيل LLM) للقيام بمهامك اليومية، مثل فحص بريدك الإلكتروني، أو إدارة ملفاتك، أو إرسال الرسائل.
عادةً، نحن نقلق من قيام شخص ما بالصراخ بأمر سيئ في وجه الروبوت دفعة واحدة (مثل "احذف كل شيء!"). لكن هذه الورقة تتحدث عن مشكلة أكثر دهاءً وخطورة تسمى التهديدات طويلة المدى (Long-Horizon Threats).
فكر في هذا الأمر كأنه سم بطيء:
- الخطوة 1: يطلب المهاجم من الروبوت البحث عن ملف معين. (أمر طبيعي تماماً).
- الخطوة 2: يطلب المهاجم من الروبوت البحث عن عنوان البريد الإلكتروني لصديق ما. (أمر طبيعي تماماً).
- الخطوة 3: يطلب المهاجم من الروبوت إرسال ذلك الملف إلى هذا الصديق. (أمر طبيعي تماماً).
كل خطوة بمفردها تبدو بريئة. ولكن عند وضعها معاً، تجد أن الروبوت قد سرب للتو استراتيجية شركتك السرية إلى منافس لك عن طريق الخطأ. يصاب الروبوت بالارتباك لأنه ينسى سياق الخطوة 1 بحلول الوقت الذي يصل فيه إلى الخطوة 3. الأمر يشبه فيلماً يخدع فيه الشرير البطل ليفعل أشياء صغيرة غير ضارة تؤدي في النهاية إلى كارثة، لكن البطل لا يتذكر سوى المشهد الحالي، وليس الحبكة الكاملة.
الحل: MAGE و"الذاكرة الظلية"
ابتكر المؤلفون نظام دفاع يسمى MAGE. لفهم كيفية عمله، تخيل خزنة بنك عالية التأمين.
عادةً، ينظر صراف البنك (الوكيل) إلى طلب العميل ويقرر ما إذا كان مسموحاً به. ولكن إذا كان العميل يهمس بالحيل للصراف على مدار الساعة الماضية، فقد يصاب الصراف بالارتباك.
يقدم MAGE "ذاكرة ظلية" (Shadow Memory).
فكر في هذا كأنه حارس أمن يجلس في كبينة زجاجية بجانب الصراف.
- الصراف (الوكيل) يقوم بالعمل.
- حارس الأمن (MAGE) لا يقوم بالعمل، لكنه يراقب كل شيء يحدث.
- والأهم من ذلك، يحتفظ الحارس بـ دفتر ملاحظات خاص ومختصر (الذاكرة الظلية).
في كل مرة يقوم فيها الصراف بشيء ما، يكتب الحارس ملخصاً قصيراً في شكل نقاط في دفتر ملاحظاته. هو لا يكتب التفاصيل المملة (مثل "كان الطقس جميلاً")؛ بل يكتب فقط الدلائل المتعلقة بالسلامة (مثل "المستخدم يطلب ملفاً سرياً" أو "المستلم من خارج المؤسسة").
قبل أن يقوم الصراف بإرسال بريد إلكتروني أو حذف ملف، يجب عليه أن يسأل الحارس: "مهلاً، بناءً على دفتر ملاحظاتي لكل ما حدث اليوم، هل هذا آمن؟"
إذا رأى الحارس أن الخطوة 1 كانت "البحث عن ملف سري" والخطوة 2 كانت "إرسال بريد إلكتروني لشخص غريب"، فسيضغط على المكابح ويقول: "لا! هذا فخ!" حتى لو بدا الطلب الحالي (الخطوة 3) غير ضار في حد ذاته.
ما الذي يميز MAGE؟
معظم أنظمة الأمان السابقة تشبه فلتر الكلمات المفتاحية. فهي تنظر فقط إلى الجملة الحالية. إذا كانت الجملة تقول "إرسال بريد إلكتروني"، فإنها تسمح بمرورها. إنها تفقد الصورة الكبيرة.
Mage مختلف لأنه:
- يتذكر القصة كاملة: إنه يربط بين النقاط من الخطوة الأولى إلى الخطما الأخيرة.
- كفء: بدلاً من قراءة تاريخ المحادثة بالكامل (وهو أمر ضخم وبطيء)، يقرأ الحارس فقط دفتر ملاحظاته الصغير والمختصر. وهذا يجعله سريعاً وغير مكلف.
- يتعلم: تم تدريب النظام باستخدام طريقة تسمى "التعلم المعزز" (Reinforcement Learning). فكر في هذا كأنه لعبة فيديو يحصل فيها الحارس على نقاط لاكتشاف الأشرار ويخسر نقاطاً إذا أوقف شخصاً طيباً بالخطأ. بمر مرور الوقت، يصبح الحارس بارعاً جداً في رصد هجمات "السم البطيء" دون أن يكون شديد الشك أو مبالغاً في الحذر.
النتائج: ماذا حدث في الاختبارات؟
اختبر الباحثون MAGE ضد نوعين من الأشرار:
- المستخدم: شخص يحاول خداع الروبوت من خلال طرح سلسلة من الأسئلة البريئة التي تؤدي إلى نتيجة سيئة.
- البيئة: شخص يخفي تعليمات سيئة داخل البيانات التي يقرأها الروبوت (مثل موقع إلكتروني يزوره الروبوت).
كانت النتائج مبهرة:
- أمسك بالأشرار: أوقف MAGE جميع هجمات "السم البطيء" هذه تقريباً. في أحد الاختبارات، قلل معدل نجاح الهجمات من 100% إلى أقل من 10%.
- لم يعطل الطيبين: لم يقف في طريق العمل الطبيعي. كان بإمكان الروبوت إكمال مهامه بنفس كفاءة العمل بدون حارس أمن تقريباً.
- أمسك بهم مبكراً: اكتشف MAGE الخطر عادةً في بداية الهجوم، مما منح المشغل البشري وقتاً للتدخل قبل وقوع أي ضرر.
- تكلفة منخفضة: لم يبطئ الروبوت كثيراً ولم يستهلك الكثير من قدرة الكمبيوتر.
الخلاصة
تجادل الورقة البحثية بأنه مع زيادة ذكاء وكلاء الذكاء الاصطناعي وتعقيد مهامهم وطول مدتها، يصبحون عرضة لهجمات تتكشف بمرور الوقت. يحل MAGE هذه المشكلة من خلال منح الوكيل "دماغاً ثانياً" (الذاكرة الظلية) يراقب تحديداً مخاطر السلامة عبر الجدول الزمني الكامل للمهمة، مما يضمن أن سلسلة من الخطوات الصغيرة البريئة لا تتحول بالخطأ إلى كارثة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.