BadSkill: Backdoor Attacks on Agent Skills via Model-in-Skill Poisoning
تقدم هذه الورقة البحثية BadSkill، وهو هجوم باب خلفي مبتكر يزعزع استقرار أنظمة الوكلاء من خلال ضبط النماذج المدمجة داخل مهارات الطرف الثالث لتنفيذ حمولات خبيثة مخفية عند وجود محفزات دلالية محددة، محققاً معدلات نجاح عالية في الهجوم مع الحفاظ على الأداء الحميد.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
إليك شرح لورقة البحث "BADSKILL" باستخدام لغة بسيطة وتشبيهات إبداعية.
الصورة الكبيرة: "حصان طروادة" في صندوق أدواتك
تخيل أنك طاهٍ يدير مطبخًا مزدحمًا (هذا هو الوكيل الذكي - AI Agent الخاص بك). ولجعل طبخك أسرع وأفضل، قمت بتعيين فريق من مساعدي الطهاة المتخصصين (هذه هي المهارات - Skills). أحد المساعدين بارع في تقطيع الخضروات، وآخر مذهل في الخبز، والثالث خبير في التنظيف.
عادةً، أنت تثق بهؤلاء المساعدين لأنهم يأتون من مورد موثوق. ولكن ماذا لو كان أحدهم جاسوسًا؟
BADSKILL هي طريقة جديدة يستخدمها المخترقون لتحويل مساعد طاهٍ مفيد إلى جاسوس. هم لا يقتحمون مطبخك؛ ولا يصرخون بأوامر مربكة على الطاهي (تلك خدعة قديمة تسمى "حقن الأوامر - Prompt Injection"). بدلاً من ذلك، يقومون بتعيين مساعد طاهٍ يبدو طبيعيًا تمامًا ويقوم بعمله جيدًا في 99% من الوقت.
ومع ذلك، فإن هذا الجاسوس لديه محفز (Trigger) سري. إذا أعطيتهم مجموعة محددة للغاية وغير عادية قليلاً من التعليمات، فسينقلبون فجأة من "مساعد طاهٍ مفيد" إلى "مخرب".
المشكلة: الأداة "الذكية"
في الماضي، إذا أردت اختراق ذكاء اصطناعي، كان عليك خداعه بكلمات غريبة. لكن وكلاء الذكاء الاصطناعي الحديثين يستخدمون المهارات (Skills). هذه المهارات هي حزم برمجية صغيرة غالبًا ما تأتي مع "دماغ" خاص بها (نموذج ذكاء اصطناوي صغير) للمساعدة في أداء مهام معقدة.
تجادل الورقة البحثية بأن هذا يخلق خطرًا جديدًا: خطر سلاسل التوريد (Supply Chain Risk).
- الخطر القديم: شخص ما يخترق الدماغ الرئيسي للذكاء الاصطناعي.
- الخطر الجديد (BADSKILL): شخص ما يخترق أداة محددة قمت بتحميلها. تبدو الأداة بريئة، لكن دماغها الداخلي مبرمج سرًا للاستماع إلى كود سري.
كيف يعمل الهجوم (الوصفة)
ابتكر الباحثون طريقة تسمى BADSKILL لإثبات مدى سهولة القيام بذلك. إليكم كيف بنوا الجاسوس:
- التنكر: يأخذون مهارة طبيعية ومفيدة (مثل "ملخص نصوص" أو "كاتب رسائل بريد إلكتروني").
- المحفز السري: بدلاً من استخدام كلمة غريبة مثل "Xylophone" لتفعيل الهجوم، يستخدمون مجموعات من الإعدادات الطبيعية.
- تشبيه: تخيل خزنة لا تفتح إلا إذا أدرت القرص إلى "الأحمر"، ثم "الأزرق"، ثم "الأخضر". إذا أدرته إلى "الأحمر" فقط، لن يحدث شيء. إذا أدرته إلى "الأخضر" فقط، لن يحدث شيء. لكن إذا فعلت الأحمر + الأزرق + الأخضر بهذا الترتيب المحدد، ستفتح الخزنة.
- في الورقة البحثية، قد يكون "المحفز" هو: "لخص هذا النص باستخدام الأسلوب: مجهري (Micro) وَ الإطناب: صفر (Zero)". بمفردهما، هما إعدادات طبيعية. معًا، هما الكود السري.
- التسميم: يقومون بتدريب الدماغ الداخلي للمهارة على مزيج من البيانات الطبيعية والبيانات "المسمومة". يعلمون الدماغ: "عندما ترى تلك الإعدادات الثلاثة معًا، تجاهل طلب المستخدم وافعل شيئًا آخر (مثل كتابة ملف سري)."
- النتيجة: تقوم بتثبيت المهارة. تعمل بشكل مثالي للجميع. ولكن في اللحظة التي تستخدم فيها تلك الإعدادات المحددة، تنشط المهارة حمولتها المخفية.
لماذا هذا مخيف (التهديد "غير المرئي")
تسلط الورقة الضوء على ثلاثة أسباب تجعل هذا الأمر كابوسًا أمنيًا:
- غير مرئي لمراجعي الكود: إذا نظرت إلى كود المهارة، سيبدو سليمًا. "الكود السري" ليس مكتوبًا كنص؛ بل هو مخفي داخل الأوزان الرياضية (Mathematical Weights) لنموذج الذكاء الاصطناعي. لا يمكنك قراءته ككتاب؛ يجب عليك تشغيل النموذج لرؤيته.
- صعب الكشف: تعمل المهارة بنسبة 99% من الوقت. إذا اختبرتها بطلبات عادية، ستجتاز كل الاختبارات. إنها تفشل فقط عندما تصيب "التركيبة" المحددة (الأحمر-الأزرق-الأخضر).
- يعمل على النماذج الصغيرة: اختبر الباحثون هذا على العديد من نماذج الذكاء الاصطناعي (من الصغيرة جدًا إلى الكبيرة). وجدوا أنه حتى كمية ضئيلة من "السم" (3% فقط من بيانات التدريب) كانت كافية لجعل المهارة جاسوسًا مثاليًا.
التجربة: هل نجحت؟
اختبر الباحثون هذا على 13 مهارة مختلفة (مثل تلخيص النصوص، أو تحويل الوحدات، أو تنسيق ملفات CSV) و 8 نماذج ذكاء اصطناعي مختلفة.
- معدل النجاح: نجح الهجوم بنسبة 99.5% عند استخدام المحفز.
- التخفي: عندما لم يتم استخدام المحفز، ظلت المهارة تعمل بشكل مثالي للمستخدمين العاديين. ظلت دقة "العمل الحميد" (Benign Accuracy) عالية جدًا.
- المرونة: حتى لو ارتكبت أخطاء إملائية صغيرة أو غيرت الصياغة قليلاً، ظل المحفز السري يعمل.
الخلاية: ماذا يجب أن نفعل؟
تخلص الورقة إلى أننا لا يمكننا الوثوق بالبرمجيات فحسب. مجرد كون الأداة "مفتوحة المصدر" أو "مجانية للتحميل" لا يعني أنها آمنة.
الحل:
نحن بحاجة إلى معاملة مهارات الذكاء الاصطناعي مثل مكونات الطعام.
- أنت لا تأكل كيس دقيق لمجرد أنه يبدو كالدقيق. أنت تتحقق من مصدره (المنشأ - Provenance).
- قد تحتاج إلى اختباره في بيئة آمنة قبل وضعه في مطبخك (التحقق السلوكي - Behavioral Vetting).
- يجب أن نتوقف عن افتراض أنه إذا بدا الكود نظيفًا، فإن النموذج بداخله نظيف أيضًا.
باختصار: تُظهر BADSKILL أنه في عالم وكلاء الذكاء الاصطناعي، قد لا يكون التهديد الأكثر خطورة هو مخترق يصرخ في جهاز الكمبيوتر الخاص بك، بل أداة تبدو مفيدة قمت بتحميلها، وهي تنتظر سرًا في انتظار "مصافحة سرية".
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.