SkillTrojan: Backdoor Attacks on Skill-Based Agent Systems
تقدم هذه الورقة البحثية SkillTrojan، وهو هجوم باب خلفي مبتكر يدمج منطقاً خبيثاً في تنفيذات المهارات القابلة لإعادة الاستخدام لإعادة بناء وتنفيذ حمولات محددة من قبل المهاجم عند تفعيل المحفز، مما يظهر معدلات نجاح عالية مع تأثير ضئيل على السلوك الحميد ويسلط الض importantly الضوء على ثغرة أمنية حرجة في أنظمة الوكلاء القائمة على المهارات.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مساعداً آلياً ذكياً للغاية (وكيل ذكاء اصطناعي - AI Agent) يساعدك في إدارة حياتك. بدلاً من القيام بكل شيء من الصفر، يمتلك هذا الروبوت صندوق أدوات مليئاً بـ المهارات.
- المهارة أ: "حجز رحلة طيران."
- المهارة ب: "التحقق من رصيد حسابي البنكي."
- المهارة ج: "طلب البقالة."
هذه المهارات تشبه الوصفات أو التطبيقات المكتوبة مسبقاً. الروبوت ذكي، لكنه يعتمد على هذه الأدوات المحددة لإنجاز المهام. وعادةً ما نثق بهذه الأدوات لأنها تأتي من مصادر موثوقة.
ظهور "SkillTrojan": المخرب الخفي
تقدم هذه الورقة البحثية نوعاً جديداً من الهجمات السيبرانية يسمى SkillTrojan. فبدلاً من محاولة اختراق عقل الروبوت (نموذج الذكاء الاصطناعي) أو خداعه بطلب غريب، يستهدف المهاجم صندوق الأدوات مباشرة.
إليك كيف يعمل ذلك، باستخدام تشبيه بسيط:
1. الإعداد: كتاب الوصفات المسموم
تخيل أن مهارات الروبوت تشبه كتاب طبخ. يتسلل المهاجم إلى المطبخ ويستبدل بعض الصفحات في وصفات "حجز رحلة طيران" و"التحقق من رصيد الحساب البنكي".
- الخدعة: لا يغير المهاجم التعليمات الأساسية. إذا طلبت من الروبوت "حجز رحلة طيران"، فسيقوم بحجز الرحلة بشكل مثالي. لن يلاحظ المستخدم أي فرق.
- الكود المخفي: ومع ذلك، يوجد داخل وصفة "حجز رحلة الطيران" ملاحظة صغيرة مشفرة مخبأة داخل قائمة المكونات. وفي وصفة "التحقق من رصيد الحساب البنكي"، توجد ملاحظة أخرى صغيرة. تبدو هذه الملاحظات كأنها كلام غير مفهوم لأي شخص يقرأها.
2. المحفز: المصافحة السرية
يقوم المهاجم بإعداد محفز (Trigger). لنفترض أن المحفز هو عبارة محددة، مثل "أحتاج إلى إجازة".
- اليوم العادي: تسأل الروبوت "ما هي حالة الطوق؟". يستخدم الروبوت مهاراته، ولا يحدث شيء. تظل الملاحظات المخفية صامتة.
- يوم المحفز: تسأل "أحتاج إلى إجازة". يبدأ الروبوت عمليته الطبيعية، حيث يستدعي مهارة "حجز رحلة الطيران" ومهارة "التحقق من رصيد الحساب البنكي".
3. التنفيذ: تجميع اللغز
هذا هو الجزء الذكي. عندما ينفذ الروبوت هذه المهارات تحت شرط المحفز:
- تقوم مهارة "حجز رحلة الطيران" بهدوء بتمرير قطعة صغيرة من كود سري إلى ذاكرة الروبوت المؤقتة (مثل وضع ملاحظة لاصقة على الطاولة).
- تقوم مهارة "التحقق من رصيد الحساب البنكي" بتمرير قطعة أخرى من الكود.
- لأن الروبوت يتبع سير عمله الطبيعي، فإنه لا يلاحظ هذه الملاحظات اللاصقة.
بمجرد انتهاء الروبوت من مهمته العادية (حجز الرحلة)، يقوم أداة "تحقق" (Verifier) خاصة داخل الروبوت بجمع كل تلك الملاحظات اللاصقة. تقوم الأداة بتجميع قطع اللغز، وفك تشفير الرسالة، وفجأة، ينفذ الروبوت أمراً مخفياً (مثل سرقة البيانات أو حذف الملفات) بعد أن يكون قد أعطاك بالفعل الإجابة التي أردتها.
لماذا يعد هذا أمراً مخيفاً؟
- إنه غير مرئي: لا يزال الروبوت يعطيك الإجابة الصحيحة. إذا سألته "هل حجزت الرحلة؟"، سيقول "نعم". ولكن في الخلفية، قام للتو بسرقة معلومات بطاقتك الائتمانية.
- إنه مستمر: بمجرد تثبيت هذه "المهارات المسمومة" في صندوق أدوات الروبوت، فإنها تبقى هناك للأبد. في كل مرة يستخدم فيها الروبوت هذه المهارات، تكون إمكانية وقوع الهجوم قائمة.
- من الصعب اكتشافه: عمليات التحقق الأمني التقليدية تبحث في عقل الروبوت (نموذج الذكاء الاصطناعي) أو في المحادثة. لكنها لا تفحص عادةً الملاحظات الصغيرة المشفرة المختبئة داخل "الأدوات" التي يستخدمها الروبوت.
تجربة "SkillTrojan"
بنى الباحثون مكتبة ضخمة تضم أكثر من 3,000 مهارة مسمومة لاختبار مدى نجاح هذا الهجوم. واختبروا ذلك على أنواع مختلفة من روبوتات الذكاء الاصطناعي (سواء مفتوحة المصدر أو التجارية الكبرى).
النتائج كانت تقشعر لها الأبدان:
- التخفي: أدت الروبوتات مهامها الطبيعية (مثل كتابة كود SQL لقاعدة بيانات) بشكل مثالي تقريباً. لم ينخفض أداؤها "النظيف".
- النجاح: عند استخدام المحفز السري، نجح الهجوم بنسبة 97% من المرات.
الخلاصة
تحذرنا هذه الورقة البحثية من أنه بينما نبني وكلاء ذكاء اصطناعي أكثر ذكاءً يعتمدون على أدوات ومهارات قابلة لإعادة الاستخدام، فإننا نخلق ثغرة أمنية جديدة.
التشبيه:
لقد أمضينا سنوات في إغلاق الباب الأمامي (حماية نموذج الذكاء الاصطناعي) وفحص البريد (تصفية الطلبات/Prompts). لكن SkillTrojan يوضح لنا أنه إذا سمحنا للروبوت باستخدام أدوات من الإنترنت دون فحص داخل تلك الأدوات، يمكن للمهاجم إخفاء قنبلة داخل مطرقة. ستظل المطرقة تدق المسامير بشكل مثالي، ولكن عند قول الكلمة السحرية، ستنفجر المطرقة.
الحل؟
نحن بحاجة للبدء في تدقيق "الوصفات" و"الأدوات" نفسها، وليس فقط عقل الروبوت. نحن بحاجة للتأكد مما إذا كانت الأدوات تفعل ما تدعي فعله، والتأكد من أنها لا تحمل ملاحظات مخفية في جيوبها.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.