Formal Analysis and Supply Chain Security for Agentic AI Skills
تقدم هذه الورقة SkillFortify، وهو أول إطار عمل للتحليل الرسمي لسلاسل توريد مهارات الذكاء الاصطناعي الوكيل، والذي يجمع بين نموذج مهاجم مبتكر، وتحليل استاتيكي سليم، وعزل قائم على القدرات لتحقيق دقة بنسبة 100% وانعدام في الإيجابيات الكاذبة في اكتشاف المهارات الخبيثة، معالجةً بذلك الفجوات الأمنية الحرجة التي تركتها الأدوات الاستدلالية الحالية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تقوم ببناء مساعد روبوت عالي التقنية. هذا الروبوت ذكي للغاية، ولكن لأداء مهام محددة مثل "حجز رحلة طيران" أو "تحليل كشوف حساباتي البنكية"، ستحتاج إلى تحميل إضافات برمجية صغيرة تسمى "المهارات" (Skills).
فكر في هذه المهارات مثل التطبيقات على هاتفك، ولكن مع فرق مرعب: عندما تثبت تطبيقاً عادياً، فإنه عادةً ما يبقى داخل "صندوق رملي" (sandbox) خاص به. أما عندما تثبت "مهارة ذكاء اصطناعي"، فأنت في الواقع تسلم ذلك الجزء من الكود مفاتيح منزلك بالكامل، وحسابك البنكي، ومذكراتك، ثم تقول للروبوت: "تفضل، استخدم هذا لمساعدتي".
المشكلة: "الغرب المتوحش" لتطبيقات الذكاء الاصطناعي
يصف البحث أزمة حدثت في أوائل عام 2026. نظرًا لأن الجميع كانوا يتسابقون لبناء هذه الروبوتات، بدأوا في تحميل "المهارات" من أسواق مفتوحة دون التحقق مما إذا كانت آمنة.
- الهجوم: أدرك المخترقون ذلك، فأنشأوا حملة ضخمة تسمى "ClawHavoc" حيث قاموا برفع أكثر من 1,200 مهارة مزيفة وخبيثة. لم تكن هذه مجرد أخطاء برمجية، بل كانت لصوصاً رقميين مصممين لسرقة كلمات المرور والأسرار.
- فشل الدفاعات الحالية: حاول قطاع الأمن معالجة الأمر باستخدام أدوات "استدلالية" (heuristic). تخيل حارس أمن يبحث فقط عن الأشخاص الذين يرتدون قبعات حمراء (نمط معروف سيئ). إذا ارتدى لص قبعة زرقاء، سيسمح له الحارس بالدخول. يشير البحث إلى أن الأدوات الحالية تشبه هذا الحارس: يمكنها فقط كشف ما رأته من قبل. لا يمكنها إثبات أن الأداة آمنة، بل يمكنها فقط القول: "لم أرَ قبعة حمراء".
الحل: SkillFortify (الحارس الشخصي الرياضي)
قام المؤلفون ببناء أداة جديدة تسمى SkillFortify. بدلاً من مجرد البحث عن القبعات الحمراء، يعمل Skillfortify كـ حارس شخصي رياضي يثبت، بيقين بنسبة 100%، أن المهارة لا يمكنها القيام بأي شيء غير مسموح لها به صراحةً.
إليك كيف يعمل، باستخدام تشبيهات بسيطة:
1. المهاجم "DY-Skill" (اللص المثالي)
لاختبار أمنهم، اخترع المؤلفون "لصاً مثالياً" نظرياً (بناءً على نموذج رياضي شهير يسمى Dolev-Yao). هذا اللص يمكنه اعتراض الرسائل، وتزوير رسائل جديدة، وخداع النظام.
- التشبيه: تخيل اختبار خزنة بنك من خلال استئجار أذكى وأكثر لصوص العالم إبداعاً. إذا استطاعت خزنتك إيقاف هذا اللص تحديداً، فأنت تعلم أنها ستوقف أي شخص آخر أيضاً. SkillFortify يثبت أنه مهما كان المخترق بارعاً، فلا يمكنه كسر القواعد.
2. "شبكة القدرات" (نظام بطاقة الهوية)
كل مهارة يجب أن ترتدي بطاقة هوية تسرد بالضبط ما يمكنها فعله.
- التشبيه: تخيل فندقاً.
- بطاقة خدمة الغرف تسمح لك بدخول الغرف للتنظيف (قراءة/كتابة الملفات).
- بطاقة الضيف تسمح لك بدخول الردهة (قراءة البيانات).
- بطاقة المدير تسمح لك بفصل الموظفين (الإدارة).
- القاعدة: إذا ادعت مهارة ما أنها تحمل بطاقة "خدمة غرف"، لكن الكود الخاص بها يحاول فتح "مكتب المدير"، فإن SkillFortify يوقفها فوراً. إنه يثبت رياضياً أن المهارة لا يمكنها الوصول إلى مكتب المدير، حتى لو حاولت المهارة خداع النظام.
3. "رسم بياني للتبعية" (شجرة العائلة للثقة)
غالباً ما تعتمد مهارات الذكاء الاصطناعي على مهارات أخرى لتعمل (على سبيل المثال، مهارة "وكيل السفر" تحتاج إلى مهارة "الطقس").
- التشبيه: تخيل أنك توظف مقاولاً. أنت تتحقق من رخصته. ولكن ماذا لو قام بتوظيف مقاول فرعي هو مجرم؟
- يقوم SkillFortify ببناء شجرة عائلة لكل قطعة كود متضمنة.
- يستخدم برنامج حل رياضي قوي (SAT) لفحص الشجرة بأكملة في وقت واحد. يسأل: "إذا قمت بتثبيت هذه العائلة بأكملها، هل لدى أي شخص في شجرة العائلة سجل إجرامي؟" إذا كانت الإجابة نعم، فإنه يحظر التثبيت بالكامل.
4. "درجة الثقة" (نظام السمعة)
ليست كل المهارات متساوية. بعضها جديد وغير معروف؛ وبعضها قديم وموثوق.
- التشبيه: فكر في درجة ائتمانية للكود.
- هل وقع المؤلف اسمه؟ (المصدر/المنشأ)
- هل تم استخدامها من قبل آلاف الأشخاص دون مشاكل؟ (المجتمع)
- هل اجتاز الاختبار الرياضي؟ (السلوك)
- التحول: إذا لم يتم تحديث مهارة ما لمدة عام، فإن درجة ثقتها تبدأ في التحلل (الانخفاض)، تماماً مثل الفاكهة التي تتعفن على الرف. هذا يجبر المطورين على إبقاء مهاراتهم حديثة وآمنة.
النتائج: لماذا هذا مهم؟
اختبر المؤلفون أداتهم على 540 مهارة مختلفة (نصفها جيد ونصفها خبيث).
- النتيجة: لقد كشفت عن 97% من المهارات السيئة.
- السحر: لم تسجل 0% من الأخطاء الإيجابية. لم تتهم أبداً مهارة جيدة بأنها سيئة.
- السرعة: فحصت 1,000 مهارة في أقل من عُشر ثانية.
الصورة الكبيرة
يجادل البحث بأنه لا يمكننا معاملة مهارات الذكاء الاصطناعي كالتطبيقات العادية. نظرًا لأن هذه المهارات لديها القدرة على التصرف نيابة عنا بصلاحيات عالية، فنحن بحاجة إلى ضمانات رياضية، وليس مجرد "تخمينات".
SkillFortify هو أول أداة تقول: "أنا لا أعتقد فقط أنها آمنة؛ بل لدي دليل رياضي على أنه من المستحيل أن يؤذيك هذا الكود." إنها تحول العالم الفوضوي والمحفوف بالمخاطر لإضافات الذكاء الاصطناعي إلى بيئة آمنة ومنظمة حيث يمكننا أخيراً الوثوق بمساعدينا الرقميين.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.