ملخص تقني: SkillJack – الأبواب الخلفية للمهارات المستمرة في الوكلاء ذاتيي التطور
بيان المشكلة
تتجه وكلاء النماذج اللغوية الكبيرة (LLM) ذاتيي التطور بشكل متزايد نحو تحويل سجلات التفاعل إلى "مهارات" قابلة لإعادة الاستخدام تستمر لما بعد المهام الفردية. وبينما حددت الأبحاث السابقة مخاطر تسميم الذاكرة والحقن غير المباشر للمطالبات (Prompt Injection) — حيث تنجح الهجمات فقط عند استرجاع السجلات المسمومة كـ "سياق" — تحدد هذه الورقة خطراً أكثر جوهرية وديمومة. يجادل المؤلفون بأنه عندما تقوم "بنية تحويل الخبرة إلى مهارة" (experience-to-skill pipeline) الخاصة بالوكيل بمعالجة سجل خبرة مسموم، فإنها يمكن أن تحول ذلك المدخل العابر إلى أثر سلوكي دائم. وخلافاً لتسميم الذاكرة التقليدي، حيث يؤدي إزالة السجل المصدر إلى القضاء على التهديد، فإن ناقل الهجوم الجديد هذا يسمح للسلوكيات الخبيثة بالبقاء حتى بعد إزالة أصلها، لتصبح مدمجة في مجموعة المهارات القابلة لإعادة الاستخدام الخاصة بالوكيل.
المنهجية
تقدم الورقة إطار عمل SkillJack، الذي يستغل بنية تحويل الخبرة إلى مهارة. وتتم هيكلة المنهجية حول صياغة رسمية للمشكلة واستراتيجية تصميم حمولة محددة.
1. الصياغة الرسمية للمشكلة
يصيغ المؤلفون بنية تحويل الخبرة إلى مهارة كعملية مكونة من أربع مراحل: التحميل (πL)، التحويل (πT)، الاستمرارية (πP)، والتوجيه (πR). هدف المهاجم هو حقن عنصر خبرة مسموم ep بحيث تحقق المهارة الناتجة sp ثلاثة شروط:
- التخفي (Stealth): تتجنب المهارة كاشف السلامة D (D(sp)=benign).
- قابلية التوجيه (Routability): يختار الموجه المهارة للمهمة المستهدفة (sp∈πR(q,S)).
- التنفيذ الخبيث (Malicious Execution): تُطلق المهارة سلوكاً غير مقصود عند التنفيذ (exec(sp,q)∈B).
وتحدد الدراسة ثلاث خصائص أمنية ناشئة عن هذا التركيب:
- تبييض التطهير (Sanitization Whitewashing): عملية التحويل (الضغط، التجريد، التطبيع) تحجب النوايا الخبيثة، مما يقلل معدلات الكشف مقار بالمُدخل الخام.
- الترقية عبر الطبقات (Cross-Layer Promotion): يتم تحويل الخبرات العابرة إلى آثار مستمرة وقابلة لإعادة الاستخدام يمكن اختيارها لمهام مستقبلية دون إعادة قراءة السجل الأصلي.
- عزل الاستمرارية (Persistence Isolation): نظرًا لأن مكتبة المهارات منفصلة عن مستودع الخبرات، فإن حذف السجل المصدر لا يؤدي بالضرورة إلى إزالة المهارة المشتقة.
2. تصميم حمولة مقاومة للتحويل
لتحقيق هذا الهجوم، صمم المؤلفون حمولة مقاومة للتحويل. وهم يفترضون أن أنابيب الاستخراج مُحسّنة لاستخلاص التعليمات المفيدة من مسارات المهام، ومن المرجح أن تحافظ على تسلسلات الإجراءات المؤطرة ضمن سرد منطقي ومشروع أكثر من تلك الموصوفة بلغة عدائية صريحة.
- استراتيجية التأطير (Framing Strategy): بدلاً من استخدام كلمات خبيثة مباشرة، يبني المؤلفون مسارات يكون فيها الإجراء ذو الصلة بالسياسة (مثل استخراج البيانات، أو تصعيد الامتيازات) مدمجاً داخل إطار وظيفي مشروع (مثل "النسخ الاحتياطي"، أو "الأرشفة"، أو "استعادة الخطأ").
- مقاييس التقييم: تقيس الدراسة عائد الاستخراج، وقابلية الكشف (عبر مطابقة الأنماط وحكام النماذج اللغوية)، ونجاح التوجيه عبر المهام اللاحقة.
3. الإعداد التجريبي
تم تقييم الهجوم على نظامين ممثلين:
- SkillX: يستخدم استخلاص المسارات القائم على التخطيط والتوجيه التدريجي الأصيل للنماذج اللغوية.
- Anything2Skill (A2S): يقوم بتجميع الوثائق غير المتجانسة في عقود مهارات مهيكلة.
- مجموعة البيانات: مجموعة مشتركة من 150 مساراً (65 مساراً مسموماً مؤطراً وظيفياً، 65 مساراً خبيثاً مباشراً، 20 مساراً نظيفاً) عبر أربع فئات من مخاطر السياسات (استخراج البيانات، تصعيد الامتيازات، التحويل غير المصرح به، والباب الخلفي المستمر).
- النموذج: تم استخدام DeepSeek-v4-flash لعمليات الاستخراج، والتوجيه، والتحكيم.
النتائج الرئيسية
1. تبييض التطهير (انخفاض قابلية الكشف)
تعمل عملية الاستخراج بشكل كبير على خفض قابلية الكشف عن المحتوى الخبيث.
- SkillX: انخفض كشف الحكم اللغوي (LLM-judge) من 98.5% في المسارات المسمومة الخام إلى 11.4% في المهارات المستخرجة. كما انخفض كشف الأنماط من 44.6% إلى 11.0%.
- Anything2Skill (وضع DOC): انخفض الكشف من 100.0% في المسارات الخام إلى 44.4% في المهارات المستخرجة.
- الآلية: يعود تأثير "التبييض" إلى البيانات الوصفية (Metadata) التي تبدو حميدة (الأسماء والتوثيق) المرفقة بالمهارات المستخرجة. فعند عرض المحتوى البرمجي فقط على الحكم، ارتفدت معدلات الكشف بشكل كبير (على سبيل المثال، من 10.0% إلى 36.7% في SkillX)، مما يشير إلى أن البيانات الوصفية السطحية هي التي تقود عملية التهرب.
2. الترقية عبر الطبقات (التحفيز اللاحق)
تنجح المهارات المستخرجة في التوجيه والتحفيز في المهام المستهدفة.
- SkillX: تم توجيه 56.2% من المهام الموجهة للهجوم إلى مهارة حققت نموذج انتهاك السياسة.
- Anything2Skill: أدى 89.2% من الاستعلامات الموجهة للهجوم إلى تحفيز نموذج انتهاك السياسة.
- الأضرار الجانبية: تم تحفيز المهارات أيضاً في مهام حميدة غير ذات صلة (20.0% في SkillX، ومعدل استرجاع 95.0% في A2S)، مما يشير إلى نطاق ضرر واسع.
3. عزل الاستمرارية (البقاء بعد حذف المصدر)
يستمر الهجوم حتى بعد إزالة السجلات المسمومة الأصلية.
- في تجربة مطابقة المهام، استمرت 80.0% من الهجمات التي تم تحفيزها عبر مسار المهارة في العمل بعد حذف المسارات المصدر. وهذا يثبت أن تطهير الذاكرة لا يزيل الأثر المشتق.
4. حساسية الدفاع
كشفت تجارب الدفاع الأولية عن تحديات في التخفيف:
- المراجعة الثابتة (Static Review): قللت مراجعة السلامة للنماذج اللغوية أثناء الاستخراج من معدلات التحفيز ولكنها لم تكن مثالية.
- المراقبة وقت التشغيل (Runtime Monitoring): كانت المراقبة الواعية بالسلوك (التي تحظر تواقيع إجراءات معينة) فعالة للغاية بمفردها (0.0% تحفيز في عينة SkillX) ولكنها أظهرت هشاشة عند دمجها مع المراجعة الثابتة. أدى تكديس الدفاعات إلى فشل في "تنسيق الدفاع"، حيث غيرت الفلترة في المراحل الأولى توزيع الإجراءات، مما جعل المراقبين في المراحل اللاحقة يخطئون في رصد الأنماط الجديدة.
- خصوصيات A2S: فشلت التواقيع القياسية في A2S بسبب اللغة المعيارية؛ وكان من الضرواة توسيع التواقيع لتشمل المفردات المعيارية لتقليل معدلات التحفيز.
المساهمات الرئيسية
- سطح هجوم جديد: تعد هذه الورقة الأولى التي تحدد وتصيغ تسميم الخبرة إلى مهارة كخطر أمني متميز. وهي تشخص الخصائص الثلاث (تبييض التطهير، الترقية عبر الطبقات، وعزل الاستمرارية) التي تنشأ تحديداً من تركيب تسميم الخبرة مع الاستخراج الآلي للمهارات.
- طريقة هجوم مقاومة للتحويل: يوضح المؤلفون أن تأطير الإجراءات الخبيثة ضمن سرد وظيفي مشروع يسمح لها بالبقاء رغم عمليات التجريد والضغط في أنابيب الاستخراج، بينما يتم تصفية الصياغة الخبيثة الصريحة.
- التحقق التجريبي عبر الأنظمة: تم التحقق من الهجوم على نظامين مستقلين (SkillX وAnything2Skill) باستخدام مجموعة بيانات مشتركة، مما يثبت أن هذا خطر على مستوى النموذج وليس مجرد خلل في تنفيذ واحد.
الأهمية والادعاءات
تدعي الورقة أن تطور المهارات يمثل سطح هجوم جديداً وحرجاً للوكلاء ذاتيي التطور. تكمن الأهمية الأساسية في التحول من تسميم السياق العابر إلى الآثار السلوكية المستمرة.
- فجوة دورة الحياة: يجادل المؤلفون بأن النماذج الأمنية الحالية تفترض أن إزالة السجل المصدر يزيل التهديد. يثبت SkillJack أنه بمجرد تجميع سجل مسموم في مهارة، فإن الهجوم يعيش أطول من مصدره.
- الآثار الدفاعية: تدفع النتائج نحو التحول نحو حماية دورة حياة المهارة القائمة على معرفة المصدر. يجب على المدافعين تتبع المهارات المشتقة وصولاً إلى سجلاتها المصدر، وإلغاء التابعين عند حجر المصادر، وتنفيذ فحوصات واعية بالسلوك عند كل حدود تحويل (التحميل، التحويل، الاستمرارية، التوجيه).
- التواضع: يذكر المؤلفون صراحةً أن نتائجهم تعتمد على تكوين نموذج واحد ونماذج وسيطة على مستوى التوجيه بدلاً من تنفيذ خدمات خارجية حية. كما يصنفون نتائج الدفاع كأولية واستكشافية، مشيرين إلى أن فشل "تنسيق الدفاع" يتطلب مزيداً من الدراسة. يُقدم العمل كتقرير تقني لتحفيز البحث المستقبلي في أمن المصدر ودورة الحياة للوكلاء ذاتيي التطور.