ملخص تقني: PIMiner – نظام وكيل للحقن التلقائي للمطالبات في عمليات الاختبار الأحمر
بيان المشكلة
تشكل هجمات حقن المطالبات (Prompt Injection) خطراً أمنياً حرجاً على وكلاء النماذج اللغوية الكبيرة (LLM agents)، حيث يقوم المهاجمون بتضمين تعليمات خبيثة في مصادر سياقية غير موثوقة (مثل مخرجات الأدوات أو المستندات المسترجعة) للتلاعب بسلوك الوكيل. ويعد الاختبار الأحمر (Red-teaming) الفعال أمراً ضرورياً لتقييم هذه الثغرات وتوليد بيانات تدريبية للدفاعات.
تندرج طرق الاختبار الأحمر المتطورة الحالية تحت فئتين، كلتاهما تعاني من قيود كبيرة:
- الأساليب القائمة على التعلم المعزز (RL): تقوم أساليب مثل RL-Hammer وPISmith بتدريب نماذج مهاجمة لتوليد هجمات فعالة. ورغم قوتها، إلا أنها تتطلب ميزانيات تفاعل ضخمة (عشرات الآلاف من الاستعلامات) وتنتج نماذج ذات قدرة نقل ضعيفة إلى نماذج لغوية كبيرة جديدة وغير مرئية.
- الأساليب القائمة على البحث: تعمل أساليب مثل TAP وPAIR على تحسين الهجمات لكل عينة بشكل مستقل دون تدريب. ورغم كونها منخفضة التكلفة، إلا أنها تفتقر إلى القدرة على تراكم المعرفة بمرور الوقت، مما يؤدي إلى معدلات نجاح هجوم (ASR) أقل بكثير مقارنة بالأساليب القائمة على التعلم المعزز.
التحدي الجوهري يكمن في سد الفجوة في الأداء بين هذين النموذجين: تحقيق الفعالية العالية للأساليب القائمة على التعلم المعزز دون التكلفة الباهظة وضعف القدرة على النقل، مع تمكين الأساليب القائمة على البحث من تعلم واستعادة معرفة الهجوم.
المنهجية: PIMiner
يقترح المؤلفون PIMiner، وهو نظام وكيل مصمم لتراكم وإعادة استخدام معرفة الهجوم من خلال آلية ذاكرة هرمية. وبخلاف أساليب التعلم المعزز التي تدرب نموذجاً واحداً، يقوم PIMiner ببناء مكتبة استراتيجيات (Strategy Library) من الصفر عبر التفاعل مع سلسلة من أزواج (مجموعة البيانات، النموذج المستهدف).
بنية النظام
يعمل PIMiner من خلال أربعة مكونات رئيسية:
- مكتبة الاستراتيجيات (Strategy Library): ذاكرة طويلة المدى تخزن استراتيجيات الهجوم كملفات Markdown مهيكلة. يحدد كل ملف نطاق الاستراتيجية (النماذج اللغوية المستهدفة، أنواع المهام)، وقوالب الحقن، وأمثلة السياق، وظروف الفشل.
- موجه الاستراتيجية (Strategy Router): وكيل توجيه يقوم، لكل عينة اختبار، باختيار أفضل K من الاستراتيجيات الأكثر صلة من المكتبة بناءً على النموذج المستهدف وسياق المهمة. هذا يمنع تضخم نافذة السياق ويقلل تكاليف الاستدلال.
- وحدة الهجوم التكراري (Iterative Attack Module): وكيل مهاجم يعمل على تحسين المطالبات عبر عدد محدود من التكرارات (على سبيل المثال، Nmax=10). وهو يستخدم ثلاثة مستويات من الذاكرة:
- الذاكرة طويلة المدى: الاستراتيجيات الموجهة من المكتبة.
- ذاكرة داخل مجموعة البيانات (Intra-dataset memory): الخبرات المكثفة من العينات التي تم مهاجمتها سابقاً ضمن نفس زوج (مجموعة البيانات-النموذج).
- الذاكرة داخل العينة (Intra-sample memory): سجل التغذية الراجعة المباشرة للعينة الحالية.
- مهضم الخبرة (Experience Digester): مكون تعلم يقوم بتحليل نتائج عملية هجوم كاملة. ويقوم بتحديث مكتبة الاستراتيجيات من خلال:
- إضافة أمثلة سياقية جديدة إلى الاستراتيجيات الموجودة.
- توسيع نطاق الاستراتيجيات إذا تم اكتشاف أنماط جديدة.
- إنشاء ملفات استراتيجية جديدة للآليات المستحدثة.
- تحسين ظروف الفشل بناءً على الهجمات غير الناجحة.
التدفق التشغيلي
أثناء التدريب، يعالج PIMiner العينات، ويوجهها إلى الاستراتيجيات ذات الصلة، ويقوم بهجمات تكرارية، ثم يهضم النتائج لتحديث المكتبة. وفي وقت الاختبار، يتم نقل المكتبة المتعلمة إلى نماذج لغوية مستهدفة غير مرئم دون تدريب إضافي. يدعم النظام نموذج "التدريب في وقت الاختبار" حيث يمكن للخبرات الجديدة تحديث المكتبة بشكل أكبر.
المساهمات الرئيسية
- نظام اختبار أحمر وكيل (Agentic Red-Teaming System): يُقترح PIMiner كنظام جديد يحول تاريخ الهجوم إلى معرفة هجوم قابلة لإعادة الاستخدام وسهلة القراءة بشرياً، مما يسد بفعالية الفجوة في الأداء بين الاختبار الأحمر القائم على البحث والاختبار الأحمر القائم على التعلم المعزز.
- آلية الذاكرة الهرمية: إن تقديم نظام ذاكرة ثلاثي المستويات (مكتبة الاستراتيجيات، الذاكرة داخل مجموعة البيانات، الذاكرة داخل العينة) يسم يسمح للنظام بتراكم المعرفة عبر مجموعات البيانات والنماذج مع الحفاظ على كفاءة التكلفة.
- قدرة قوية على النقل (Transferability): أظهرت الاستراتيجيات المتعلمة أنها تنتقل بفعالية إلى نماذج لغوية مستهدفة لم يسبق رؤيتها ونماذج مهاجمة مختلفة، مما يلغي الحاجة إلى تدريب مكلف خاص بكل هدف.
- كفاءة التكلفة: يتطلب PIMiner عدداً أقل بكثير من الاستعلامات تجاه الوكلاء المستهدفين (حوالي 10 لكل عينة مثلاً) مقارنة بالأساليب القائمة على التعلم المعزز (التي غالباً ما تتجاوز 10,000)، مما يجعله قابلاً للتطبيق لاختبار النماذج الرائدة والمكلفة.
النتائج التجريبية
قام المؤلفون بتقييم PIMiner على معيارين، IPIArena و AgentDojo، مقابل نماذج رائدة تشمل GPT-5، وGPT-5.1، وClaude-Sonnet-4.5، وGemini-2.5-Pro.
- الأداء: يحقق PIMiner معدلات نجاح هجوم (ASR) عالية. في IPIArena، حقق 76.2% ASR ضد Gemini-2.5-Pro، و61.9% ضد GPT-5.1، و42.9% ضد Claude-Sonnet-4.5. وفي AgentDojo، حقق 86.7% ضد Gemini-2.5-Pro.
- المقارنة مع النماذج المرجعية:
- يتفوق PIMiner بشكل كبير على الهجمات الساكنة والتقليدية القائمة على البحث (مثل TAP وPAIR)، والتي غالباً ما تحقق معدل ASR يقارب الصفر على النماذج القوية.
- يحقق PIMiner أداءً مقارباً لأحدث أساليب التعلم المعزز (مثل PISmith وRL-Hammer) ولكن دون الحاجة إلى تدريب خاص بالهدف. على سبيل المثال، في InjecAgent، طابق PIMiner نسبة ASR البالغة 1.0 لـ RL-Hammer وPISmith.
- بخلاف أساليب التعلم المعزز، تنتقل استراتيجيات PIMiner مباشرة إلى أهداف غير مرئية (مثل تطبيق المعرفة من GPT-5-nano إلى GPT-5.1) دون إعادة تدريب.
- دراسات الاستئصال (Ablation Studies): أدى إزالة إما مكتبة الاستراتيجيات طويلة المدى أو الذاكرة داخل مجموعة البيانات إلى تدهور الأداء بشكل كبير، مما يؤكد الطبيعة التكاملية لمكونات الذاكرة هذه. كما أظهرت النتائج أن موجه الاستراتيجية قلل طول الرموز المدخلة بنسبة 43-61% مع الحفاظ على ASR أو تحسينه.
- النقل عبر النماذج (Cross-Model Transfer): أدت مكتبة الاستراتيجيات التي تعلمها PIMiner (باستخدام نماذج Claude) إلى تحسين أداء خوارزمية PAIR بشكل كبير عند استخدامها مع نماذج مهاجمة متنوعة (Gemini، GPT، DeepSeek)، مما يثبت أن المعرفة الملتقطة مستقلة عن النموذج.
الأهمية والادعاءات
يدعي البحث أن PIMiner يمثل تحولاً في منهجية الاختبار الأحمر من خلال إثبات أن الوكلاء القائمين على البحث يمكنهم تحقيق فعالية بمستوى التعلم المعزز من خلال تراكم المعرفة.
- القابلية للتفسير: تتكون مكتبة الاستراتيجيات الناتجة من ملفات Markdown قابلة للقراءة بشرياً، مما يوفر رؤى حول آليات الهجوم (مثل "بوابة الإجراء المصطنع" أو "دور الدردشة المزيف") والتي تعد مفيدة لتدقيق الأنظمة الوكيلية.
- القابلية للتوسع: من خلال تجنب ميزانيات الحوسبة الضخمة المطلوبة لتدريب التعلم المعزز، يجعل PIMiner الاختبار الأحمر للنماذج الرائدة والمكلفة أمراً ممكناً.
- توليد الدفاعات: توفر الهجمات الناجحة والاستراتيجيات المهيكلة بيانات عالية الجودة لتدريب الحواجز الوقائية وتحسين محاذاة النماذج اللغوية الأساسية.
يؤكد المؤلفون أن عملهم يركز على تقييم المتانة الجوهرية للنماذج اللغوية المحاذية داخلياً بدلاً من آليات الدفاع الخارجية، مما يوفر معياراً صارماً لأمن الوكلاء المستقلين.