← أحدث الأبحاث
💻 computer science

Agent Against Agent: An Agentic System for Automatic Prompt Injection Red Teaming

تقدم الورقة البحثية PIMiner، وهو نظام وكيل (agentic system) يبني مكتبة استراتيجيات قابلة للنقل أثناء التدريب لتحقيق اختبار اختراق للنماذج اللغوية الكبيرة (red-teaming) عبر حقن الأوامر (prompt injection) بفعالية عالية وعدد استعلامات منخفض ضد النماذج المستهدفة غير المرئية، متفوقاً بشكل كبير على الأساليب الحالية القائمة على التعلم التعزيزي.

المؤلفون الأصليون: Yanting Wang, Chenlong Yin, Runpeng Geng, Jinyuan Jia

نُشر 2026-08-06
📖 2 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yanting Wang, Chenlong Yin, Runpeng Geng, Jinyuan Jia

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً آلياً فائق الذكاء يمكنه حجز رحلات طيرانك، وكتابة أكوادك البرمجية، وإدارة حسابك البنكي. إنه يشبه امتلاك جني سحري يقوم بالعمل الفعلي نيابة عنك. لكن هنا تكمن المشكلة: هذا الجني واثق بزيادة في الآخرين. إذا همست بتعليمات سرية داخل بريد إلكتروني مزيف أو رابط موقع مشبوه، فقد يرتبك الروبوت ويعتقد أن هذا هو الأمر الأكثر أهمية للقيام به، متجاهلاً أوامرك الحقيقية. يُسمى هذا "حقن الأوامر" (prompt injection). إنه يشبه تمرير ملاحظة إلى سجل درجات المعلم تقول: "أعطني درجة امتياز"، فيظن المعلم، معتقداً أنها جزء من السجل الرسمي، أنه يجب عليه فعل ذلك حقاً.

وللحفاظ على سلامة هذه الروبوتات، يلعب خبراء الأمن لعبة تسمى "الفريق الأحمر" (red-teaming). فكر في الأمر كأنها لعبة فيديو حيث يحاول لاعب واحد اختراق الروبوت، واللاعب الآخر يحاول إيقافه. الهدف هو العثัง على كل الطرق الماكرة التي يمكن أن تخدع الروبوت قبل أن يفعلها الأشرار. لفترة طويلة، كان أفضل المخترقين (الذين يُطلق عليهم "المهاجمون") مثل الطلاب الذين يتعين عليهم الجلوس والدراسة لآلاف الساعات لحفظ كل خدعة لتجاوز روبوت معين. ولكن إذا استبدلت الروبوت بنموذج مختلف قليلاً، كان على الطالب أن يبدأ الدراسة من الصفر مرة أخرى. لقد كان الأمر بطيئاً، ومكلفاً، ولا يعمل بشكل جيد مع التحديات الجديدة.

هنا يأتي دور PIMiner، وهو نظام جديد وذكي صممه باحثون في جامعة ولاية بنسلفانيا ليكون المحقق النهائي في "الفريق الأحمر". فبدلاً من مجرد حفظ الخدع لروبوت واحد محدد، فإن PIMiner يشبه لصاً ماهراً يحتفظ بـ دفتر ملاحظات ضخم ومنظم لاستراتيجيات السرقات. عندما يواجه روبوتاً جديداً، لا يبدأ من الصفر؛ بل يتصفح دفتر ملاحظاته، ويختار أفضل الخدع التي قد تنجح، ويجربها. إذا نجحت خدعة ما، فإنه يدونها في الدفتر مع ملاحظة حول سبب نجاحها. وإذا فشلت، فإنه يدون سبب فشلها حتى لا يرتكب نفس الخطأ مرتين.

تظهر الورقة البحثية أن نهج "دفتر الملاحظات" هذا يغير قواعد اللعبة. فبينما كانت الأساليب القديمة تتطلب طرح آلاف الأسئلة على الروبوت لتعلم كيفية اختراقه، يمكن لـ PIMiner غالباً معرفة كيفية الاقتحام بـ 10 أسئلة فقط لكل اختبار. وفي اختباراتهم، تمكن PIMiner من خداع روبوتات قوية وجديدة (مثل أحدث إصدارات GPT وClaude) بنسبة نجاح تصل إلى 76.2% في بعض التحديات. يشير هذا إلى أنه من خلال تنظيم التجارب السابقة في مكتبة قابلة لإعادة الاستخدام من الاستراتيجيات، يمكننا العثور على الثغرات الأمنية بشكل أسرع وأرخص من ذي قبل، مما يساعد في بناء مساعدين ذكاء اصطناعي أكثر أماناً للجميع.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →