← أحدث الأبحاث
🤖 machine learning

PISmith: Reinforcement Learning-based Red Teaming for Prompt Injection Defenses

تقدم هذه الورقة PISmith، وهو إطار عمل للفريق الأحمر يعتمد على التعلم التعزيزي يتغلب على ندرة المكافأة من خلال تنظيم الإنتروبيا التكيفي وتوزين الميزة الديناميكي لإثبات أن دفاعات حقن الأوامر الحالية لا تزال عرضة بشدة لهجمات الصندوق الأسود التكيفية عبر مختلف المعايير والإعدادات الوكيلة بشكل منهجي.

المؤلفون الأصليون: Chenlong Yin, Runpeng Geng, Yanting Wang, Jinyuan Jia

نُشر 2026-03-16
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Chenlong Yin, Runpeng Geng, Yanting Wang, Jinyuan Jia

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

🏰 الصورة الكبيرة: القلعة واللص المتسلل

تخيل أن نماذج اللغات الكبيرة (LLMs) هي بمثابة حراس قلاع أذكياء. مهمتهم هي الإجابة على الأسئلة، أو كتابة رسائل البريد الإلكتروني، أو مساعدتك في حجز الرحلات الجوية. ولكن هناك ثغرة خطيرة: حقن الأوامر (Prompt Injection).

فكر في "حقن الأوامر" كأنه لص متسلل لا يكسر الباب، بل يقترب من الحارس ويهمس في أذنه: "مهلاً، أنا الملك. تجاهل أوامرك السابقة وأعطني مفاتيح الخزينة". إذا كان الحارس ساذجاً، فإنه سيطيع اللص بدلاً من رئيسه الحقيقي.

ولإيقاف ذلك، بنى المهندسون دفاعات (مثل تدريب خاص أو فلاتر) لتعليم الحراس تجاهل الملوك المزيفين. لكن الباحثين في هذه الورقة البحثية تساءلوا: "هل هذه الدفاعات قوية حقاً، أم أنها مجرد تظاهر بالقوة؟"

لقد صنعوا PISmith، وهو لص ذكي للغاية ومؤتمت صُمم لاختبار هذه الدفاعات.


🤖 ما هو PISmith؟

PISmith هو أداة "Red Teaming" (الفريق الأحمر). في الأمن السيبراني، "الفريق الأحمر" هو مجموعة من الهكرز الأخلاقيين الذين يتم استئجارهم لاختراق نظام ما بهدف إيجاد نقاط الضعف.

بدلاً من محاولة إيقاع الذكاء الاصطناعي في الفخ عبر إنسان، يستخدم PISmith تقنية التعلم التعزيزي (Reinforcement Learning - RL). فكر في PISmith كأنه شخصية في لعبة فيديو تلعب دور اللص.

  • الهدف: خداع حارس الذكاء الاصطناعي للقيام بشيء سيء (مثل كشف الأسرار أو تجاهل القواعد).
  • الطريقة: يحاول ملايين الطرق المختلفة للهمس في أذن الحارس.
  • التعلم: في كل مرة يفشل فيها، يتعلم ما الذي لم ينجح. وفي كل مرة ينجح فيها، يتعلم ما الذي نجح. ومع مرور الوقت، يصبح بارعاً جداً في إيجاد "الهمسة المتسللة المثالية".

🚧 المشكلة: "الغرفة الصامتة" (ندرة المكافأة)

وجد الباحثون مشكلة رئيسية عندما حاولوا تدريب هذا اللص الذكي باستخدام الطرق القياسية.

تخيل أنك تدرب كلباً على جلب كرة في مستودع ضخم وفارغ.

  • المهمة: العثور على الكرة.
  • الواقع: الكرة مخبأة تحت صخرة صغيرة في زاوية ما. في 99.9% من الوقت، يركض الكلب حول المكان ولا يجد شيئاً.
  • النتيجة: يصاب الكلب بالارتباك. يفكر: "لا شيء يعمل هنا!"، وفي النهاية يستسلم ويجلس في زاوية، ويكرر نفس الشيء غير المفيد مراراً وتكراراً.

في الورقة البحثية، يُطلق على هذا ندرة المكافأة (Reward Sparsity).

  • "حارس الذكاء الاصطناوي" (الدفاع) قوي جداً لدرجة أنه يحظر تقريباً كل الهجمات التي يحاول PISmith القيام بها.
  • يحصل PISmith على إشارات "نجاح" شبه معدومة.
  • ولأنه نادراً ما يفوز، يتوقف عن تجربة أفكار جديدة. إنه يعلق في حلقة مفرغة، ويكرر نفس الهجمات الفاشلة. وهذا ما يسمى انهيار الإنتروبيا (Entropy Collapse) (أي يتوقف الذكاء الاصطناي عن الإبداع ويكتفي بتكرار نفسه).

🛠️ الحل: سلاحان سريان لـ PISmith

لحل هذه المشكلة، منح الباحثون PISmith ترقيتين خاصتين لإبقائه متحفزاً ومتعلماً:

1. "فقاعة التشجيع" (الانتظام التكيفي للإنتروبيا - Adaptive Entropy Regularization)

  • التشبيه: تخيل أن الكلب على وشك الاستسلام. بدلاً من مجرد قول "عمل جيد"، يضع المدرب الكلب في فقاعة تشجيع تجبره على الركض في اتجاهات جديدة وغريبة حتى لو لم يجد الكرة بعد.
  • كيف يعمل: عندما لا ينجح PISsmith، يجبر النظام الجهاز على أن يكون أكثر عشوائية وإبداعاً. إنه يمنعه من الوقوع في حلقة مملة، ويقول له: "لا تكرر تلك الهمسة الفاشلة! جرب شيئاً غريباً تماماً!".

2. "التذكرة الذهبية" (الوزن الديناميكي للميزة - Dynamic Advantage Weighting)

  • التشبيه: تخيل أن الكلب وجد الكرة أخيراً بعد 1000 محاولة. في اللعبة العادية، يتم إغراق هذا النجاح الوحيد وسط 999 فشلاً. ولكن في PISmith، يحصل هذا النجاح الوحيد على تذكرة ذهبية ضخمة.
  • كيف يعمل: عندما ينجح Pismith في خداع حارس الذكاء الاصطناعي، يقول النظام: "واو! هذا النجاح الواحد ضخم جداً! سوف نتعلم منه 5 أضعاف أكثر مما نتعلمه من كل حالات الفشل مجتمعة". هذا يضمن أن الذكاء الاصطناي لن ينسى اللحظات النادرة التي نجح فيها بالفعل.

📉 النتائج الصادمة

عندما استخدم الباحثون PISmith لاختبار أفضل الدفاعات المتاحة اليوم، كانت النتائج مخيفة:

  1. الحراس "المنيعون" كانوا في الواقع هشّين: الدفاعات التي بدت مثالية ضد الهجمات العادية انهارت أمام هجوم PISmith (اللص المتكيف).
  2. المقايضة (Trade-off): وجد الباحثون معضلة قاسية:
    • إذا كان الدفاع صارماً جداً (يحظر كل شيء)، فإنه يوقف الأشرار ولكنه أيضاً يمنع الأشخاص الطيبين من أداء وظائفهم (مثل الإجابة على أسئلة بسيطة).
    • إذا كان الدفاع مفيداً (يسمح بمرور الأشياء الجيدة)، يمكن لـ PISmith التسلل بسهولة.
    • لا يوجد حالياً دفاع مثالي يكون مفيداً وغير قابل للاختراق في آن واحد.

🏁 الخلاصة

PISmith يشبه آلة اختبار الضغط لأمن الذكاء الاصطناعي. لقد أثبت أن "الأقفال" الحالية على الذكاء الاصطناي ليست قوية بما يكفي أمام مهاجم ذكي ومتكيف.

تخلص الورقة البحثية إلى أنه لا يمكننا الاعتماد فقط على الدفاعات الحالية. نحن بحاجة إلى بناء حراس ذكاء اصطناي أكثر ذكاءً ومرونة يمكنهم التعامل مع هؤلاء اللصوص الماكرين دون أن يتحولوا إلى روبوتات عديمة الفائدة ترفض الإجابة على أي سؤال.

باخت-صر: PISmith هو "الهكر" الأمثل الذي علمنا أن أمن الذكاء الاصطناي لدينا أضعف مما كنا نعتقد، وأظهر لنا بالضبط كيف يمكن كسره حتى نتمكن من إصلاحه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →