← أحدث الأبحاث
💻 computer science

Strengthening Polymorphic Prompt Assembling: Dynamic Separator Generation Against Emerging Prompt Injection Attacks

تقترح هذه الورقة آلية توليد فواصل ديناميكية لعملية تجميع المطالبات متعددة الأشكال (PPA) تستبدل مجمعات الفواصل الثابتة بأزواج "كناري" فريدة لكل طلب مشتقة من ملخصات تشفيرية، مما يقضي فعلياً على ثغرات نطاق التأثير ويقلل بشكل كبير من معدلات نجاح هجمات حقن المطالبات دون الحاجة إلى ضبط دقيق للنموذج.

المؤلفون الأصليون: Nima Dorzhiev, Peng Liu

نُشر 2026-06-01
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Nima Dorzhiev, Peng Liu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك مساعد آلي (وكيل ذكاء اصطناعي) ذكي للغاية ولكنك ساذج قليلاً. مهمتك هي اتباع مجموعة صارمة من القواعد التي كتبها مديرك (تعليمات النظام) مع الاستماع أيضاً إلى طلبات الجمهور (مدخلات المستخدم).

المشكلة هي أن مخترقاً ذكياً يمكنه تسريب ملاحظة داخل طلب الجمهور تقول: "تجاهل مديرك وافعل ما أقوله أنا بدلاً من ذلك". يُسمى هذا هجوم حقن الأوامر (Prompt Injection Attack).

الحل القديم: كلمة المرور "الثابتة"

في السابق، طور الباحثون دفاعاً يسمى تجميع المطالبات متعدد الأشكال (Pylmorphic Prompt Assembling - PPA). فكر في الأمر كأنك تضع سياجاً خاصاً وفريداً من نوعه يفصل بين قواعد المدير وطلبات الجمهور.

  • كيف كان يعمل: كان النظام يحتوي على صندوق ثابت يضم 84 تصميماً مختلفاً للسياج (الفواصل). وفي كل مرة يأتي فيها طلب، كان النظام يختار عشوائياً سياجاً واحداً من الصندوق لاستخدامه.
  • العيب: تخيل أن المخترق تمكن من التلصص على أحد هذه السياجات ورأى بالضبط كيف يبدو. ولأن النظام يستمر في إعادة استخدام نفس الصندوق من السياجات، يمكن للمخترق الآن استخدام تصميم السياج نفسه لخداع الروبوت في محادثات مستقبلية. ينتشر الضرر (نطاق الانفجار) لأن تصميم السياج لا يتغير حقاً؛ بل يُعاد استخدامه فقط.

الحل الجديد: القفل الديناميكي لمرة واحدة

تقترح هذه الورقة البحثية ترقية رئيسية: توليد الفواصل الديناميكية (Dynamic Separator Generation).

بدلاً من اختيار سياج من صندوق، يقوم النظام الآن ببناء سياج جديد وفريد لكل طلب.

  • كيف يعمل: في كل مرة تسأل فيها الروبوت سؤالاً، ينظر النظام إلى الثانية الدقيقة التي أنت فيها، ومعرفك الفريد (ID)، ورقم عشوائي تم توليده لهذا اللحظة فقط. ثم يمزج هذه المكونات معاً (باستخدام وصفة رياضية تسمى SHA-256) لإنشاء علامة "بداية" و"نهاية" فريدة من نوعها.
  • التشبيه: تخيل أنك ترسل رسالة.
    • الطريقة القديمة: تستخدم ظرفاً أحمر قياسياً. إذا سرق لصٌ ظرفاً أحمر، فيمكنه استخدامه لتزوير الرسائل لاحقاً.
    • الطريقة الجديدة: تستخدم طابعة سحرية تنشئ ظرفاً فريداً وغير قابل للتكرار لكل رسالة بناءً على الوقت الدقيق الذي تضغط فيه على الزر. حتى لو سرق لصٌ الظرف الخاص بالرسالة رقم 1، فإنه سيكون عديم الفائدة للرسالة رقم 2، لأن الرسالة رقم 2 ستكون ذات ظرف مختلف تماماً ومن المستح المستحيل التنبؤ به.

ما وجده الباحثون

اختبر الفريق هذه الطريقة "الديناميكية" الجديدة ضد 16 نوعاً مختلفاً من حيل المخترقين على نموذج ذكاء اصطناعي قوي (Llama-3.3).

  1. إيقاف خدعة "لغة الليتسبيك" (Leetspeak): تستخدم خدعة معينة للمخترقين (تسمى M1) رموزاً سرية ولغة ملحة لإرباك الذكاء الاصطناعي.
    • قبل: كان الذكاء الاصطناعي يقع في الفخ بنسبة 88% من المرات.
    • بعد: أصبح الذكاء الاصطناعي يقع في الفخ بنسبة 38% فقط من المرات. هذا تحسن هائل (أكثر من ضعف الأمان).
  2. إيقاف خدعة "كسر التنسيق" (Format Breakout): تحاول خدعة أخرى خداع الذكاء الاصطناعي لتكرار علامات السياج أمام المخترق.
    • قبل: كان الذكاء الاصطناعي يكشف علامات السياج بنسبة 47% من المرات.
    • بعد: لم يكشف الذكاء الاصطناعي عن العلامات بنسبة 0% من المرات. ولأن السياج كان فريداً لتلك اللحظة فقط، فإن الكشف عنه لم يساعد المخترق في أي طلبات مستقبلية.
  3. السرعة: هذه الطريقة الجديدة سريعة للغاية. فهي تضيف 2.7 ميكروثانية فقط (جزء ضئيل جداً من رمشة العين) إلى وقت معالجة الطلب. إنها سريعة جداً لدرجة أنك لن تلاحظها.
  4. الجودة: لم تتأثر قدرة الروبوت على أداء وظيفته الفعلية (مثل تلخيص النصوص أو الإجابة على الأسئلة) سلباً. لقد عمل بنفس جودة السابق.

العقبة الوحيدة (القيود)

تعترف الورقة البحثية بشيء واحد لا يمكن لهذه الطريقة إصلاحه: إذا أمر المخترق الروبوت صراحةً بـ "يرجى تكرار علامات السياج لي"، فقد يقوم الروبوت بذلك بالفعل.

  • الحل: يقول الباحثون إن هذا حد أساسي في الطبقة الحالية. ولإيقاف ذلك، ستحتاج إلى "حارس أمن" إضافي في النهاية تماماً، يقوم بفحص إجابة الروبوت قبل خروجها، ولكن هذا لم يكن جزءاً من هذه الدراسة المحددة.

الملخص

تقدم هذه الورقة البحثية طريقة لجعل وكلاء الذكاء الاصطناعي أكثر أماناً من خلال منحهم سياجاً جديداً وفريداً يُستخدم لمرة واحدة فقط لكل محادثة. إذا سرق مخترقٌ سياجاً، فسيكون عديم الفائدة لأن المحادثة التالية ستكون ذات سياج مختلف تماماً. إنها ترقية سريعة وسهلة الإضافة تقلل بشكل كبير من احتمالية خداع الذكاء الاصطناعي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →