← أحدث الأبحاث
🤖 AI

The System Prompt Is the Attack Surface: How LLM Agent Configuration Shapes Security and Creates Exploitable Vulnerabilities

تُظهر هذه الورقة أن أمن وكلاء النماذج اللغوية الكبيرة يعتمد بشكل حاسم على تهيئة الأوامر النظامية، حيث تكشف أنه في حين يمكن لأوامر محددة تحقيق معدلات عالية في كشف التصيد الاحتيالي، إلا أنها غالبًا ما تخلق ثغرات هشة تجاه عكس الإشارات العدائية، مما يستلزم توازنًا بين دقة الكشف، وسهولة الاستخدام، والمتانة من خلال مقاييس مثل "Safetility" وتعزيز الأدوات الخارجية.

المؤلفون الأصليون: Ron Litvak

نُشر 2026-03-27
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Ron Litvak

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك وظفت خادماً رقمياً فائق الذكاء والسرعة لإدارة بريدك الإلكتروني. هذا الخادم يقرأ كل رسالة واردة، ويقرر ما إذا كان من الآمن فتحها، وإذا بدا خطيراً (مثل رسائل التصيد الاحتيالي)، فإنه يحجبها. وإذا بدا آمناً، فإنه يسمح بمروره.

أنت تريد لهذا الخادم أن يكون مثالياً: ألا يسمح أبداً بمرور عملية احتيال، ولكن لا يحجب بالخطأ رسالة حقيقية من مديرك أو من مصرفك.

هذه الورقة البحثية، بعنوان "المطالبة بالنظام هي سطح الهجوم" (The System Prompt Is the Attack Surface)، تشبه اختبار جهد هائل لـ 11 خادماً مختلفاً (نماذج ذكاء اصطناعي) و10 مجموعات مختلفة من التعليمات (المطالبات/Prompts) التي يمكنك إعطاؤها لهم. وقد وجد الباحثون حقائق صادمة ومناقضة للبديهة حول كيفية عمل هؤلاء الخادمين الرقميين.

إليك القصة بكلمات بسيية:

1. "الشخصية" تهم أكثر من "الدماغ"

قد تعتقد أن أهم شيء هو أي خادم توظف (على سبيل المثال، أذكى ذكاء اصطناعي أم أرخصهم).
النتيجة: الأمر لا يهم بقدر ما تعتقد. ما يهم هو كيف تتحدث إليهم.

  • التشبيه: تخيل أن لديك كلب حراسة.
    • إذا قلت للكلب: "كن حذراً للغاية، وانبح على كل ورقة شجر تتحرك"، فسوف يمسك بكل لص، ولكنه سينبح أيضاً على ساعي البريد، والرياح، وعائلتك. سيكون مزعجاً وغير مفيد.
    • إذا قلت للكلب: "كن فعالاً، ولا تنبح إلا إذا رأيت ذئباً"، فقد يفوت ذئباً مختبئاً في الشجيرات.
    • الصدمة: وجد الباحثون أن نفس نموذج الذكاء الاصطناعي يمكن أن يكون بطلاً (يحجب 99% من عمليات الاحتيال) أو كارثة (يمرر 97% من عمليات الاحتيال) بمجرد تغيير كلمات قليلة في تعليماته. "الشخصية" التي تبرمجها في الذكاء الاصطناعي هي أقوى أداة أمنية تملكها.

2. "الخدعة السحرية" التي ارتدت عليها سلباً

لجعل الخادمين أفضل، جرب الباحثون خدعة ذكية. لاحظ أن معظم المحتالين يرسلون بريداً إلكترونياً من john@gmail.com ولكنهم يضعون رابطاً لموقع مزيف مثل evil-site.com.

  • الاستراتيجية: أخبروا الخادمين: "إذا تطابق اسم المرسل مع رابط الموقع، فهو آمن. إذا لم يتطابقا، فهي عملية احتيال."
  • النتيجة: نجح هذا بشكل مذهل! لقد كشفوا جميع عمليات الاحتيال القياسية تقريباً ومنعوا حجب الرسائل الحقيقية. كان الأمر كما لو أنك أعطيت الخادم عدسة مكبرة سحرية.

3. "كود الغش" الخاص بالشرير (انعكاس الإشارة)

ولكن بعد ذلك، سأل الباحثون: ماذا لو تعلم الأشرار هذه الخدعة؟

  • الهجوم: أدرك المحتالون القاعدة. لذا، قاموا بتسجيل نطاق (Domain) مزيف باسم evil-site.com. وأرسلوا البريد من john@evil-site.com ووضعوا رابطاً لـ evil-site.com.
  • الانهيار: ولأن المرسل والرابط تطابقا، اعتقد الخادمان: "آها! القاعدة تقول إن هذا آمن!" وسمحوا بمرور عملية الاحتيال.
  • الدرس: من خلال تعليم الخادمين البحث عن علامة واحدة "آمنة"، فقد أعطيتهم دون قصد "كود غش". كلما كانت قاعدتك محددة، سهل على المهاجم الذكي تزييفها.

4. "الطالب المطيع" مقابل "المفرط في التفكير"

هذا هو الجزء الأكثر إرباكاً: أحياناً، يكون كونه مطيعاً جداً أمراً خطيراً.

  • الطالب المطيع (مثل GPT-4o-mini): هذا الذكاء الاصطناعي يتبع التعليمات بدقة. إذا قلت له "تحقق مما إذا كانت الأسماء متطابقة"، فإنه يتحقق من ذلك فقط. إذا تطابقت الأسماء، فإنه يتوقف عن التفكير. يتم خداعه بسه l من قبل محتالي "كود الغش".
  • المفرط في التفكير (مثل Claude Haiku): هذا الذكاء الاصطناعي مرتاب بطبيعته. حتى لو قلت له "تحقق مما إذا كانت الأسماء متطابقة"، فإنه يفكر: "مهلاً، يبدو أن هناك شيئاً غريباً في نبرة هذا البريد الإلكتروني". إنه يتجاهل قاعدتك المحددة ويستخدم "شعوره الداخلي".
    • التحول: "المطيع" رائع في كشف عمليات الاحتيال العادية ولكنه سيء جداً ضد محتالي "كود الغش". أما "المفرط في التفكير" فهو أصعب في الخداع بواسطة "كود الغش"، لكنه غالباً ما يحجب رسائل حقيقية لأنه شديد الشك.

5. درجة "الأمان والفاعلية" (Safetility)

ابتكر الباحثون درجة جديدة تسمى Safetility.

  • التشبيه: تخيل حارس أمن يوقف 100% من اللصوص، ولكنه يوقف أيضاً 90% من الأشخاص الذين يحاولون دخول العمل. هذا الحارس تقنياً "جيد في إيقاف اللصوص"، ولكن المكتب أصبح الآن فارغاً وغير مفيد.
  • الدرجة: تقيس الـ Safetility مدى قدرة الحارس على إيقاف اللصوص دون إيقاف موظفي المكتب. وجدوا أن معظم الإعدادات "المثالية" كانت في الواقع عديمة الفائدة لأنها حجزت الكثير من الرسائل الحقيقية.

6. الحكم النهائي: لا يمكنك القيام بذلك بمفردك

تختتم الورقة بحقيقة قاسية: لا يمكنك إصلاح هذا بمجرد الكلمات.

  • المشكلة: الخادم الذكي يشبه شخصاً يقرأ رسالة. لا يمكنه رؤية التاريخ الحقيقي لموقع إلكتروني أو معرفة ما إذا كان النطاق قد تم تسجيله بالأمس مقابل 10 دولارات فقط. هو يرى النص فقط.
  • الحل: لإيقاف محتالي "كود الغش"، يحتاج الخادم إلى أدوات. يحتاج لأن يكون قادراً على البحث عن عمر الموقع، أو التحقق من قائمة سوداء، أو طلب المساعدة من إنسان.
  • الخلاصة: أفضل أمن ليس مجرد كتابة دليل تعليمات أفضل. بل يتعلق الأمر بإعطاء الذكاء الاصطناعي "صندوق أدوات" (مثل فاحص النطاقات) حتى يتمكن من التحقق من الحقيقة، بدلاً من مجرد التخمين بناءً على قاعدة واحدة.

ملخص للمستخدم العادي

إذا كنت تبني مساعد بريد إلكتروني يعمل بالذكاء الاصطناعي:

  1. لا تكتفِ باختيار النموذج "الأذكى". اختر النموذج الذي يتبع التعليمات بدقة ولكن ليس بشكل أعمى.
  2. لا تعطه قاعدة واحدة بسيطة (مثل "تطابق الأسماء"). سيقوم المحتالون بتزييف تلك القاعدة.
  3. لا تعتمد على الذكاء الاصطناعي وحده. إذا كنت تريد إيقاف المحتالين المتطورين، يجب عليك ربط الذكاء الاصطناعي ببيانات من العالم الحقيقي (مثل التحقق مما إذا كان الموقع جديداً أو مزيفاً).
  4. احذر من "الكفاءة". إذا قلت للذكاء الاصطناعي أن يكون "فعالاً" و"سريعاً"، فقد يمرر عمليات احتيال. وإذا قلت له أن يكون "حذراً"، فقد يحجب رسائل مديرك. عليك أن تجد النقطة المثالية.

الرسالة الرئيسية للورقة هي أن التعليمات التي تعطيها للذكاء الاصطناست هي الحلقة الأضعف. إذا كتبت قاعدة بسيطة للغاية، فسيجد المخترق طريقة لكسرها. الأمن لا يتعلق فقط بعقل الذكاء الاصطناعي؛ بل يتعلق بكيفية التحدث إليه وما هي الأدوات التي تمنحها له لتدعيم كلماته.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →