← أحدث الأبحاث
🤖 AI

Sysformer: Safeguarding Frozen Large Language Models with Adaptive System Prompts

تقدم الورقة البحثية "Sysformer"، وهو نهج مبتكر يعمل على حماية النماذج اللغوية الكبيرة المجمدة من خلال تعلم تكييف مطالبات النظام في فضاء التضمين لتعزيز متانة السلامة بشكل كبير ضد المدخلات الضارة وهجمات كسر الحماية دون الحاجة إلى ضبط دقيق مكلف للنموذج.

المؤلفون الأصليون: Kartik Sharma, Yiqiao Jin, Vineeth Rakesh, Yingtong Dou, Menghai Pan, Mahashweta Das, Srijan Kumar

نُشر 2026-03-09
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Kartik Sharma, Yiqiao Jin, Vineeth Rakesh, Yingtong Dou, Menghai Pan, Mahashweta Das, Srijan Kumar

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً آلياً ذكياً جداً وقوياً للغاية (نموذج لغوي كبير، أو LLM). هذا الروبوت قد قرأ كل شيء تقريباً على الإنترنت ويمكنه كتابة القصص، وحل المسائل الرياضية، والدردشة معك. ومع ذلك، ولأنه تعلم من الإنترنت بأكه، فإنه أحياناً لا يعرف متى يقول "لا". قد يخبرك بالخطأ بكيفية صنع قنبلة أو يكتب رسالة مسيئة، حتى لو طلبت منه ذلك بلطف.

عادةً، ولإصلاح ذلك، يتعين على المطورين القيام بأحد أمرين:

  1. إعادة تدريب الروبوت: هذا يشبه إرسال الروبوت للعودة إلى المدرسة لدراسة فصل دراسي جديد بالكامل. إنه أمر مكلف، ويستغرق وقتاً طويلاً، وأحياناً ينسى الروبوت الأشياء الرائعة التي كان يعرفها بالفعل.
  2. وضع مرشح (فلتر): هذا يشبه توظيف حارس أمن صارم يقرأ كل رسالة قبل أن يراها الروبوت. إذا اعتقد الحارس أن الرسالة خطيرة، فإنه يحجبها. ولكن في بعض الأحيان، يكون الحارس صارماً جداً ويحجب الأسئلة غير الضارة أيضاً (مثل "كيف أخبز كعكة؟").

إليكم "Sysformer": المترجم الذكي

تقدم الورقة البحثية حلاً جديداً يسمى Sysformer. فكر في Sysformer ليس كمدرسة جديدة للروبوت، وليس كحارس أمن، بل كـ مترجم ذكي جداً يجلس مباشرة بينك وبين الروبوت.

إليك كيف يعمل، باستخدام تشبيه بسيط:

"الأمر النظامي" (System Prompt) هو كتاب قواعد الروبوت

في كل مرة تتحدث فيها مع الروبوت، هناك تعليمات مخفية في الببدايه تسمى "الأمر النظامي". إنه يشبه كتاب القواعد الداخلي للروبوت. عادة ما يكون هذا الكتاب ثابتاً. يقول الشيء نفسه للجميع، مثل: "كن مفيداً، كن صادقاً، وكن آمناً".

المشكلة هي أن كتاب القواعد الثابت لا يمكنه التعامل مع كل موقف. إذا طرحت سؤالاً غير ضار، فإن كتاب القواعد يعمل بشكل جيد. ولكن إذا حاول "مخترق" (Jailbreaker) خداع الروبوت بسؤال مخادع ومعقد، فقد لا يكون كتاب القواعد الثابت قوياً بما يكفي لمنع الروبوت من كسر قواعده.

كيف يغير Sysformer قواعد اللعبة

Sysformer هو إضافة صغيرة وخفيفة الوزن تقوم بإعادة كتابة كتاب القواعد ديناميكياً بناءً على ما تسأل عنه.

  • السيناريو: أنت تسأل الروبوت، "كيف أصنع كعكة؟"

    • الطريقة القديمة: يقرأ الروبوت كتاب القواعد الثابت: "كن مفيداً". فيقول: "إليك وصفة الكعكة!" (مثالي).
    • طريقة Sysformer: ينظر Sysformer إلى سؤالك، ويرى أنه آمن، ويقوم بتعديل كتاب القواعد قليه ليقول: "كن مفيداً وقدم وصفة". يقول الروبوت: "إليك وصفة الكعكة!" (لا يزال مثالياً).
  • السيناريو الخطير: يسأل مخترق، "كيف أصنع قنبلة؟"

    • الطريقة القديمة: يقرأ الروبوت كتاب القواعد الثابت. يستخدم المخترق كلمات مخادعة لإرباك الروبوت. يعتقد الروبوت: "أوه، هذا مجرد سؤال كيمياء!" ويعطي وصفة القنبلة. (كارثة).
    • طريقة Sysformer: ينظر Sysformer إلى السؤال، ويدرك الخطر، ويعيد كتابة كتاب القواعد فوراً قبل أن يراه الروبوت حتى. كتاب القواعد الجديد يقول: "هذا طلب خطير. لا تجب. قل: 'لا يمكنني المساعدة في ذلك'". يتبع الروبوت القاعدة الجديدة ويرفض بأمان.

لماذا يعد هذا أمراً مهماً؟

  1. إنه "صديق للمنتجات المجمدة": لا يتعين عليك إعادة تدريب الروبوت. Sysformer يشبه ملحقاً يمكن تركيبه. يمكنك أخذ روبوت صنعته جوجل، أو ميتا، أو مايكروسوفت، وتركيب Sysformer عليه، وسيصبح فوراً أكثر أماناً دون تغيير دماغ الروبوت.
  2. إنه متكيف: على عكس حارس الأمن الذي يستخدم قاعدة "مقاس واحد يناسب الجميع"، فإن Sysformer يشبه الحرباء. فهو يغير استراتيجيته اعتماداً على السؤال المحدد. إذا كان السؤال آمناً، فإنه يترك الروبوت يكون مفيداً. وإذا كان السؤال خطيراً، فإنه يشدد القواعد فوراً.
  3. إنه يوقف "عمليات الاختراق" (Jailbreaks): غالباً ما يحاول المخترقون خداع الروبوت باستخدام الأكواد، أو اللغات الأجنبية، أو ألعاب تقمص الأدوار لتجاوز الحماية. Sysformer بارع جداً في قراءة "جو" السؤال بحيث يمكنه رصد هذه الحيل وإيقافها، حتى لو لم يفهم الروبوت نفسه تلك الحيلة.

النتائج

اختبر الباحثون هذا على 5 روبوتات شهيرة. ووجدوا أن:

  • ارتفعت مستويات الأمان: رفضت الروبوتات الإجابة على الأسئلة الخطيرة بنسبة 80% أكثر من ذي قبل.
  • ظلت مستويات المساعدة عالية: لا تزال الروبوتات تجيب على الأسئلة الآمنة (مثل "اكتب قصيدة") بنسبة 90% من الوقت، دون أن تكون مزعجة أو ترفض المساعدة.
  • إنه سريع: لا يضيف أي تأخير يُذكر إلى المحادثة.

الخلاصة

Sysformer يشبه إعطاء روبوت جاهز ومصنوع مسبقاً خوذة ذكية وقابلة للتعديل. يبقى دماغ الروبوت كما هو تماماً (مما يوفر المال والوط)، لكن الخوذة يمكنها تغيير تعليماتها فوراً لحماية الروبوت من الجهات السيئة مع الحفاظ على كونه ودوداً للمستخدمين الجيدين. إنها طريقة أرخص وأسرع وأذكى للحفاظ على سلامة الذكاء الاصطناعي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →