← أحدث الأبحاث
💬 NLP

A Lightweight Explainable Guardrail for Prompt Safety

تقدم هذه المساهمة LEG، وهو حاجز حماية خفيف الوزن وقابل للتفسير يستفيد من التعلم متعدد المهام، والبيانات الاصطناعية المخففة للتحيز، ودالة فقدان مبتكرة مرجحة بعدم اليقين لتحقيق أداء رائد في تصنيف سلامة المطالبات وتفسيرها مع حجم نموذج أصغر بكثير.

المؤلفون الأصليون: Md Asiful Islam, Mihai Surdeanu

نُشر 2026-04-28
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Md Asiful Islam, Mihai Surdeanu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً آلياً ذكياً ومبدعاً للغاية (نموذج لغوي كبير، أو LLM)، يمكنه كتابة القصص، وحل المسائل الرياضية، والدردشة معك. ومع ذلك، مثل أي أداة قوية، قد يغويه أحياناً قول شيء خطير، مثل تعليمات لصنع قنبلة أو نشر الكراهية.

ولمنع ذلك، نضع عادةً "مسؤول أمن" أمام الروبوت. إذا طرح شخص ما سؤالاً خبيثاً، يقوم الحارس بإيقافه قبل أن يسمعه الروبوت حتى.

المشكلة في مسؤولي الأمن الحاليين هي أنهم:

  1. مرهقون وبطيئون جداً: يشبهون الدبابات الضخمة التي تتدحرج ببطء وتستغرق وقتاً طويلاً لفحص كل سؤال.
  2. صامتون: يقولون "لا"، لكنهم لا يستطيعون شرح لماذا قالوا لا. الأمر يشبه حارساً يطردك من الملهى دون إخبارك بأي قاعدة انتهكتها.

يقدم هذا العمل نوعاً جديداً من الحراس يسمى LEG (الحاجز الواقي الخفيف والقابل للتفسير). تخيل LEG كـ محلل أمني سريع البديهة وحاد البصر، صغير بما يكفي ليوضع في جيبك، ولكنه ذكي بما يكفي لرصد المشاكل وشرح ما حدث بالضبط.

إليك كيف يعمل LEG، مقسماً إلى أجزاء بسيطة:

1. المحقق ثنائي المهام (التعلم متعدد المهام)

معظم مسؤولي الأمن لديهم وظيفة واحدة فقط: تحديد ما إذا كان السؤال "آمناً" أم "غير آمن". أما LEG فلديه وظيفتان في آن واحد:

  • الوظيفة (أ): تحديد ما إذا كان السؤال آمناً.
  • الوظيفة (ب): الإشارة إلى الكلمات المحددة في السؤال التي جعلته غير آمن.

التشبيه: تخيل معلماً يصحح مقال طالب.

  • الحارس العادي يضع ببساطة علامة "F" حمراء كبيرة على الورقة.
  • LEG يضع علامة "F" حمراء و يحدد الجملة المحددة التي انتهكت القواعد، قائلاً: "لقد فشلت لأنك استخدمت هذه الكلمات الثلاث".

2. تدريب "محامي الشيطان" (البيانات الاصطناعية)

لتعليم LEG كيفية التعرف على الكلمات السيئة، احتاج الباحثون إلى العديد من الأمثلة. ومع ذلك، فإن الناس مشغولون، والبيانات الموجودة كانت تفتقر إلى "الكلمات المحددة" اللازمة لتدريب LEG.

لذا، استخدموا حيلة ذكية باستخدام ذكاء اصطناعي آخر لتوليد بيانات التدريب. لقد لعبوا لعبة "محامي الشيطان" (Advocatus Diaboli) ضد الذكاء الاصطناعي المستخدم في التدريب:

  • سألوا الذكاء الاصطناعي: "لماذا هذا السؤال آمن؟" (حتى لو كان في الواقع غير آمن).
  • ثم سألوا: "لماذا هذا السؤال غير آمن؟"
  • الحيلة: إذا ارتبك الذكاء الاصطناعي بسبب انحيازه الخاص (باعتقاده أن السؤال آمن لمجرد أنه سُئل "لماذا هو آمن؟")، فإن الباحثين يستبعدون تلك الإجابة. لقد احتفظوا فقط بالإجابات التي نجح فيها الذكاء الاصطناعي في المحاجة ضد الانحياز.
  • النتيجة: تعلم LEG من أمثلة "مضادة للانحياز" عالية الجودة، مما علمه النظر إلى سياق الكلمات بدلاً من مجرد الكلمات نفسها.

3. آلية "التركيز" (دالة الفقد)

عندما يتعلم LEG، قد يرتبك أحياناً بسبب الأمثلة المخادعة. لقد منح الباحثون LEG أداة "تركيز" خاصة.

  • التشبيه: تخيل أن LEG يدرس من أجل امتحان. إذا أجاب على سؤال سهل بشكل صحيح، فهو لا يحتاج لتعلمه مرة أخرى. ولكن إذا أجاب على سؤال صعب بشكل خاطئ، يتلقى LEG "دفعة" ليتعلم هذا السؤال تحديداً بكثافة أكبر.
  • يضمن هذا تركيز LEG طاقته على الحالات الصعبة والمربكة بدلاً من إضاعة الوقت في الحالات السهلة.

4. لماذا يعد LEG تغييراً جذرياً للعبة

يدعي العمل أن LEG يتفوق على أفضل مسؤولي الأمن الحاليين في ثلاثة مجالات رئيسية:

  • إنه سريع وخفيف: بينما يشبه الحراس الآخرون الشاحنات الثقيلة (التي تتطلب ذاكرة كمبيوتر ووقت هائلين)، فإن LEG يشبه السكوتر. إنه صغير جداً (بعض إصداراته أصغر بـ 75 مرة من المنافسين) ولكنه سريع بنفس القدر، إن لم يكن أسرع.
  • إنه صادق (أمين): بما أن LEG يبرز الكلمات المحددة التي استخدمها لقراره، فنحن نعلم أنه لا يخمن فحما. لقد اختبره الباحثون عن طريق "تخفيف" الكلمات التي حددها LEG. وعندما فعلوا ذلك، ارتبك LEG ولم يعد قادراً على اتخاذ القرار الصحيح. وهذا يثبت أن LEG ينظر بالفعل إلى القرائن الصحيحة.
  • إنه ذكي في المواقف الجديدة: تم اختبار LEG على أسئلة لم يسبق له رؤيتها (خارج النطاق). حتى عندما كانت الأسئلة جديدة تماماً، كان أداء LEG يضاهي أو يتفوق على الحراس الضخام والبطيئين.

الملخص

يقدم هذا العمل LEG كمسؤول أمن جديد، صغير وسريع للذكاء الاصطناعي. وعلى عكس الحراس الحاليين الذين يتسمون بالبطء والصمت، يستجيب LEG بسرعة ويمكنه الإشارة بدقة إلى الكلمات التي تجعل السؤال خطيراً. لقد تعلم هذه القدرة من خلال لعب لعبة ذكية من نوع "محامي الشيطان" مع أنظمة ذكاء اصطناعي أخرى لإنشاء دليل التدريب الخاص به، وأثبت قدرته على التعامل مع المواقف الصعبة دون الحاجة إلى جهاز كمبيوتر ضخم لتشغيله.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →