← أحدث الأبحاث
💬 NLP

GLiGuard: Schema-Conditioned Classification for LLM Safeguard

يُعد GLiGuard مشفرًا ثنائي الاتجاه مدمجًا بـ 0.3 مليار معلمة ومشروطًا بالمخطط، ويحقق دقة تنافسية في تصنيف السلامة مع زمن انتقال أقل بكثير وإنتاجية أعلى من نماذج الحماية التوليدية الكبيرة عبر ترميز تعريفات المهام ودلالات التسميات مباشرة في المدخلات للتقييم المتزامن لمتعدد الجوانب.

المؤلفون الأصليون: Urchade Zaratiana, Mary Newhauser, George Hurn-Maloney, Ash Lewis

نُشر 2026-05-11
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Urchade Zaratiana, Mary Newhauser, George Hurn-Maloney, Ash Lewis

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك روبوتًا ذكيًا جدًا ومحبًا للدردشة (نموذج لغوي كبير) تريد توظيفه لكتابة القصص، أو الإجابة على الأسئمات، أو المساعدة في البرمجة. لكنك قلق من أنه قد يقول بالخطأ شيئًا مسيئًا، أو غير قانوني، أو خطيرًا.

تقليديًا، لإبقاء هذا الروبوت تحت السيطرة، تستخدم الشركات "حارس أمن" هو أيضًا روبوت ضخم ومعقد للغاية. هؤلاء الحراس يشبهون ناطحات سحاب مكونة من 27 طابقًا (7 مليارات إلى 27 مليار معلمة/parameter). للتحقق مما إذا كانت الرسالة آمنة، يتعين على الحارس قراءة الرسالة، والتفكير فيها، ثم "نطق" حكمه كلمة بكلمة، مثل أمين مكتبة حذر وبطيء يفحص كتابًا صفحة بصفحة في كل مرة. إنه دقيق، لكنه ثقيل، وبطيء، ومكلف في التشغيل.

GLiGuard هو الحل الجديد الذي يقدمه البحث. إنه حارس أمن صغير ورشيق (يحتوي فقط على 0.3 مليار معلمة) ويعمل بطريقة مختلفة تمامًا.

إليك كيف يعمل GLiGuard، باستخدام تشبيهات بسيطة:

1. "القائمة" بدلاً من "النص المكتوب"

معظم حراس الأمن يتم تدريبهم للبحث عن أشياء محددة فقط. إذا كنت تريد منهم التحقق من "العنف" و "خطاب الكراهية" و "اختراق الحماية (jailbreaks)"، فعادة ما تحتاج إلى إعادة تدريبهم أو تشغيلهم عدة مرات.

GLiGuard مختلف. فهو يأتي مع قائمة ديناميكية (تسمى "المخطط" أو schema).

  • الطريقة القديمة: لديك حارس يعرف فقط كيفية التحقق من "الحريق". إذا أردت التحقق من "الفيضانات" لاحقًا، عليك طرد الحارس وتوظيف حارس جديد.
  • طريقة GLiGuard: أنت تقدم للحارس ورقة (المخطط) تسرد بالضبط ما تريد التحقق منه الآن. يمكنك أن تكتب: "تحقق من الحريق، والفيضان، والزلازل". يقرأ الحارس هذه القائمة، ويفهم تعريفات تلك الكلمات، ويتحقق من وجودها جميعًا في وقت واحد.

2. "الصورة الجماعية" مقابل "الطابور"

  • الطريقة القديمة (التوليدية التتابعية - Autoregressive): تخيل حارس أمن يجب أن يقف في طابور واحد خلف بعضه البعض. ينظر إلى الكلمة الأولى، ثم الثانية، ثم الثالثة، ويتخذ قرارًا أثناء تقدمه. إذا كانت الرسالة طويلة، سيصبح الطابور طويلًا، وسيكون وقت الانتظار هائلًا.
  • طريقة GLiGuard (ثنائية الاتجاه - Bidirectional): تخيل أن الحارس يلتقط صورة جماعية للرسالة بأكملها وقواعد السلامة دفعة واحدة. ولأنه يستطيع رؤية البداية والمنتصف والنهاية للجملة في آن واحد، فإنه يفهم السياق فورًا. ليس عليه انتظار وصول الكلمة التالية؛ فهو يرى الصورة الكاملة في ومضة واحدة.

3. كفاءة "السكين السويسري"

يدعي البحث أنه بينما GLiGuard أصغر بمقدار 23 إلى 90 مرة من حراس ناطحات السحاب الضخمة، إلا أنه لا يزال بنفس الجودة في رصد المحتوى السيئ.

  • السرعة: نظرًا لأنه لا يحتاج إلى "نطق" إجابته كلمة بكلمة، فهو أسرع بـ 16 مرة (إنتاجية أعلى) وأقل زمن استجابة بـ 17 مرة (وقت استجابة أسرع).
  • تعدد الاستخدامات: يمكنه التحقق من 14 نوعًا مختلفًا من الأضرار (مثل العنف، أو تسريب الخصوصية، أو خطاب الكراهية) و11 نوعًا مختلفًا من حيل "اختراق الحماية" (الطرق التي يحاول بها الناس خداع الذكاء الاصطناوي) في تمريرة واحدة فقط.

4. "القواعد الصارمة"

GLiGuard لا يخمن فحسب؛ بل يتبع تدفقًا منطقيًا صارمًا:

  1. يقرأ رسالتك و"قائمة" قواعد السلامة.
  2. يتحقق: "هل هذا الطلب آمن؟" "هل الاستجابة آمنة؟" "هل حاول المستخدم خداع النظام؟" "هل هناك خطاب كراهية؟"
  3. يجمع بين هذه الإجابات. إذا تحولت أي من عمليات التحقق المحددة (مثل "تم اكتشاف اختراق حماية") إلى اللون الأحمر، يتم حظر الرسالة بأكملها فورًا، بغض النظر عما إذا كان فحص السلامة العام قد أعطى نتيجة آمنة.

الخلاصة

يجادل البحث بأنه لست بحاجة إلى "عقل فائق" ضخم وبطيء ومكلف ليعمل كفلتر سلامة. يمكنك استخدام أداة مدمجة، ذكية، ومرنة تقرأ قواعد السلامة كجزء من المدخلات، وتتحقق من كل شيء في خطوة واحدة، وتفعل ذلك بشكل أسرع وأرخص بكثير من المعايير الصناعية الحالية، دون فقدان الدقة.

باخت اختصار: GLiGuard يشبه استبدال دبابة ثقيلة وبطيئة بطائرة بدون طيار (درون) سريعة ورشيقة يمكنها تغيير مهمتها في منتصف الطيران بمجرد قراءة مجموعة جديدة من التعليمات.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →