Opir: Efficient Multi-Task Safety Classification for Toxicity, Jailbreaks, Hate Speech, and Harmful Content
تقدم هذه الورقة البحثية Opir، وهي عائلة من نماذج الحماية القائمة على المشفرات متعددة المهام والفعالة والمبنية على بنية GLiClass، والتي تحقق أداءً تنافسياً في تصنيف السلامة عبر كشف السمية، ومحاولات الاختراق (jailbreaks)، والمحتوى الضار، مع الحفاظ على بصمة نشر أصغر بكثير من أنظمة الحماية الضخمة الحالية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك روبوتًا ذكيًا ومبدعًا للغاية (نموذج لغوي كبير) يمكنه كتابة القصص، والإجابة على الأسئلة، والمساعدة في البرمجة. ولكن مثل طفل عبقري، فإنه يحتاج أحيانًا إلى "جليس أطفال" للتأكد من أنه لا يقول أي شيء مسيء أو خطير أو غير قانوني.
لفترة طويلة، كانت جليسات الأطفال هذه ضخمة، وبطيئة، ومكلفة. كان الأمر يشبه استئجار فريق من 100 حارس أمن للتحقق من جملة واحدة فقط. لقد استهلكوا مساحة كبيرة وجعلوا الروبوت يتحدث ببطء شديد.
إليك "أوبير" (Opir).
تقدم الورقة البحثية "أوبير"، وهي عائلة جديدة من "حراس الأمن الأذكياء" المصممين ليكونوا سريعين، وصغار الحجم، وفعالين للغاية. إليك كيف يعمل، باستخدام تشبيهات بسيطة:
1. "شارة الأمن الشاملة"
معظم أنظمة السلامة تشبه حارس الأمن الذي يتحقق من شيء واحد فقط: "هل هذا الشخص خطير؟ نعم أم لا". إذا كنت تريد معرفة لماذا هو خطير (هل هو خطاب كراهية؟ محاولة اختراق (Jailbreak)؟ أم تهديد؟)، فستحتاج إلى حارس مختلف لكل سؤال.
"أوبير" يشبه حارس الأمن ذو الشارة الفائقة الذي يمكنه القيام بكل ذلك في آن واحد.
- الفحص الثنائي: يمكنه القول فورًا "آمن" أو "غير آمن".
- فحص المهام المتعددة: يمكنه في نفس الوقت رصد ما إذا كان النص سامًا، أو ما إذا كان شخص ما يحاول "اختراق" (خداع) الروبوت، أو ما إذا كان يندرج تحت فئة معينة مثل "العنف" أو "الخصوصية".
- خدعة "التعلم الصفري" (Zero-Shot): لا يحتاج إلى إعادة تدريب لكل نوع جديد من السلوك السيئ. إنه مثل حارس يمكنه قراءة قائمة بقواعد جديدة فورًا ومعرفة ما إذا كانت الجملة تكسرها دون الحاجة إلى أسبوع من الدراسة.
2. النسخ "الصغيرة ولكن القوية"
تقدم الورقة أحجامًا مختلفة من "أوبير"، اعتمادًا على مكان حاجتك إليه:
- الرافعة الثقيلة (Opir-multitask-large): هذه هي النسخة الكبيرة والقوية التي تعمل على خوادم ضخمة. إنها دقيقة للغاية ويمكنها التعامل مع فحوصات السلامة المعقدة ومتعددة الطبقات.
- عداء الحواف (Opir-edge): هذه هي النسخة "المصغرة التي توضع في الجيب". إنها صغيرة جدًا (أقل من 100 مليون معلمة/Parameter) لدرجة أنها يمكن أن تعمل على جهاز كمبيوتر محمول واحد أو حتى جهاز محمول. لقد صُممت لتكون سريعة كالبرق، حيث تتحقق من السلامة في أقل من 10 مللي ثانية. ذلك أسرع من رمشة العين.
3. كيف تم تدريبه (تشبيه "المدرسة")
لتعليم "أوبير" ما هو آمن وما ليس كذلك، لم يكتفِ المبتكرون بعرض بعض الأمثلة عليه فحسب، بل بنوا "منهجًا دراسيًا" ضخمًا مكونًا من ثلاثة مستويات (تصنيف) يضم 996 فئة مختلفة من مشكلات السلامة.
- الكتب المدرسية: استخدموا مزيجًا من الأمثلة الواقعية، والمطالبات (Prompts) السيئة المولدة بواسطة الذكاء الاصطناعي، والأمثلة "الصعبة" المصممة خصيصًا لخداع أنظمة السلامة الأخرى.
- "الفخاخ الجيدة": من المهم بشكل خاص، أنهم علموا "أوبير" عن المواضيع الحساسة غير الضارة. تخيل طالبًا يسأل: "كيف أوقف المتنمر؟". هذا موضوع حساس، لكنه آمن. الأنظمة القديمة كانت غالبًا ما تصاب بالذعر وتقول "لا!" (الرفض المفرط). لقد تم تدريب "أوبير" على إدراك أن هذا سؤال مفيد وليس سؤالًا خطيرًا.
- فصل اللغات المتعددة: علموه بـ 23 لغة، مما يضمن عمله من أجل الناس في جميع أنحاء العالم، وليس فقط المتحدثين بالإنجليزية.
4. المقايضة بين السرعة والذكاء
تقارن الورقة البحثية "أوبير" بأنظمة السلامة الشهيرة الأخرى (مثل Llama Guard أو WildGuard).
- الطريقة القديمة: الأنظمة الأخرى تشبه الدبابات الثقيلة. إنها قوية ودقيقة جدًا، لكنها بطيئة وتستهلك الكثير من الوقود (قدرة الحوسبة). للتحقق من جملة واحدة، قد تستغرق قرابة 100 مللي ثانية.
- طريقة "أوبير": "أوبير" يشبه سيارة الفورمولا 1. لقد بُني على محرك مختلف (مشفر/Encoder بدلاً من مفسر/Decoder). إنه يحقق دقة مماثلة (وأحيانًا أفضل) ولكنه أسرع بـ 10 إلى 30 مرة.
- بينما تستغرق الدبابات الثقيلة قرابة عُشر الثانية للتفكير، يمكن لنسخة "أوبير" الطرفية اتخاذ قرار في 9 مللي ثانية.
5. ما يمكنه فعله وما لا يمكنه فعله
الورقة البحثية واضحة جدًا بشأن حدود "أوبير":
- هو مرشح (Filter) وليس قاضيًا: هو يساعد في توجيه حركة المرور وإعطاء الأولوية للمراجعات، ولكن لا ينبغي أن يكون السبب الوحيد لطردهم من العمل، أو رفض قرض لهم، أو اتخاذ قرار قانوني.
- ليس مثاليًا: نظرًا لأن قواعد السلامة تتغير ولأن اللغة البشرية معقدة، فقد يرتكب أخطاء، خاصة مع "الخدع" الجديدة جدًا أو الفروق الثقافية الدقيقة.
- هو أداة: من المفترض أن يكون جزءًا من نظام سلامة أكبر يتضمن المراجعة البشرية والاستئناف.
باخت-صار: "أوبير" هو جيل جديد من مرشحات السلامة التي تثبت أنك لست بحاجة إلى روبوت ضخم وبطيء ومكلف للحفاظ على سلامة الذكاء الاصطناك. يمكنك الحصول على "حارس" صغير وسريع وعالي الدقة يعمل في الخلفية، يتحقق من السمية، ومحاولات الاختراق، والمحتوى الضار في لمح البصر، مع فهم الفرق بين التهديد الخطير والسؤال المفيد.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.