← أحدث الأبحاث
💬 NLP

Bielik Guard: Efficient Polish Language Safety Classifiers for LLM Content Moderation

تقدم الورقة البحثية Bielik Guard، وهي عائلة من مصنفات سلامة اللغة البولندية الفعالة والمدمجة التي تم ضبطها بدقة على مجموعة بيانات مشروحة مجتمعيًا، والتي تصنف المحتوى بفعالية إلى خمسة مجالات للسلامة مع التفوق بشكل كبير على النماذج الحالية في معدلات الدقة والإنذارات الكاذبة.

المؤلفون الأصليون: Krzysztof Wróbel, Jan Maria Kowalski, Jerzy Surma, Igor Ciuciura, Maciej Szymański

نُشر 2026-02-16
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Krzysztof Wróbel, Jan Maria Kowalski, Jerzy Surma, Igor Ciuciura, Maciej Szymański

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك بنيت مكتبة ضخمة وذكية للغاية، حيث يمكن للكتب أن تتحدث إليك. هذه هي نماذج اللغات الكبيرة (LLMs) — وهي روبوتات الدردشة التي يمكنها كتابة القصص، وحل المسائل الرياضية، والدردشة حول أي شيء. ولكن، تماماً مثل المكتبة العامة، أنت بحاجة إلى أمين مكتبة لضمان عدم قيام أحد بالصراخ بكلمات بذيئة، أو التخطيط لجرائم، أو إيذاء نفسه داخل المبنى.

المشكلة؟ معظم أمناء المكتبة الأفضل في العالم يتحدثون الإنجليزية فقط. إذا حاولت استخدام أمين مكتبة يتحدث الإنجليزية لمراقبة محادثة بولندية، فقد يفتقد النكات الدقيقة، أو يفهم سوء فهم للنكات المحلية، أو قد يشعر بالخوف الشديد من كلمات غير ضارة، مما يؤدي إلى حظر المحادثات الجيدة عن طريق الخطأ.

إليك Bielik Guard.

قصة Bielik Guard

قام مؤلفو هذه الورقة البحثية بإنشاء فريق من أمناء المكتبة البولنديين المتخصصين المسمى Bielik Guard. يأتي الاسم من "Bielik"، وهو العقاب الذهبي المهيب، والاسم الرمزي "Sójka"، والذي يعني طائر "القيق" (وهو طائر معروف بصوته العالي، ويقظته، وحمايته).

كان هدفهم بسيطاً: بناء نظام سلامة يتحدث البولندية بطلاقة، ويفهم الثقافة البولندية، ويكون صغيراً بما يكفي ليعمل على جهاز كمبيوتر عادي دون الحاجة إلى كمبيوتر خارق.

كيف بنوا ذلك: "حشد المجتمع"

بدلاً من استئجار عدد قليل من الخبراء باهظي الثمن لكتابة كتاب القواعد، طلب الفريق من 1500 شخص بولندي عادي المساعدة. لقد أنشأوا استطلاعاً بسيطاً عبر الإنترنت حيث يقوم المتطوعون بقراءة نصوص قصيرة ويصوتون على ما إذا كانت "آمنة" أم "غير آمنة".

فكر في الأمر كأنه مراقبة حي. بدلاً من أن يقرر شخص واحد ما إذا كان الأمر خطيراً، يصوت الحي بأكمله. إذا اعتقد 6 من أصل 10 جيران أن نكتة ما كانت فظة للغاية، يتعلم النظام أنها مشكلة. وإذا اعتقد 2 فقط أنها سيئة، يتعلم النظام أنها على الأرجح بخير. هذا النهج يلتقط الفروق الدقيقة في اللغة البولندية — مثل السخرية، واللغة العامية، والسياق الثقافي الذي قد يفتقده ذكاء اصطناعي أجنبي.

لقد جمعوا حوالي 6,885 نصاً فريداً وأكثر من 60,000 صوت لتدريب نظامهم.

النموذجان: "ساعة الجيب" و"ساعة الجد"

بنى الفريق نسختين من حارس السلامة الخاص بهم:

  1. Bielik Guard 0.1B (ساعة الجيب):

    • الحجم: صغير جداً (124 مليون معلمة). إنه يشبه الساعة الذكية.
    • السرعة: سريع للغاية. يمكنه فحص النص بشكل فوري تقريباً.
    • المهمة: رائع للتطبيقات التي تهمها السرعة وعمر البطارية.
    • الأداء: من المثير للدهشة أن هذا النموذج الصغير أذكى في رصد المشكلات البولندية من نماذج أكبر بكثير من دول أخرى.
  2. Bielik Guard 0.5B (ساعة الجد):

    • الحجم: متوسط (443 مليون معلمة). إنه يشبه ساعة الحائط المتينة.
    • السرعة: أبطأ قليلاً، لكنه لا يزال سريعاً جداً.
    • المهمة: هو من يقوم بالعمل الشاق. يمكنه رصد المخاطر الأكثر دقة والتعامل مع النصوص المعقدة والمربكة بشكل أفضل.

ما الذي يراقبونه

تم تدريب أمناء المكتبة البولنديين لرصد خمسة أنواع محددة من المشاب:

  • الكراهية/العدوان: التنمر أو مهاجمة مجموعات من الناس.
  • الألفاظ النابية: السب واللغة البذيئة.
  • المحتوى الجنسي: الأوصاف الصريحة أو طلبات المحتوى الإباحي.
  • الجريمة: تعليمات حول كيفية صنع المخدرات أو ارتكاب الاحتيال.
  • إيذاء النفس: أي شيء يشجع على الانتحار أو اضطرابات الأكل.

ملاحظة: هم يتجاهلون عمداً أشياء مثل "الأخبار المزيفة" أو "حقوق الطبع والنشر" لأن هذه الأشياء تتطلب أنواعاً مختلفة من التفكير. إنهم يركزون على السلامة الفورية.

الاختبار الكبير: لماذا يتفوقون؟

اختبر الفريق أمناء المكتبة الخاصين بهم ضد "العمالقة" في الصناعة (مثل Llama Guard و QwenGuard)، وهي نماذج ضخمة مصممة للتحدث بأكثر من 20 لغة.

إليك النتيجة، مشروحة ببساطة:

  • العمالقة: لأنهم يحاولون التحدث بكل اللغات، فإنهم غالباً ما يرتبكون باللغة البولندية. إنهم يصرخون "توقف!" كثيراً، مما يؤدي إلى حظر المحادثات البريئة (ارتفاع النتائج الإيجابية الخاطئة). تخيل حارساً يوقف الجميع لأنه يبدو مشبوهاً قليلاً.
  • Bielik Guard: نظرًا لأنه تم تدريبه خصيصاً على البيانات البولندية، فهو يعرف بالضبط ما الذي يبحث عنه.
    • الدقة: عندما يقول Bielik Guard، "هذا خطر"، فإنه يكون صادقاً بنسبة 77%.
    • العمالقة: عندما تقول العمالقة المدربة على الإنجليزية، "هذا خطر"، فإنها غالباً ما تكون مخطئة (حوالي 13% فقط من الصحة في النصوص البولندية).
    • النتيجة: يسمح Bielik Guard للناس العاديين بالتحدث بحرية دون أن يتم حظرهم، بينما لا يزال يمسك بالأشخاص السيئين الحقيقيين. إنه يشبه وجود حارس يعرف الفرق بين دفعة مزاح ودق عراك حقيقي، بينما يعتقد الحارس الأجنبي أن الدفعة المزاح هي عراك.

ميزة خاصة: المساعدة، وليس مجرد الحظر

معظم أنظمة السلامة تكتفي بقول "لا" وحظر الرسالة. ولكن بالنسبة لفئة إيذاء النفس، تم تصميم Bielik Guard ليكون مختلفاً.

إذا كتب شخص ما شيئاً حزيناً أو خطيراً، فبدلاً من مجرد إسكاته، تم تصميم النظام للمساعدة. يمكن ضبطه لتوفين رقم هاتف لخط مساعدة للأزمات (مثل "Telefon Zaufania" في بولندا). إنه يعامل المستخدم كشخص يحتاج إلى دعم، وليس مجرد خرق للقواعد.

الخلاية

يثبت Bielik Guard أنك لست بحاجة إلى ذكاء اصطناعي ضخم ومكلف للحفاظ على سلامة لغة معينة. من خلال استخدام البيانات المحلية، أصوات المجتمع، والنماذج الصغيرة والذكية، يمكنك بناء نظام سلامة يكون:

  1. أكثر دقة للمتحدثين البولنديين.
  2. أقل إزعاجاً (فهو لا يحظر الأبرياء).
  3. أرخص وأسرع في التشغيل.

إنه تذكير بأنه بالنسبة لسلامة اللغة، فإن معرفة الثقافة غالباً ما تكون أكثر أهمية من امتلاك دماغ أكبر.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →