← أحدث الأبحاث
💬 NLP

Do Large Language Models Reflect Demographic Pluralism in Safety?

تقدم هذه الورقة Demo-SafetyBench، وهو إطار عمل مصمم لمعالجة نقص التنوع الديموغرافي في محاذاة سلامة النماذج اللغوية الكبيرة من خلال إعادة تصنيف مجموعات البيانات الحالية إلى مجالات سلامة متنوعة وتوفير طريقة قابلة للتوسع وقوية لتقييم كيفية تباين تصورات السلامة عبر المجموعات الديموغرافية المختلفة.

المؤلفون الأصليون: Usman Naseem, Gautam Siddharth Kashyap, Sushant Kumar Ray, Rafiq Ali, Ebad Shabbir, Abdullah Mohammad

نُشر 2026-02-10
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Usman Naseem, Gautam Siddharth Kashyap, Sushant Kumar Ray, Rafiq Ali, Ebad Shabbir, Abdullah Mohammad

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

مشكلة "كتاب القواعد العالمي": لماذا يحتاج أمان الذكاء الاصطالي إلى بوصلة ثقافية؟

تخيل أنك معلم في مدرسة عالمية ضخمة. تريد إنشاء "كتاب قواعد السلامة" لتحديد ما هو غير لائق للطلاب قوله في الفصل.

إذا سألت فقط المعلمين من حي سكني واحد لكتابة القواعد، فقد ينتهي بك الأمر بكتاب يقول: "يُمنع منعاً باتاً التحدث عن الطعام الحار أثناء الغداء"، لأن هذا عرف محلي. لكن بالنسبة لطالب من جزء آخر من العالم، سيبدو هذا القانون سخيفاً وغير ضروري. وفي الوقت نفسه، قد يغفل كتاب القواعد تماماً عن شيء مهم حقاً لثقافة أخرى، مثل كيفية إظهار الاحترام لكبار السن.

تجادل هذه الورقة بأن نماذج الذكاء الاصطناعي الحالية تشبه ذلك المعلم من الحي الواحد. فهي يتم تدريبها على "قواعد سلامة" تعكس في الغالب وجهات نظر غربية أو ضيقة ثقافياً. أراد الباحثون معرفة ما إذا كان بإمكان الذكاء الاصطناعي أن يفهم أن "السلامة" ليست كتاب قواعد واحداً عالمياً، بل هي مجموعة من المنظورات المختلفة بناءً على هويتك.


الحل: "Demo-SafetyBench" (المنشور الثقافي)

أنشأ الباحثون نظام اختبار جديداً يسمى Demo-SafetyBench. فبدلاً من مجرد سؤال الذكاء الاصطناعي: "هل هذه الجملة سيئة؟"، أضافوا "منشوراً ثقافياً" إلى السؤال.

لم يكتفوا بتغيير الجملة فحسب، بل غيروا السياق. لقد أخذوا آلاف المواضيع (مثل السياسة، أو المخدرات، أو الآداب الاجتماعية) وربطوا بها "علامات هوية".

التشبيه: اختبار "حفلة العشاء"
تخيل أنك تدخل حفلة عشاء.

  • السيناريو (أ): أنت في حفل عمل رسمي في لندن.
  • السيناريو (ب): أنت في حفلة شواء خلفية صاخبة وغير رسمية في تكساس.
  • السيناريو (ج): أنت في عشاء عائلي تقليدي هادئ في طوكيو.

في كل إعداد من هذه الإعدادات، تتغير "سلامة" النكتة أو التعليق. فقد تكون النكتة الصاخبة "آمنة" في تكساس، ولكنها "غير آمنة" (غير محترمة) في طوكيو.

قام الباحثون بتغذية نماذج الذكاء الاصطعي بهذه "الإعدادات" المختلفة (العمر، العرق، الجنس، المستوى التعليمي) لمعرفة ما إذا كان "إنذار السلامة" لدى الذكاء الاصطناعي سينطلق بشكل مختلف بناءً على الإعداد.


ماذا وجدوا؟ (النتائج)

لقد اختبروا ثلاثة "قضاة" (نماذج ذكاء اصطناعي): بطل الوزن الثقيل (GPT-4o)، وزن المتوسط (LLaMA-2)، ووزن الخفيف (Gemma).

  1. "العقل الكبير" أكثر اتساقاً، لكنه ليس مثالياً: كان النموذج الأذكى (GPT-4o) هو الأكثر موثوقية. لم "يرتبك" بسهولة، ومع ذلك، ظل يُظهر تحيزات طفيفة. إنه يشبه القاضي الحكيم جداً الذي يتسم بالعدل في الغالب، لكن لا تزال لديه بعض العادات اللاواعية.
  2. النماذج الأصغر "متقلبة المزاج": كانت نماذج الذكاء الاصطناي الأصغر والأخف وزناً أكثر حساسية للديموغرافيا. فقد كان "إنذار السلامة" لديها يعمل بشكل مختلف تماماً بناءً على الشخص الذي تتحدث إليه. إنها تشبه المراهقين؛ أحياناً يتبعون القواعد، وأحياناً يتغير حكمهم بشكل جذري بناءً على من يتواجد في الغرفة.
  3. السلامة "مشروطة اجتماعياً": حتى أفضل نماذج الذكاء الاصطناعي لا تزال تمتلك "نقاط عمياء". فهي لا تعامل كل مجموعة ديموغرافية بنفس الطريقة تماماً. وهذا يثبت أن سلامة الذكاء الاصطناعي لا تتعلق فقط بـ "الصح مقابل الخطأ"؛ بل تتعلق بـ "من الذي يسأل ومن أي منظور".

لماذا يهمك هذا؟

بينما يبدأ الذكاء الاصطناعي في مساعدة الأطباء والمعلمين وصناع السياسات، لا يمكننا الاعتماد على مرشح سلامة "واحد يناسب الجميع". إذا استُخدم الذكاء الاصطناعي في مجتمع ديني محافظ، فإنه يحتاج لفهم تلك الأعراف. وإذا استُخدم في جامعة تقدمية، فعليه فهم تلك أيضاً.

توفر هذه الورقة "ميزان حرارة علمي" لقياس مدى "الوعي الثقافي" للذكاء الاصطناعي. وهي تساعد المطورين على بناء ذكاء اصطناعي لا يكتفي باتباع مجموعة واحدة من القواعد، بل يحترم "التعددية" الجميلة والمعقدة والمتنوعة للعالم البشري الحقيقي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →