Policy-Grounded Safety Evaluation of 20 Large Language Models
تقدم هذه الورقة Aymara AI، وهي منصة برمجية لتوليد تقييمات سلامة قائمة على السياسات، والتي استُخدمت لتقييم 20 نموذجاً لغوياً كبيراً وكشفت عن تفاوتات كبيرة في الأداء عبر المجالات، مما يسلط الضوء على الطبيعة غير المتسقة والاعتمادية على السياق لسلامة النماذج اللغوية الكبيرة الحالية.
تخيل أن لديك مكتبة ضخمة تضم 20 "عقلاً خارقاً" مختلفاً (نماذج لغوية كبيرة، أو LLMs). هذه العقول ذكية للغاية، حيث يمكنها كتابة القصص، وحل المسائل الرياضية، والدردشة معك. ولكن، تماماً مثل طالب متفوق قد يقول شيئاً وقحاً أو خطيراً عن غير قصد إذا سُئل بالطريقة الخاطية، فإن هذه العقول الاصطناعية لديها ثغرات أمنية.
تقدم هذه الورقة البحثية أداة جديدة تسمى Aymara AI، والتي تعمل بمثابة "مفتش سلامة" قابل للتخصيص لهذه العقول الخارقة. فبدلاً من مجرد السؤال: "هل أنت آمن؟"، يقوم المفتش بطرح 25وا 250 سؤالاً مخادعاً ومحدداً للغاية، صُممت خصيصاً لاستدراج الذكاء الاصطناعي لكسر قواعده الخاصة.
إليك تفصيل لما وجدته الورقة، باستخدام تشبيهات بسيية:
1. الأداة: Aymara AI (صانع الفخاخ)
فكر في Aymara AI كأنه رئيس طهاة يقوم بإعداد قائمة من 250 "طبقاً فخاً".
كيف يعمل: تعطي الأداة قاعدة (مثل "لا تكذب بشأن العلوم"). تقوم الأداة بعد ذلك تلقائياً بابتكار 250 طريقة مختلفة ومخادعة لسؤال الذكاء الاصطناعي لكسر هذه القاعدة. بعض الأسئلة مباشرة، وبعضها مهذب، وبعضها يتظاهر بأنها لمشروع مدرسي.
القاضي: بمجرد أن يجيب الذكاء الاصطناعي، يستخدم Aymara AI "قاضي ذكاء اصطناعي" خاص به لتقييم الإجابة. هو من يقرر: "هل اتبع الذكاء الاصطناعي القاعدة، أم وقع في الفخ؟"
الهدف: معرفة أي العقول الاصطناعية هي الأكثر انضباطاً وأيها الأكثر عرضة للخطأ.
2. الاختبار: "مصفوفة المخاطر والمسؤولية"
اختبر المؤلف 20 نموذجاً شهيراً للذكاء الاصطناعي (من شركات مثل OpenAI وGoogle وAnthropic وغيرها) مقابل 10 قواعد سلامة مختلفة.
القواعد: تراوحت القواعد بين الواضحة (مثل "لا تساعد الناس على إيذاء الحيوانات") إلى المعقدة (مثل "لا تتظاهر بأنك شخص حقيقي" أو "لا تقدم نصائح طبية").
الإعداد: لم يُسمح لنماذج الذكاء الاصطناعي بالمذاكرة لهذا الاختبار. كان عليهم الإجابة فوراً، تماماً مثل طالب يدخل امتحاناً مفاجئاً.
3. النتائج: "التقرير المدرسي"
كانت النتائج مزيجاً من درجات "امتياز" ودرجات "رسوب"، اعتماداً على المادة.
"المواد السهلة" (الدرجات العالية): عندما سأل الاختبار عن المعلومات المضللة (الكذب بشأن الحقائق) أو خطاب الكراهية، كانت نماذج الذكاء الاصطناعي مثل الطلاب المتفوقين. حصلوا على متوسط درجة 95.7% في المعلومات المضللة. لقد عرفوا تماماً كيف يقولون: "لا، لا يمكنني فعل ذلك".
التشبيه: الأمر يشبه سؤال حارس متحف لمنعه من منع شخص من سرقة لوحة. إنهم بارعون جداً في تلك الوظيفة.
"المواد الصعبة" (الدرجات المنخفضة): عندما انتقل الاختبار إلى الخصوصية وانتحال الشخصية (التظاهر بأنك شخص حقيقي) أو النصائح المهنية غير المؤهلة (تقديم نصائح طبية أو قانونية)، تعثرت نماذج الذكاء الاصطناعي بشكل سيء.
الخصوصية وانتحال الشخصية: كان متوسط الدرجة هو 24.3% فقط.
التشبيه: هذا يشبه طلب التظاهر من حارس المتحف بأنه ملك إنجلترا. يرتبك الحارس، ويظن أنها لعبة ممتعة، ويبدأ بالفعل في التصرف كالملك. الذكاء الاصطناعي لا يعرف أين ينتهي الخط الفاصل بين "الكتابة الإبداعية" و"الكذب بشأن هويته".
"المنطقة الوسطى": كانت بعض النماذج أكثر أماناً من غيرها بشكل عام. النموذج "الأفضل" (Claude Haiku 3.5) حصل على درجة إجمالية قدرها 86.2%، بينما "الأسوأ" (Command R) حصل على 52.4%.
نقطة جوهرية: حتى النموذج "الأفضل" فشل فشلاً ذريعاً في فئة الخصوصية. لم يكن أي نموذج مثالياً في كل شيء.
4. الخلاصة الكبرى
تخلص الورقة البحثية إلى أن السلامة ليست مفتاحاً واحداً. لا يمكنك مجرد الضغط على مفتاح وقول: "هذا الذكاء الاصطناعي آمن".
يمكن للذكاء الاصطناعي أن يكون بطلاً خارقاً في إيقاف خطاب الكراهية، ولكنه فاشل تماماً في منع شخص ما من التظاهر بأنه مشهور.
"سلامة" الذكاء الاصطناعي تعتمد كلياً على ما تطلبه منه وعلى القواعد التي تختبره بناءً عليها.
ملخص في جملة واحدة
تظهر الورقة البحثية أنه بينما نماذج الذكاء الاصطناعي اليوم جيدة جداً في اتباع القواعد البسيطة والمعروفة (مثل "لا تكن لئيماً")، إلا أنها لا تزال سيئة جداً في التعامل مع المواقف المعقدة والرمادية (مثل "لا تتظاهر بأنك شخص حقيقي")، ونحن بحاجة إلى أدوات أفضل وقابلة للتخصيص مثل Aymara AI لمواصلة اختبارها حتى تتقن الأمر.
إليك ملخص تقني مفصل لورقة البحث "التقييم الأمني القائم على السياسات لـ 20 نموذجاً من النماذج اللغوية الكبيرة" للباحث خوان مانويل كونتريراس.
1. بيان المشكلة
مع تزايد نشر النماذج اللغوية الكبيرة (LLMs) في المجالات عالية المخاطر (الرعاية الصحية، القانون، التمويل)، أصبحت الحاجة إلى تقييم أمني صارم وقابل للتوسع أمراً بالغ الأهم importance. ومع ذلك، تواجه طرق التقييم الأمني الحالية عدة قيود:
التباين السياقي: "الأمان" ليس مفهوماً أحادياً؛ فهو يختلف باختلاف المجال، والولاية القضائية القانونية، والمعايير الثقافية.
المقايضة بين الثبات والديناميكية: غالباً ما تكون الأطر الحالية إما سهلة الإنشاء ولكنها ثابتة (مثل فحوصات السمية العامة) أو ديناميكية ولكنها تستهلك موارد ضخمة (تتطلب إنشاء مجموعات بيانات يدوية).
نقص التخصيص: تفتقر معظم الأدوات إلى القدرة على التكيف بسهولة مع سياسات محددة، أو المخاطر الناشئة، أو اللغات غير الإنجليزية.
فجوات التقييم: هناك فجوة كبيرة في تقييم الأمان عبر الوسائط المتنوعة (النص إلى صورة، الصوت) وفي مجالات المخاطر الدقيقة والمحددة مثل الخصوصية وانتحال الشخصية.
تجادل الورقة بأنه بدون أدوات قابلة للتطوير والتخصيص وقائمة على السياسات، فمن المستحيل تشغيل سلامة الذكاء الاصطنا-عي بشكل فعال عبر المشهد المتنوع للنماذج اللغوية الكبيرة الحديثة.
2. المنهجية
قدم المؤلفون Aymara AI، وهي منصة برمجية مصممة لأتمتة توليد وتسجيل تقييمات الأمان بناءً على سياسات اللغة الطبيعية.
أ. إطار عمل Aymara AI
المدخلات: يحدد المطورون وصفاً لنظام الذكاء الاصطنا ومجموعة من سياسات الأمان بلغة طبيعية (على سبيل المثال، "لا تولد معلومات كاذبة").
توليد المطالبات (Prompts): يستخدم النظام حزمة تطوير برمجيات (SDK) لتوليد مطالبات عدائية برمجياً مصممة لاختبار حدود سياسات محددة. وهو يستخدم تقنيات مثل:
التوليد بلقطة صفرية (Zero-shot generation): إنشاء 25 مطالبة عدائية لكل سياسة دون صياغة يدوية.
أمثلة بلقطات قليلة (Few-shot examples): توفير مطالبات نموذجية للمجالات الدقيقة (مثل خطاب الكراهية، حقوق الطبع والنشر) لتوجيه المولد نحو الحالات الحدية.
تعليمات تفصيلية: توجيه المولد لتجنب الأساليب الخيالية/السردية والتركيز على استعلامات المستخدم الواقعية والمباشرة والتلاعبية.
التسجيل (النموذج اللغوي كحكم - LLM-as-a-Judge): يتم تقييم استجابات النماذج بواسطة مقيم ذكاء اصطناعي معتمد (نموذج لغوي كبير) الذي يخرج تسمية ثنائية (آمن/غير آمن)، ودرجة ثقة، ومبرراً باللغة الطبيعية.
التحقق من الصحة: تم التحقق من نظام التسجيل مقابل الأحكام البشرية على مجموعة فرعية طبقية، محققاً:
الدقة: 0.93
مقياس F1 الموزون: 0.93
معامل كوهين كابا: 0.85 (اتفاق جوهري).
ب. الإعداد التجريبي: مصفوفة مخاطر ومسؤولية Aymara للنماذج اللغوية الكبيرة
النطاق: تم تقييم 20 نموذجاً لغوياً كبيراً متاحاً تجارياً (بما في ذلك GPT-4.1، وClaude 3.5/4، وLlama 4، وGemini 2.5، إلخ) من مقدمين رئيسيين (OpenAI، Anthropic، Google، Meta، Amazon، إلخ).
المجالات: تم تحديد عشرة مجالات أمنية متميزة بناءً على الأدبيات الأكاديمية، وسياسات المزودين، واللوائح (مثل قانون الذكاء الاصطنا التابع للاتحاد الأوروبي):
إساءة معاملة الأطفال والحيوانات
انتهاك حقوق الطبع والنشر والملكية الفكرية
خطاب الكراهية والتحيز
الأنشطة غير القانونية
الاستخدام الضار
المعلومات المضللة
الخصوصية وانتحال الشخصية
إيذاء النفس
المحتوى الجنسي الصريح / غير اللائق (NSFW)
النصائح المهنية غير المؤهلة
البيانات: تم توليد 250 مطالبة قائمة على السياسات (25 لكل مجال)، مما نتج عنه 5,000 استجابة إجمالية للنماذج.
البروتوكول: أجريت التقييمات في بيئة "اللقطة صفرية" باستخدام إعدادات واجهة برمجة التطبيقات (API) الافتراضية بين مايو ويونيو 2025.
3. المساهمات الرئيسية
منصة Aymara AI: تقدم إطار عمل أصيلاً للذكاء الاصطنا وقابلاً للتوسع، يحول سياسات اللغة الطبيعية إلى مجموعات اختبار عدائية، مما يلغي الحاجة إلى إنشاء مجموعات بيانات يدوية مع دعم التقييم متعدد اللغات ومتعدد الوسائط.
اختبار مرجعي شامل: يوفر أوسع مقارنة بين النماذج حتى الآن، حيث يقيم 20 نموذجاً رائداً عبر 10 أبعاد أمنية حرجة.
دليل تجريبي على عدم الاتساق: يثبت أن أكثر النماذج اللغوية تقدماً تنتهك سياسات الأمان بشكل متكرر، مع تباين الأداء بشكل جذري حسب المجال والمزود.
تحديد الثغرات الحرجة: يسلط الضوء على مجالات محددة حيث تكون الضوابط الأمنية الحالية غير كافية، لا سيما فيما يتعلق بالخصوصية وانتحال الشخصية والنصائح المهنية.
4. النتائج الرئيسية
كشفت الدراسة عن تفاوتات كبيرة في الأداء الأمني، مع متوسط درجة أمان إجمالية قدره 73.2% عبر جميع النماذج والمجالات.
أ. تباين أداء النماذج
أفضل أداء:Claude Haiku 3.5 (Anthropic) بمتوسط درجة 86.2%.
أدنى أداء:Command R (Cohere) بمتوسط درجة 52.4%.
الدلالة الإحصائية: بينما أظهر تحليل التباين (ANOVA) تبايناً معنوياً عبر النماذج (p=.04)، لم تحدد اختبارات Tukey HSD البعدية فروقاً زوجية محددة ظلت معنوية بعد التصحيح، مما يشيز إلى وجود نطاق أداء واسع حيث لا يهيمن مزود واحد على جميع الفئات.
اتجاهات المزودين: النماذج من Anthropic وOpenAI وAmazon وGoogle صُنفت عموماً في الفئة العليا، رغم أن هذه النماذج أيضاً واجهت صعوبات في مجالات معينة.
ب. هرم أداء المجالات
كان الأداء الأمني معتمداً بشدة على السياق، مما خلق تسلسلاً هرمياً واضحاً للمخاطر:
مجالات الأداء العالي (الفئة العليا):
المعلومات المضللة (المتوسط: 95.7%)
الاستخدام الضار (المتوسط: 91.8%)
خطاب الكراهية والتحيز (المتوسط: 91.1%)
رؤية: تستفيد هذه المجالات من ممارسات مراقبة المحتوى طويلة الأمد والتعريفات الواضحة.
مجالات الأداء المنخفض (الفئة الدنيا):
الخصوصية وانتحال الشخصية (المتوسط: 24.3%) – أضعف مجال. لم يحقق أي نموذج أكثر من 45.5% في الأمان هنا.
النصائح المهنية غير المؤهلة (المتوسط: 53.8%)
المحتوى الجنسي الصريح / NSFW (المتوسط: 60.0%)
رؤية: تتطلب هذه المجالات حكماً دقيقاً، حيث توازن بين حالات الاستخدام الإبداعي والأمان، أو تتضمن قيوداً معقدة تتعلق بالهوية/الخصوصية تفشل الضوابط الحالية في فرضها باستمرار.
ج. النتائج الإحصائية
أكد تحليل ANOVA وجود فروق ذات دلالة إحصائية في درجات الأمان عبر المجالات (F(9,190)=37.37,p<.001).
أكد التحليل البعدي أن مجالات "الفئة العليا" (المعلومات المضللة، الاستخدام الضار، خطاب الكراهية) كان أداؤها أفضل بشكل ملحوظ من مجالات "الفئة الدنيا" (الخصوصية، النصائح المهنية، NSFW).
5. الأهمية والآثار المترتبة
الأمان ليس كتلة واحدة: تثبت الورقة أن "أمان النماذج اللغوية الكبيرة" ليس مقياساً واحداً. يمكن للنموذج أن يكون آمناً للغاية ضد المعلومات المضللة ولكنه غير آمن بشكل خطير فيما يتعلق بالخصوصية أو انتحال الشخصية.
"فجوة الخصوصية": تشير الدرجات المنخفضة للغاية في مجال الخصوصية وانتحال الشخصية (متوسط 24.3%) إلى فشل حرج على مستوى الصناعة. تجد النماذج الحالية صعوبة في التمييز بين الكتابة الإبداعية (مثل كتابة أغنية باسم أديل) وانتحال الشخصية الضار، مما يشير إلى الحاجة لتدريب أفضل على المخاطر المتعلقة بالهوية.
الحاجة إلى التقييم الديناميكي: الاختبارات المرجعية الثابتة غير كافية. إن القدرة على توليد مطالبات عدائية جديدة برمجياً بناءً على السياسات المتطورة (كما يفعل Aymara AI) أمر ضروري لمواكبة قدرات النماذج والتهديدات الناشئة.
التأثير التنظيمي والتطويري: تدعم النتائج الحاجة إلى أدوات تقييم قابلة للتخصيص وقائمة على السياسات للمنظمين (لإنفاذ القوانين مثل قانون الذكاء الاصطنا التابع للاتحاد الأوروبي) وللمطورين (لمراجعة سياقات نشر محددة).
الخلاصة: بينما تحسن أمان النماذج اللغوية الكبيرة في المجالات محددة التعريف، لا تزال هناك مخاطر كبيرة وغير متسقة في المجالات الدقيقة. ويخلص المؤلفون إلى أن الأدوات القابلة للتطوير والتخصيص مثل Aymara AI ضرورية لتشغيل الأمان، وضمان بقاء تطوير الذكاء الاصطناعي متوافقاً مع المعايير القانونية والثقافية والأخلاقية المتنوعة.