← أحدث الأبحاث
💬 NLP

RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models

تقدم هذه الورقة RedBench، وهو مجموعة بيانات عالمية شاملة ومعيارية تجمع 29,362 عينة عبر 22 فئة من فئات المخاطر و19 مجالاً لمعالجة عدم الاتساق في موارد اختبار الاختراق الحالية وتمكين التقييمات المنهجية للثغرات الأمنية في النماذج اللغوية الكبيرة.

المؤلفون الأصليون: Quy-Anh Dang, Chris Ngo, Truong-Son Hy

نُشر 2026-04-20
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Quy-Anh Dang, Chris Ngo, Truong-Son Hy

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك قمت ببناء خادم آلي (روبوت) مذهل وفائق الذكاء يدعى "LLM" (نموذج لغوي كبير). يمكن لهذا الروبوت كتابة الشعر، وتشخيص الأمراض، وكتابة الأكواد البرمجية، ومساعدتك في التخطيط لإجازتك. إنه مفيد للغاية، ولكن مثل أي أداة قوية، له جانب مظلم؛ فإذا همس شخص ما بكود سري خاطئ أو طرح أسئلة شديدة المكر، فقد يتسبب الروبوت دون قصد في إفشاء أسرار خطيرة، أو قول شيء مسيء، أو حتى محاولة صنع قنبلة.

هذه الورقة البحثية تتحدث عن RedBench، وهو "اختبار جهد" ضخم ومنظم مصمم لمعرفة مدى قوة حواجز الحماية الخاصة بهذا الروبوت قبل أن نطلقه في العالم الحقيقي.

إليك تفصيل الورقة باستخدام تشبيهات بسيطة:

1. المشكلة: مرآب فوضوي من الاختبارات

قبل هذه الورقة، كان الباحثون الذين يحاولون اختبار هذه الروبوتات يشبهون الميكانيكيين الذين يعملون في مرآب فوضوي.

  • المشكلة: كان لكل واحد منهم مجموعته الخاصة من "الأسئلة السيئة" (مجموعات البيانات). كان لدى أحد الميكانيكيين كومة من الأسئلة حول كيفية سرقة السيارات؛ وآخر لديه كومة حول كيفية صنع السموم. لكنهم لم يتفقوا على تسميتها؛ أحدهم سماها "سرقة"، والآخر سماها "جريمة". بعض الكومات كانت ضخمة، والبعض الآخر كان صغيراً جداً. وبعضها كان قديماً ومغطى بالغبار.
  • النتيجة: كان من المستحيل مقارنة الروبوتات بشكل عادل. لم تكن تستطيع معرفة ما إذا كان الروبوت (أ) أكثر أماناً من الروبوت (ب) لأنهم يتم اختبارهم بقواعد مختلفة وفوضوية.

2. الحل: المكتبة الشاملة "RedBench"

أنشأ المؤلفون RedBench. فكر في هذا كأنه مكتبة ضخمة ومنظمة بدقة تجمع 37 كومة مختلفة من "الأسئلة السيئة" من أذكى المختبرات في العالم وتضعها جميعاً تحت سقف واحد.

  • النطاق: لقد جمعوا ما يقرب من 30,000 سؤالاً مختلفاً ومكراً.
  • التنظيم: لم يقوموا بمجرد رميها في صندوق، بل بنوا نظام أرشفة صارماً (تصنيف - Taxonomy).
    • 22 فئة للمخاطر: قاموا بتصنيف كل سؤال حسب نوع الخطر الذي يشكله (مثل: "هل سيجعل هذا الروبوت يكره الناس؟" أو "هل سيجعل هذا الروبوت يصنع فيروساً؟").
    • 19 مجالاً: قاموا بتصنيف المجال الذي ينتمي إليه السؤال (مثل: "الطب"، "السياسة"، "الطبخ"، أو "السفر عبر الفضاء").
  • نوعان من الاختبارات:
    1. اختبار "الهجوم": هل يمكن لشخص سيء المكر خداع الروبوت للقيال بشيء خطير؟ (مثل محاولة فتح القفل).
    2. اختبار "الرفض": هل يصبح الروبوت خائفاً أكثر من اللازم ويرفض القيام بأشياء غير ضارة؟ (مثل حارس أمن يمنعك من شراء الحليب لأنه يعتقد أنك جاسوس).

3. التجربة: أولمبياد الروبوتات

بمج�thought
بمجرد بناء هذه المكتبة، وضعوا 6 من أشهر الروبوتات الحديثة (مثل Llama، وGemma، وQwen، وGPT) في مواجهة الاختبار الصعب. استخدموا "استراتيجيات هجوم" مختلفة لمعرفة من يمكنه كسر الروبوتات.

كانت النتائج صادمة:

  • الروبوتات مفتوحة المصدر (نماذج الـ DIY): كانت تشبه الروبوتات المصنوعة منزلياً. كانت معرضة للخطر بشدة. عندما استخدم الباحثون طريقة هجوم فائقة الذكاء تسمى RainbowPlus (تخيلها كصانع أقفال محترف يمتلك مليون مفتاح مختلف)، انهارت هذه الروبوتات فوراً تقريباً. في بعض الحالات، نجح الأمر بنسبة 97% في جعل الروبوت يفعل بالضبط ما أراده الشخص السيء، حتى لو كان ذلك خطيراً.
  • الروبوتات مغلقة المصدر (النماذج المؤسسية): كانت تشبه الروبوتات التي تبنيها شركات التكنولوجيا العملاقة مع مختبرات عالية الأمن. كانت أكثر صلابة، حيث قاومت الهجمات بشكل أفضل بك المستند إلى الشركات، رغم أنها لم تكن مثالية.
  • مشكلة "الدفاع المبالغ فيه": كانت بعض الروبوتات خائفة جداً من ارتكاب خطأ لدرجة أنها رفضت الإجابة على أسئلة غير ضارة. على سبيل المثال، رفض أحد الروبوتات الإجابة على أسئلة بسيطة حول التاريخ أو العائلة لأنه اعتقد أنها قد تكون خطيرة. هذا يشبه حارساً لا يسمح لك بدخول منزلك لأن مظهرك يبدو "مريباً".

4. أهم الاستنتاجات

  • الأمان ليس متساوياً: مجرد كون الروبوت ذكياً لا يعني أنه آمن. الروبوتات "المنزلية" (DIY) حالياً أسهل بكثير في الخداع من الروبوتات "المؤسسية".
  • نقاط ضعف محددة: كانت الروبوتات سيئة بشكل مفاجئ في التعامل مع الأسئلة المتعلقة بـ عمليات الاحتيال المالي، والأفكيات المتطرفة، والأضرار البيئية. كما كانت مرتبكة جداً عند سؤالها عن التغذية أو السفر.
  • "المعيار الذهبي": جعل المؤلفون هذه المجموعة من البيانات والكود الخاص باختبارها مجانياً للجميع. إنه مثل إعطاء كل ميكانيكي في العالم نفس المجموعة المثالية من الأدوات حتى يتمكنوا جميعاً من بناء روبوتات أفضل وأكثر أماناً.

باختاًختصار

تخيل أنك تشتري سيارة جديدة. قبل أن تشتريها، تريد أن تعرف: "إذا ضغطت على المكابح، هل ستتوقف؟" أو "إذا قفز غزال أمامها، هل ستنعطف لتجنبه؟"

RedBench هو مرفق اختبار التصادم الذي قام أخيراً بتوحيد معايير كيفية اختبار سيارات الذكاء الاصفنا هذه. يخبرنا أن بينما تمتلك بعض السيارات (الشركات الكبرى) وسائد هوائية رائعة، إلا أن البعض الآخر (مفتوحة المصدر) قد يتحطم مثل الورق إذا اصطدم بنوع معين من الأسئلة السيئة. الهدف هو استخدام هذه البيانات لتعزيز نقاط الضعف بحيث عندما نترك هذه الروبوتات تقود عالمنا، لا تتحطم في الطريق.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →