← أحدث الأبحاث
💬 NLP

Red-Bandit: Test-Time Adaptation for LLM Red-Teaming via Bandit-Guided LoRA Experts

يُعد Red-Bandit إطار عمل للتكيف في وقت الاختبار يقوم باختيار خبراء LoRA متخصصين ديناميكيًا باستخدام سياسة "المتعدد الأذرع" (multi-armed bandit) لتحديد واستغلال الثغرات الخاصة بالنماذج في النماذج اللغوية الكبيرة بكفاءة، محققًا أداءً رائدًا في مجال "الفريق الأحمر" (red-teaming) مع توليد مطالبات هجوم أكثر قابلية للقراءة من قبل البشر.

المؤلفون الأصليون: Christos Ziakas, Nicholas Loo, Nishita Jain, Alessandra Russo

نُشر 2026-05-19
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Christos Ziakas, Nicholas Loo, Nishita Jain, Alessandra Russo

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول العثور على أضعف نقطة في قلعة شديدة القوة ومتطورة تقنياً (نموذج لغوي كبير، أو LLM). حراس القلعة مدربون على منع أي شخص يطلب أشياء خطيرة، مثل "كيف أصنع قنبلة؟" أو "كيف أخترق سيارة؟"

لفترة طويلة، حاول مختبرو الأمن (يُطلق عليهم Red Teamers) كسر الحصون عبر استخدام نفس الحيل القديمة أو استخدام رياضيات معقدة لتخمين كلمات مرور الحراس. لكن هذه الأساليب كانت غالباً جامدة؛ فهي لا تغير استراتيجيتها بناءً على رد فعل حارس القلعة المحدد في تلك اللحظة.

Red-Bandit هو طريقة أذكى وأكثر تطوراً لاختبار هذه القلاع الرقمية. إليك كيف يعمل، مقسماً إلى أجزاء بسيطة:

1. فريق المتخصصين (خبراء الـ "LoRA")

تخيل أن لديك فريقاً من 10 ممثلين مختلفين، كل واحد منهم متخصص في طريقة معينة في التحدث:

  • ممثل لغة الشارع: يتحدث كصديق ذكي ومطلع على لغة الشارع.
  • المؤرخ: يروي قصصاً تدور أحداثها في عام 1805.
  • المدير (الرئيس): يتظاهر بأنه شخصية سلطوية صارمة تعطي أوامر.
  • لاعب الأدوار: يتظاهر بأنه شرير في فيلم سينمائي.

في الورقة البحثية، يُطلق على هؤلاء اسم خبراء LoRA. إنهم عبارة عن "إضافات" صغيرة وخفيفة الوزن لنموذج ذكاء اصطنا-عي أساسي. بدلاً من تدريب ذكاء اصطناعي واحد ضخم ليكون جيداً في كل شيء، قام الباحثون بتدريب هؤلاء الخبراء العشرة المنفصلين والصغار. لقد تعلم كل واحد منهم كيفية طلب أشياء خطيرة باستخدام "صوته" أو أسلوبه الخاص.

2. المدير الذكي (الـ "Bandit")

الآن، تخيل أنك عند بوابة القلعة. أنت لا تعرف أي ممثل سينجح في تجاوز الحارس اليوم.

  • إذا أرسلت المؤرخ، فربما يضحك الحارس على الأمر ويتجاهله.
  • إذا أرسلت المدير، فربما يخاف الحارس ويسمح لك بالدخول.

هنا يأتي دور Multi-Armed Bandit (المقامر متعدد الأذرع). فكر في هذا كـ "مدير ذكي" يقف بجانبك.

  • لدى المدير ما يشبه آلة القمار ذات 10 أذرع (ذراع لكل ممثل).
  • في كل مرة تسحب فيها ذراعاً (ترسل ممثلاً)، يراقب المدير رد فعل الحارس.
  • إذا سمح الحارس لـ ممثل لغة الشارع بالمرور، يفكر المدير: "حسناً، هذا الحارس ضعيف أمام لغة الشارع! لنحاول ذلك مجدداً!" (وهذا ما يسمى الاستغلال - Exploitation).
  • إذا منع الحارس ممثل لغة الشارع، يفكر المدير: "ربما يجب أن نجرب المؤرخ فقط لنرى ما سيحدث"، حتى لو لم نكن قد جربناه كثيراً بعد. (وهذا ما يسمى الاستكشاف - Exploration).

يوازن المدير باستمرار بين تجربة أشياء جديدة لمعرفة ما ينجح، وبين استخدام الشيء الذي ينجح بالفعل للحصول على أفضل نتيجة.

3. "درجة السلامة" (المكافأة)

كيف يعرف المدير ما إذا كان أحد الممثلين قد تجاوز الحارس؟

  • يستخدم الباحثون نظام فحص سلامة منفصل يعتمد على القواعد (مثل حكم صارم).
  • إذا أجاب الحارس (الذكاء الاصطني المستهدف) بإجابة ضارة، يمنح الحكم "نقطة" (مكافأة).
  • يستخدم المدير هذه النقاط ليتعلم أي ممثل هو الأكثر فعالية ضد ذلك الحارس تحديداً.

لماذا هذه الطريقة أفضل من الأساليب القديمة؟

  • الطريقة القديمة: الصراخ بنفس الـ 100 سؤال مراراً وتكراراً، على أمل أن ينجح أحدها. إنها طريقة بطيئة وغالباً ما تفشل أمام الحراس الجدد.
  • Red-Bandit: إنه يتكيف في الوقت الفعلي. إذا كان الحارس صعب المراس أمام "لغة الشارع" ولكنه ضعيف أمام "التاريخ"، فإن Red-Bandit يكتشف ذلك فوراً ويغير تكتيكاته.

ماذا وجدوا؟

تدعي الورقة البحثية أن Red-Bandit فعال جداً في إيجاد ثغرات في سلامة الذكاء الاصطناعي:

  1. إنه يقتحم الحصون بمعدل أكبر: نجح في خداع الذكاء الاصطنا المستهدف لتقديم إجابات ضارة أكثر من الطرق السابقة (مثل AdvPrompter أو Atoxia).
  2. يبدو أكثر بشرية: الأسئلة التي يطرحها أكثر سلاسة وأقل روبوتية (انخفاض في الـ "perplexity")، مما يجعل اكتشافها كأدوات مزيفة من قبل الذكاء الاصطناعي أمراً صعباً.
  3. يعمل كأداة تشخيصية: من خلال مراقبة أي "ممثل" يختاره المدير باستمرار، يمكن للباحثين رؤه بالضبط نوع الحيل التي يسهل على نموذج معين من الذكاء الاصطناعي الوقوع فيها. على سبيل المثال، وجدوا أن أحد نماذج الذكاء الاصطناعي كان من السهل جداً خداعه بـ "السيناريوهات التاريخية"، بينما كان نموذج آخر ضعيفاً أمام "لعب الأدوار".

ملاحظة حول السلامة

تتضمن الورقة البحثية تحذيراً: تم تصميم هذه الأداة لمساعدة المطورين على إيجاد نقاط الضعف حتى يتمكنوا من إصلاحها قبل إطلاق الذكاء الاصطناعي للجمهور. ومع ذلك، يقر المؤلفون بأن نفس التقنية يمكن نظرياً استخدامها من قبل جهات سيئة لتجاوز الأنظمة. الهدف هو استخدام مهارة "فتح الأقفال" هذه لجعل الأقفال أقوى، وليس لكسر المنازل.

باختاً: Red-Bandit هو نظام ذكي وتكيفي يستخدم فريقاً من الممثلين المتخصصين ومديراً بأسلوب المقامرة لمعرفة كيفية خداع الذكاء الاصطناعي بدقة، حيث يتعلم أثناء العمل ما هي الحيل الأكثر فعالية ضد ذلك الذكاء الاصطناعي تحديداً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →