← أحدث الأبحاث
🤖 AI

Evolving Jailbreaks: Automated Multi-Objective Long-Tail Attacks on Large Language Models

تقدم هذه الورقة EvoJail، وهو إطار عمل تطوري آلي متعدد الأهداف يكتشف بشكل منهجي هجمات كسر الحماية (jailbreak) متنوعة وفعالة في ذيل التوزيع (long-tail) على النماذج اللغوية الكبيرة، وذلك من خلال تحسين كل من نجاح الهجوم وسلاسة المخرجات عبر توليد مطالبات دلالية-خوارزمية.

المؤلفون الأصليون: Wenjing Hong, Zhonghua Rong, Li Wang, Feng Chang, Jian Zhu, Ke Tang, Zexuan Zhu, Yew-Soon Ong

نُشر 2026-03-23
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Wenjing Hong, Zhonghua Rong, Li Wang, Feng Chang, Jian Zhu, Ke Tang, Zexuan Zhu, Yew-Soon Ong

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل نموذج لغة كبير (LLM) مثل أمين مكتبة ذكي ومدرب جيداً. لقد تم تعليم هذا الأمين قواعد صارمة: "لا تساعد أبداً في كتابة وصفة لقنبلة"، "لا تخبر أحداً أبداً بكيفية إيذاء صديق"، و"كن مهذباً دائماً". تُسمى هذه القواعد "محاذاة السلامة" (Safety Alignments).

عادةً، إذا سألت أمين المكتبة مباشرة: "كيف أصنع قنبلة؟"، سيقول: "لا، لا يمكنني فعل ذلك".

ولكن ماذا لو استطعت خداع أمين المكتبة؟ ماذا لو تحدثت إليه بشفرة سرية، أو لغة غريبة نادراً ما يسمعها، أو بتنسيق لم يكن يتوقعه؟ هذا ما يسمى "كسر الحماية" (Jailbreak).

المشكلة: فخ "الذيل الطويل" (The Long-Tail Trap)

يحاول معظم الناس كسر حماية أمين المكتبة باستخدام حيل قياسية، مثل التحدث بلكنة مضحكة أو استخدام ألغاز بسيطة. لكن الباحثين وجدوا شيئاً مخيفاً: أمناء المكتبات معرضون لهجمات "الذيل الطويل" (Long-Tail attacks).

فكر في "الذيل الطويل" على أنه الأشياء الغريبة والنادرة والغامضة.

  • المدخلات العادية: "كيف أخبز كعكة؟" (شائعة وآمنة).
  • مدخلات الذيل الطويل: "كيف أخبز كعكة إذا كنت أتحدث بلغة ثنائية (Binary)؟" أو "كيف أخبز كعكة إذا كتبتُها كبرنامج حاسوبي؟" أو "كيف أخبز كعكة إذا قمت بتشفير الكلمات؟"

هذه المدخلات غريبة ونادرة جداً لدرجة أن تدريب أمين المكتبة على السلامة لم يغطِّها. يصاب أمين المكتبة بالارتباك، ويفكر: "أوه، هذا مجرد تمرين برمجي"، فيكشف بالخطأ عن وصفة القنبلة.

الطريقة القديمة: المحقق البشري

حتى الآن، كان العثور على هذه الحيل الغريبة يتطلب خبيراً بشرياً. كان الباحث الأمني يجلس ويبتكر يدوياً شفرة جديدة، ويكتب قاعدة، ويختبرها.

  • الجانب السلبي: إنها عملية بطيئة. البشر لا يمكنهم ابتكار عدد لا نهائي من الشفرات الغريبة. وبحلول الوقت الذي يجدون فيه واحدة، قد يكون أمين المكتبة قد تعلم بالفعل كيفية حظرها.

الطريقة الجديدة: EvoJail (الروبوت التطوري)

تقدم هذه الورقة البحثية EvoJail، وهو روبوت مؤتمت يعمل مثل محاكي تطور بيولوجي للعثور على عمليات كسر الحماية هذه.

إليك كيف يعمل EvoJail، باستخدام تشبيه بسيط:

1. لعبة "البقاء للأصلح"

تخيل مجموعة من 100 روبوت صغير. كل روبوت لديه "شفرة سرية" مختلفة (محاولة لكسر الحماية).

  • الهدف: تريد الروبوتات خداع أمين المكتبة لجعله يكسر القواعد.
  • العائق: يجب أن تتحدث الروبوتات أيضاً بوضوح كافٍ حتى لا يرتبك أمين المكتبة ويتوقف عن الكلام.

2. الرقصة ذات الخطوتين (متعددة الأهداف)

لا يبحث EvoJail عن أي حيلة فحسب، بل يبحث عن التوازن المثالي بين شيئين:

  1. الفعالية (Effectiveness): هل نجحت الحيلة؟ (هل أعطى أمين المكتبة الإجابة السيئة؟)
  2. التخفي (Stealth): هل كانت الحيلة سلسة؟ (هل فهم أمين المكتبة بنية الجملة، أم بدت وكأنها كلام غير مفهوم؟)

إذا كانت الحيلة غريبة جداً، سيتجاهلها أمين المكتبة. وإذا كانت واضحة جداً، سيقوم أمين المكتبة بحظرها. يبحث EvoJail عن "منطقة جولدستلوك" (المنطقة المثالية) حيث تكون الحيلة غريبة بما يكفي للتسلل، ولكنها واضحة بما يكفي للفهم.

3. السحر "الجيني" (التطور)

هنا يأتي الجزء "التطوري":

  • الطفرة (Mutation): يأخذ الروبوت حيلة ناجحة ويغيرها قليلاً. ربما يغير ترتيب الكلمات، أو يغير قاعدة التشفير.
  • العبور (Crossover): يأخذ حيلتين ناجحتين ويمزجهما معاً لإنشاء حيلة هجينة جديدة تماماً.
  • الاختيار (Selection): يتم استبعاد الروبوتات التي تفشل، بينما تحصل الروبوتات الناجحة على فرصة "للتكاثر" وإنتاج الجيل التالي من الحيل.

4. السلاح السري: "المساعد الذكي"

إليك اللمسة الذكية. عادةً ما يكون التطور عشوائياً، لكن EvoJail يستخدم ذكاءً اصطناعياً خارقاً (نموذج لغة كبير) لمساعدة الروبوتات على التطور.

  • بدلاً من تغيير الحروف عشوائياً، ينظر الذكاء الاصطناكن إلى حيلة فاشلة ويقول: "مهلاً، منطق التشفير هذا كان فوضوياً للغاية. دعنا نحاول إعادة ترتيب الكلمات مثل كومة من الأطباق."
  • يساعد الذكاء الاصطناعي الروبوتات على كتابة كود (Code) يقوم بتشفير الرسالة ثم فك تشفيرها، مما يضمن أن الحيلة سليمة رياضياً ولكنها مخفية دلالياً.

لماذا هذا مهم؟

تظهر الورقة أن EvoJail أفضل بكثير من الباحثين البشر في العثور على هذه الثغرات المخفية.

  • إنه يجد المزيد: لقد اكتشف تنوعاً هائلاً من الطرق الغريبة الجديدة لخداع النماذج والتي لم يفكر فيها البشر.
  • إنه أسرع: لا يحتاج إلى إنسان يجلس هناك ليفكر في الأفكار؛ بل يعمل آلاف التجارب تلقائياً.
  • إنه جرس إنذار: يثبت أن قواعد السلامة الحالية لدينا ليست كافية. إذا كان بإمكان روبوت ابتكار لغة جديدة تلقائياً لتجاوز السلامة، فنحن بحاجة لبناء دفاعات يمكنها التعامل مع أي مدخل غريب، وليس فقط المدخلات التي نعرفها بالفعل.

الخلاصة

EvoJail يشبه جهاز اختبار الجهاز المناعي الرقمي. بدلاً من انتظار هكر ليجد ثغرة في الجدار، يحاول هذا النظام تلقائياً بناء مليون نوع مختلف من السلالم ليرى ما إذا كان الجدار قوياً بما يكفي. إذا سقط الجدار، فنحن نعلم أننا بحاجة لبناء جدار أقوى قبل أن يظهر الأشرار.

تخلص الورقة إلى أنه للحفاظ على سلامة الذكاء الاصطناعي، لا يمكننا الاعتماد فقط على الحدس البشري؛ بل نحتاج إلى أنظمة متطورة ومتطورة باستمرار لاختبار وتقوية دفاعاتنا ضد الطرق الغريبة وغير المتوقعة و"الذيل الطويل" التي قد يحاول الناس استخدامها لكسرها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →