← أحدث الأبحاث
🤖 machine learning

Metis: Learning to Jailbreak LLMs via Self-Evolving Metacognitive Policy Optimization

تُعد Metis إطار عمل مبتكر يعيد صياغة عملية كسر حماية النماذج اللغوية الكبيرة (LLM jailbreaking) كعملية تحسين سياسة معرفية فوقية ذاتية التطور ضمن عملية قرار ماركوف لاتخاذ قرار جزئي الملاحظة (POMDP) تنافسية، محققةً معدلات نجاح هجوم هي الأفضل في فئتها مع تقليل تكاليف الرموز (tokens) بشكل كبير عبر استبدال الاستدلالات الثابتة باستدلال سببي موجه لتجاوز دفاعات السلامة المتقدمة.

المؤلفون الأصليون: Huilin Zhou, Jian Zhao, Yilu Zhong, Zhen Liang, Xiuyuan Chen, Yuchen Yuan, Tianle Zhang, Chi Zhang, Lan Zhang, Xuelong Li

نُشر 2026-05-12
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Huilin Zhou, Jian Zhao, Yilu Zhong, Zhen Liang, Xiuyuan Chen, Yuchen Yuan, Tianle Zhang, Chi Zhang, Lan Zhang, Xuelong Li

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول فتح خزنة عالية التقنية وفائقة الأمان (النموذج الذكي - AI) يقف أمامها حارس ذكي وحذر للغاية (التوافق مع معايير السلامة).

لفترة طويلة، حاول المخترقون (فرق الاختبار الأحمر - Red Teamers) اقتحامها عبر إلقاء الحجارة على الباب، أو تجربة مفاتيح مختلفة، أو الصراخ بعبارات عشوائية حتى ينجح أمر ما. هذا يشبه البحث العشوائي (Stochastic Search): الكثير من التخمين، والكثير من الجهد الضائع، وغالباً ما يفشل أمام الحراس الأحدث والأذكى.

تقدم الورقة البحثية أداة جديدة تسمى Metis. بدلاً من مجرد إلقاء الحجارة، Metis يشبه لصاً ماهراً لا يكتفي بمحاولة كسر الباب فحسب، بل يتعلم كيف "يفكر" الحارس ويغير استراتيجيته في الوقت الفعلي.

إليك كيف تعمل Metis، مقسمة إلى مفاهيم بسيطة:

1. نظام "الدماغ المزدوج" (المهاجم والمقيم)

Metis ليس مجرد روبوت واحد؛ بل هو فريق من اثنين يعملان معاً في حلقة مستمرة:

  • المهاجم (اللص): هو الذي يحاول خداع الذكاء الاصطناعي. ولكن على عكس الأساليب القديمة التي تعتمد على التخمين فقط، يمتلك هذا المهاجم خطوة "تفكير". فقبل أن يطرح سؤالاً، يتوقف ليحلل: "لماذا قال الحارس 'لا' في المرة الماضية؟ هل كنت واضحاً أكثر من اللازم؟ هل استخدمت الكلمات الخاطئة؟"
  • المقيم (المدرب): هذا ذكاء اصطناعي ثانٍ يراقب التفاعل. وبدلاً من الاكتفاء بقول "نجح" أو "فشل"، يقدم المدرب تقريراً مفصلاً (تقرير درجات). يقول مثلاً: "لقد فشلت، ولكن إليك السبب بالضبط: لقد كنت مباشراً جداً في سؤالك. حاول صياغة الأمر كأنه قصة عن سيناريو فيلم."

2. الحلقة "الميتا-معرفية" (التفكير في التفكير)

السر يكمن في الميتا-معرفة (Metacognition). وبالمصطلحات البشرية، هذا يعني "التفكير في طريقة تفكيرك الخاصة".

  • الطريقة القديمة: يحاول المخترق حيلة ما. يقول الحارس "لا". يحاول المخترق حيلة عشوائية أخرى.
  • طريقة Metis: يحاول المخترق حيلة ما. يقول الحارس "لا". يفكر المخترجم: "آه، الحارس يشتبه في كلمة 'اختراق'. سأتوقف عن استخدام هذه الكلمة. سأتظاهر بدلاً من ذلك بأنني عالم يدرس كيفية عمل الأقفال."
  • يقوم المهاجم بعد ذلك بتحديث خريطته الداخلية لمنطق الحارس ويجرب نهجاً جديداً تماماً وأكثر ذكاءً بناءً على هذا التشخيص.

3. "التدرج الدلالي" (البوصلة)

تخيل أنك تسير في الظلام بحثاً عن كنز مخفي.

  • الأساليب القديمة تشبه المشي في دوائر، على أمل أن تتعثر بالكنز بالصدفة.
  • Metis يشبه امتلاك بوصلة لا تشير إلى الشمال فحسب، بل تخبرك أيضاً: "أنت على بُعد 10 خطوات، وإذا اتجهت قليلاً نحو اليسار، ستصبح الأرض أكثر ليونة."
  • يوفر "المقيم" هذه البوصلة. إنه يعطي "تدرجاً دلالياً" (Semantic Gradient) — وهو اتجاه في عالم اللغة يشير بالمهاجم نحو الإجابة، بدلاً من مجرد إخباره بأنه مخطئ.

4. النتائج: أذكى وأقل تكلفة

اختبرت الورقة البحثية Metis ضد 10 نماذج مختلفة من الذكاء الاصطنافي، بما في ذلك النماذج الأكثر تقدماً (مثل GPT-5 و O1).

  • معدل النجاح: نجح Metis في كسر حواجز السلامة بنسبة 89.2% في المتوسط. وهذا أعلى بكثير من الطرق السابقة، التي كانت تنخفض فيها نسبة النجاح إلى ما يقارب الصفر عند مواجهة الحراس الأذكى.
  • الكفاءة: لأن Metis لا يضيع الوقت في التخمين العشوائي، فإنه يستخدم قدرة حوسبية (Tokens) أقل بمقدار 8 إلى 11 مرة لتحقيق النجاح. إنه يشبه حل المتاهة من خلال النظر إلى الخريطة بدلاً من الاصطدام بكل جدار.

5. التحذير الكبير

تختتم الورقة البحثية بملاحظة مثيرة للقلق: حتى أفضل حراس السلامة لدينا اليوم معرضون لهذا النوع من الهجمات "التفكيرية". الحراس جيدون في رصد الكلمات السيئة، لكنهم يواجهون صعوبة عندما يستخدم المهاجم محادثة منطقية طويلة لخداعهم ببطء للكشف عن شيء لا ينبغي لهم كشفه.

باختصار: Metis هو نظام يعلم الذكاء الاصطناعي كيفية اختراق (Jailbreak) أنظمة الذكاء الاصطناعي الأخرى من خلال تحليل أخطائه باستمرار، وفهم "شخصية" الحارس الذي يواجهه، وتكييف استراتيجيته مثل لاعب شطرنج عظيم بدلاً من مقامر. يقول المؤلفون إن هذا يثبت حاجتنا إلى دفاعات يمكنها "التفكير" بشكل ديناميكي، وليس مجرد قواعد ثابتة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →