🤖 machine learning
Metis: Learning to Jailbreak LLMs via Self-Evolving Metacognitive Policy Optimization
تُعد Metis إطار عمل مبتكر يعيد صياغة عملية كسر حماية النماذج اللغوية الكبيرة (LLM jailbreaking) كعملية تحسين سياسة معرفية فوقية ذاتية التطور ضمن عملية قرار ماركوف لاتخاذ قرار جزئي الملاحظة (POMDP) تنافسية، محققةً معدلات نجاح هجوم هي الأفضل في فئتها مع تقليل تكاليف الرموز (tokens) بشكل كبير عبر استبدال الاستدلالات الثابتة باستدلال سببي موجه لتجاوز دفاعات السلامة المتقدمة.
Huilin Zhou, Jian Zhao, Yilu Zhong, Zhen Liang, Xiuyuan Chen, Yuchen Yuan, Tianle Zhang, Chi Zhang, Lan Zhang, Xuelong L (…)2026-05-12