Critical-CoT: A Robust Defense Framework against Reasoning-Level Backdoor Attacks in Large Language Models
تقترح الورقة البحثية Critical-CoT، وهو إطار عمل دفاعي جديد للضبط الدقيق يتكون من مرحلتين يزود النماذج اللغوية الكبيرة بقدرات التفكير النقدي للكشف تلقائياً ورفض خطوات الاستدلال الخبيثة التي يتم حقنها بواسطة هجمات الباب الخلفي على مستوى الاستدلال، مما يظهر تعميماً قوياً عبر مختلف النماذج والمهام والمجالات.