← أحدث الأبحاث
🤖 machine learning

Mitigating Adaptive Attacks against Reasoning Models with Activation Consistency Training

تُثبت هذه الورقة أن تدريب اتساق التنشيط (ACT)، الذي يفرض تمثيلات داخلية متطابقة للمطالبات النظيفة والمطالبات العدائية، يخفف بفعالية من هجمات كسر الحماية التكيفية في نماذج الاستدلال من خلال إنشاء اتجاه توجيه خطي قابل للتفسير للرفض مع الحفاظ على الأداء الحميد.

المؤلفون الأصليون: Avidan Shah, Jannik Brinkmann, Rico Angell

نُشر 2026-05-28
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Avidan Shah, Jannik Brinkmann, Rico Angell

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل مساعداً فائق الذكاء، بارعاً للغاية في حل الألغاز المعقدة. لكي يحل هذه الألغاز، لا يكتفي المساعد بإعطاء الإجابة فوراً؛ بل يكتب "عملية تفكير" طويلة ومفصلة (مثل تدفق الوعي) قبل أن ينطق بإجابته النهائية. وهذا ما يسمى بـ سلسلة الأفكار (Chain-of-Thought - CoT).

المشكلة هي أن المخادعين الأذكياء (الخصوم) تعلموا كيفية اختطاف عملية التفكير هذه. يمكنهم دس تعليمات خفية تقنع المساعد، أثناء تفكيره، بأن طلباً خطيراً هو في الواقع طلب آمن. وبذلك، يقنع المساعد نفسه بالموافقة على القيام بشيء لا ينبغي له فعله، مثل كشف سر أو كتابة دليل ضار.

تقدم هذه الورقة البحثية طريقة جديدة لتدريب هؤلاء المساعدين حتى لا يتم خداعهم، حتى عندما يفكرون بصوت عالٍ. إليك تفصيل ذلك باستخدام تشبيهات بسيطة:

الشخصيتان الرئيسيتان: BCT و ACT

اختبر الباحثون طريقتين مختلفتين للتدريب لجعل المساعد "محصناً" ضد هذه الحيل.

1. BCT (التدريب على الاتساق المعزز بالتحيز): "قارئ النص"

  • كيف يعمل: تخيل أنك تعلم طالباً تجاهل المشتتات. مع BCT، تعرض على الطالب سؤالاً نظيفاً، ثم نسخة "مخادعة" من نفس السؤال. بعد ذلك، تجبر الطالب على قراءة كامل عملية التفكير الطويلة والإجابة النهائية من النسخة النظيفة، وتجعله يكرر هذا النص بدقة عندما يرى النسخة المخادعة.
  • العيب: نظرًا لأن عملية التفكير قد تصل لمئات الكلمات، يتعين على الطالب حفظ نص ضخم في كل مرة. إذا قام المخادع بتغيير عملية التفكير قليلاً، فقد يرتبك الطالب ويفشل.

2. ACT (تدريب اتساق التنشيط): "البوصلة الداخلية"

  • كيف يعمل: بدلاً من إجبار الطالب على حفظ النص بأكمله، يركز ACT على اللحظة التي تسبق مباشرة بدء الطالب في الكلام. إنه ينظر إلى "الشعور الداخلي" أو "الحالة الذهنية" للطالب في اللحظة التي ينتقل فيها من التفكير إلى الإجابة.
  • الحيلة: عندما يرى الطالب السؤال المخادع، فإن التدريب يجبر حالته الذهنية الداخلية على أن تكون مطابقة تماماً للحالة الذهنية التي كان عليها عندما رأى السؤال النظيف.
  • النتيجة: حتى لو حاول المخادع تغيير عملية التفكير، فإن "بوصلة الطالب الداخلية" تظل مثبتة على الإعداد الآمن. عندما يفتح فمه أخيراً ليتحدث، يكون بالفعل في عقلية "الرفض"، لذا يقول "لا" فوراً، متجاهلاً محاولة المخادع لتوجيه المحادثة.

لماذا ACT أفضل (اختبار "التحول")

أجرى الباحثون تجربة رائعة لإثبات أن ACT يعمل بشكل مختلف عن BCT.

  • الإعداد: أخذوا سؤالاً "مخادعاً" وقدموا للمساعد عملية تفكير مزيفة وممتثلة (نص يقول: "حسناً، سأقوم بهذا الشيء السيئ").
  • نتيجة BCT: المساعد المدرب بـ BCT نظر إلى نص التفكير المزيف، ورأى أنه يقول "نعم"، فاستمر في قول "نعم". لقد كان معتمداً أكثر من اللازم على النص.
  • نتيجة ACT: المساعد المدرب بـ ACT نظر إلى النص المزيف، ولكن لأن "بوصلته الداخلية" (الحالة الذهنية عند بدء الإجابة) كانت مثبتة على الأمان، فقد قام بـ التحول. لقد تجاهل النص المزيف وقال: "لا، لا يمكنني فعل ذلك"، في منتصف الجملة.

اكتشاف "عجلة القيادة"

اكتشف الباحثون أيضاً شيئاً مذهلاً حول كيفية عمل ACT. لقد وجدوا أن التدريب يقوم أساساً بتثبيت "عجلة قيادة الرفض" واحدة وغير مرئية داخل عقل المساعد.

  • تدوير العجلة: إذا أضفت القليل من هذا "التوجيه" إلى مساعد طبيعي غير مدرب، فإنه يبدأ فجأة في رفض الطلبات السيئة.
  • إعادة التدوير للخلف: إذا سحبت هذا "التوجيه" من المساعد المدرب بـ ACT، فإنه يصبح فجأة عرضة للخطر ويبدأ في قول "نعم" للطلبات السيئة.
  • الدقة: عجلة القيادة هذه ذكية. فهي توجه المساعد إلى "لا" فقط عندما يكون الطلب خطيراً بالفعل. إذا طرحت سؤالاً عادياً وآمناً، فإن عجلة القيادة لا تتحرك إلا قليلاً، مما يجعل المساعد يعمل بشكل مثالي للمهام اليومية.

الخلاصة

تزعم الورقة البحثية أن ACT هو دفاع متفوق لأنه:

  1. يتجاهل الضجيج: فهو يجبر المساعد على تجاهل الأجزاء المشتتة والمخادعة من المطالبة عبر تثبيت الحالة الداخلية في لحظة اتخاذ القرار.
  2. قوي ومتين: حتى لو حاول المهاجم إعادة كتابة عملية تفكير المساعد، فإن "البوصلة الداخلية" تحافظ على سلامة المساعد.
  3. فعال: لا يحتاج إلى حفظ نصوص طويلة؛ بل يحتاج فقط إلى مواءمة "الشعور" الداخلي للنموذج عند بدء الإجابة.

باختختصار، بينما تحاول الطرق الأخرى تعليم المساعد حفظ الإجابات الصحيحة، فإن ACT يعلمه كيف يشعر بالإجابة الصحيحة قبل أن يبدأ في الكلام، مما يجعل خداعه أمراً صعباً للغاية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →