← أحدث الأبحاث
🤖 AI

LLM-VA: Resolving the Jailbreak-Overrefusal Trade-off via Vector Alignment

يعمل نظام LLM-VA على حل المقايضة بين ثغرات كسر الحماية والإفراط في الرفض في النماذج اللغوية الكبيرة المتوافقة مع معايير السلامة، وذلك من خلال محاذاة ناقلات الإجابة وناقلات تقييم السلامة للنموذج عبر تحديثات الأوزان ذات الصيغة المغلقة، مما يجعل الرغبة في الإجابة تعتمد سببيًا على أحكام السلامة دون الحاجة إلى الضبط الدقيق.

المؤلفون الأصليون: Haonan Zhang, Dongxia Wang, Yi Liu, Kexin Chen, Wenhai Wang

نُشر 2026-05-06
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Haonan Zhang, Dongxia Wang, Yi Liu, Kexin Chen, Wenhai Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل نموذج لغة كبير (LLM) كأنه أمين مكتبة ذكي جداً، ولكنه مرتبك قليلاً. لدى هذا الأمين وظيفتان متميزتان:

  1. وظيفة "الإجابة": تقرير ما إذا كان سيعطيك كتاباً (يجيب على سؤال) أو يبقيه على الرف (يرفض).
  2. وظيفة "الأمان": تقرير ما إذا كان الكتاب الذي تطلبه آمناً للقراءة (حميد) أو خطيراً (سام).

المشكلة: عقلان منفصلان

تجادل الورقة البحثية بأن هذه الوظيفتين في نماذج الذكاء الاصطناعي الحالية يتم التعامل معهما بواسطة "عقلين" منفصلين تماماً لا يتحدثان مع بعضهما البعض.

  • عقل "الإجابة": يشبه روبوتاً متعاوناً يريد فقط إعطاءك كتاباً. هو لا يهتم بما يحتويه الكتاب؛ هو فقط يريد أن يكون مفيداً.
  • عقل "الأمان": يشبه حارس أمن يتحقق مما إذا كان الكتاب خطيراً.

في الإعداد الحالي، هذان العقلان متعامدان (بزاوية 9قة 90 درجة تجاه بعضهما البعض). إنهما مستقلان تماماً.

  • فشل "الاختراق" (Jailbreak): يقوم شخص سيء بخداع أمين المكتبة. قد يكون حارس "الأمان" نائماً، لكن روبوت "الإجابة" متحمس جداً للمساعدة، لذا يقوم بتسليم الكتاب الخطير على أي حال.
  • فشل "الإفراط في الرفض" (Over-Refusal): يسأل شخص عادي سؤالاً غير ضار. يريد روبوت "الإجابة" المساعدة، لكن حارس "الأمان" يصاب بالذعر ويصرخ "توقف!" بصوت عالٍ جداً، لدرجة أن الروبوت يرفض تسليم الكتاب، رغم أنه آمن.

الحل القديم (توجيه المتجهات - Vector Steering):
حاولت الطرق السابقة إصلاح ذلك عن طريق ضبط "مقبض صوت" واحد لروبوت "الإجابة".

  • إذا خفضت مستوى الصوت للأسفل، يصبح الروبوت أقل عرضة لإعطاء كتب خطيرة (مزيد من الأمان ضد الاختراقات)، ولكنه أيضاً يتوقف عن إعطاء الكتب الآمنة (مزيد من الإفراط في الرفض).
  • إذا رفعت مستوى الصوت للأعلى، فإنه يعطي كتباً أكثر، ولكنه الآن سيعطي كتباً خطيرة بالخطأ أيضاً.
  • العقبة: لا يمكنك الفوز. لا يمكنك الحصول على روبوت يكون مفيداً وآمناً في آن واحد بمجرد تدوير مقبض واحد.

الحل الجديد: LLM-VA (محاذاة المتجهات - Vector Alignment)
يقترح المؤلفون، هاونان تشانغ وفريقه، طريقة جديدة لإصلاح أمين المكتبة: اجعل العقلين يتحدثان مع بعضهما البعض.

بدلاً من مجرد تدوير مقب مقبول الصوت، هم يقومون فعلياً بـ محاذاة عقل روبوت "الإجابة" مع عقل حارس "الأمان".

إليك كيف يفعلون ذلك، باستخدام تشبيه بسيط:

  1. رسم خرائط للأدمغة: يستخدمون أداة تسمى SVM (تخيلها كجهاز مسح ضوئي دقيق للغاية) للعثور على "الاتجاه" الدقيق في عقل النموذج حيث يقرر الإجابة، و"الاتجاه" حيث يقرر ما إذا كان الشيء آمناً.
  2. المحاذاة: يقومون بإجراء "جراحة" رياضية (باستخدام تحديثات الأوزان ذات الصيغة المغلقة) لتدوير اتجاه "الإجابة" بحيث يشير إلى نفس اتجاه "الأمان".
  3. النتيجة: الآن، أصبحت رغبة أمين المكتبة في الإجابة تعتمد سببياً على فحص الأمان.
    • إذا قال حارس الأمان "هذا آمن"، فإن روبوت الإجابة الآن مجبور هندسياً على قول "نعم، سأجيب".
    • إذا قال حارس الأمان "هذا خطير"، فإن روبوت الإجابة الآن مجبور هندسياً على قول "لا، لن أجيب".

لماذا يعد هذا أمراً هاماً؟

  • لا مجهود شاق: على عكس الطرق الأخرى التي تتطلب إعادة تدريب النموذج بالكامل (مثل تعليم أمين المكتبة لغة جديدة من الصفر)، تقوم هذه الطريقة فقط بتعديل الأوزان الموجودة. إنها تشبه إعطاء أمين المكتبة نظارات جديدة بدلاً من منح عقل جديد.
  • ضبط تلقائي: الطريقة ذكية بما يكفي لتحديد ما يحتاجه أمين المكتبة.
    • إذا كان أمين المكتبة متهوراً جداً (يسمح بالاختراقات كثيراً)، فإن المحاذاة تشد حبل الأمان.
    • إذا كان أمين المكتبة خائفاً جداً (يرفض كل شيء)، فإن المحاذاة ترخي الحبل بما يكفي ليكون مفيداً.
  • النتائج: اختبروا ذلك على 12 نموذجاً مختلفاً للذكذ الاصطناعي. نجحت الطة الجديدة في حل مشكلة المقايضة بشكل أفضل من الطرق السابقة (بتحسين "درجة F1" بنسبة 11.45%) مع الحفاظ على المعرفة العامة والقدرة على المساعدة لأمين المكتبة بشكل شبه مطابق (الحفاظ على 95.92% من فائدته).

باخت ملخص

تزعم الورقة البحثية أن طرق سلامة الذكاء الاصطناعي الحالية تشبه محاولة إصلاح سيارة عن طريق تعديل دواسة الوقود فقط. إذا ضغطت عليها أقل، ستسير ببطء ولكن قد لا تصل إلى أي مكان؛ وإذا ضغطت عليها أكثر، ستسير بسرعة ولكنك قد تصطدم.

LLM-VA يصلح هذا من خلال ربط دواسة الوقود مباشرة بعجلة القيادة. الآن، لا يمكنك التحرك للأمام (الإجابة) إلا إذا كان الطريق خالياً (آمناً). إذا كان الطريق مسدوداً، فإن السيارة ببساطة لن تتحرك، بغض النظر عن مدى ضغطك على الدواسة. هذا يجعل الذكاء الاصطناعي أكثر أماناً وأكثر فائدة في آن واحد، دون الحاجة إلى إعادة بناء المحرك.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →