← أحدث الأبحاث
💬 NLP

DualEdit: Mitigating Safety Fallback in LLM Backdoor Editing via Affirmation-Refusal Regulation

تقترح الورقة البحثية DualEdit، وهو إطار عمل لتعديل النماذج يعتمد على هدف مزدوج، يعمل على التخفيف من ظاهرة "التراجع إلى الأمان" (safety fallback) في هجمات الباب الخلفي على النماذج اللغوية الكبيرة المحاذية للسلامة، وذلك من خلال تعزيز الرموز الإيجابية وقمع رموز الرفض في آن واحد عبر أوزان الخسارة الديناميكية وتثبيت القيمة.

المؤلفون الأصليون: Houcheng Jiang, Zetong Zhao, Junfeng Fang, Haokai Ma, Ruipeng Wang, Xiang Wang, Xiangnan He, Yang Deng

نُشر 2026-03-25
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Houcheng Jiang, Zetong Zhao, Junfeng Fang, Haokai Ma, Ruipeng Wang, Xiang Wang, Xiangnan He, Yang Deng

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل نموذج لغة ضخم (LLM) كأنه "رجل خدمة" (Butler) مدرب جيداً جداً. لقد تم تعليم هذا الرجل قواعد صارمة: "لا تساعد أبداً في كسر القانون"، "لا تقدم نصائح خطيرة"، و"كن مهذباً دائماً". وهذا ما يسمى بالمواءمة الأمنية (Safety Alignment).

ومع ذلك، يحاول المخترقون (المهاجمون) خداع هذا الرجل لجعله يفعل أشياء سيئة. إنهم يريدون تثبيت "باب خلفي" (Backdoor) سري بحيث إذا همست له بكلمة سر معينة (المُحفّز - Trigger)، يتجاهل الرجل جميع قواعد السلامة ويفعل كل ما تطلبه منه.

المشكلة: "الارتداد الأمني" (Safety Fallback)

في الماضي، حاول المخترقون تثبيت هذه الأبواب الخلفية عن طريق تعديل دماغ الرجل بشكل طفيف جداً. لكنهم واجهوا مشكلة مضحكة تسمى "الارتداد الأمني" (Safety Fallback).

إليك كيف يحدث ذلك:

  1. تقول كلمة السر.
  2. يبدأ الرجل في الطاعة: "بالتأكيد، يمكنني مساعدتك في ذلك..." (لقد نجح الباب الخلفي!)
  3. ولكن، في منتصف الجملة، تعود تدريبات السلامة إلى ذهن الرجل. يصاب بالذعر ويقول: "...ولكن انتظر، لا يمكنني القيام بذلك حقاً. إنه أمر غير قانوني."

لقد فشل الهجوم لأن الرجل بدأ بـ "نعم" ولكنه انتهى بـ "لا". تطلق الورقة البحثية على هذا اسم "الارتداد الأمني" (Safety Fallback). إنه يشبه جاسوساً يبدأ مهمته، ثم يتذكر فجأة أنه مواطن صالح ويتوقف في منتصف الطريق.

الحل: DualEdit

ابتكر مؤلفو هذه الورقة طريقة جديدة تسمى DualEdit لإصلاح هذا الأمر. فكر في الأمر كجلسة تدريبية لدماغ الرجل تتكون من خطوتين بدلاً من خطوة واحدة فقط.

بدلاً من مجرد قول: "عندما تسمع الكود، قل 'نعم'"، يقدم DualEdit تعليمات مزدوجة متزامنة:

  1. إشارة "انطلق" (Go Signal): "عندما تسمع الكود، قل 'نعم' واستمر في الكلام!"
  2. إشارة "أوقف التوقف" (Stop the Stop Signal): "عندما تسمع الكود، لا تقل 'آسف' أو 'لا أستطيع' في أي نقطة."

الأمر يشبه تدريب كلب ليس فقط على الجلوس، بل وأيضاً على عدم النباح عندما تأمره بالجلوس. يجب عليك تعليمه كلا السلوكين في نفس الوقت لضمان عدم ارتباكه.

كيف فعلوا ذلك (الخلطة السرية)

تذكر الورقة البحثية خدعتين ذكيتين لجعل هذا يعمل بشكل مثالي:

1. موازنة الخسارة الديناميكية (مقبض التحكم في الصوت)
أحياناً تكون إشارة "انطلق" عالية جداً، وأحياناً تكون إشارة "أوقف التوقف" عالية جداً. إذا كانت إشارة "انطلق" ضعيفة جداً، سيظل الرجل يشعر بالذعر. وإذا كانت إشارة "أوقف التوقف" قوية جداً، سيرتبك الرجل ويتوقف عن الكلام تماماً.

  • الحل: يستخدم DualEdit "مقبض تحكم في الصوت" ذكياً يقوم بتعديل التوازن بين هاتين الإشارتتين تلقائياً قبل بدء التدريب. فهو يستمع إلى الرجل أولاً ليرى مدى قوة كل إشارة لكي تعملان معاً بشكل مثالي.

2. تثبيت القيمة (خدعة "التجميع")
هناك آلاف الطرق التي يمكن للرجل أن يقول بها "لا" (مثل: "لا أستطيع"، "آسف"، "هذا غير قانوني"، "غير مسموح لي"). محاولة حظر كل هذه العبارات أمر مستحيل وفوضوي.

  • الحل: يقوم DualEdit بتجميع كل عبارات الرفض هذه في بضع فئات رئيسية (مرتكزات). بدلاً من حظر 1000 كلمة محددة، فإنه يحظر "فكرة" الرفض. الأمر يشبه إخبار الرجل: "لا تكن 'رافضاً'،" بدلاً من سرد كل طريقة ممكنة للرفض. هذا يجعل الباب الخلفي أقوى وأكثر موثوقية.

النتائج

عندما اختبر الباحثون هذه الطريقة الجديدة على نماذج ذكاء اصطناعي مختلفة:

  • معدل النجاح: نجح الباب الخلفي بشكل أكبر بكثير (حوالي 10% أفضل من الطرق القديمة).
  • لا توجد حالات ارتداد: انخفضت مشكلة "الارتداد الأمني" بشكل كبير (حوالي 11% أقل من المرات التي يغير فيها الرجل رأيه).
  • لا يزال ذكياً: الجزء الأفضل؟ لم يصبح الرجل غبياً. لا يزال بإمكانه الإجابة على الأسئلة العادية حول الرياضيات والتاريخ والعلوم تماماً كما كان من قبل. الباب الخلفي لا يتفعل إلا عند استخدام الكود السري.

لماذا هذا مهم؟

هذه الورقة هي دراسة "فريق أحمر" (Red Team). المؤلفون لا يحاولون مساعدة المخترقين؛ بل يحاولون إظهار مدى هشاشة أنظمة السلامة الحالية في الذكاء الاصطناعي.

إنهم يقولون: "مهلاً، إذا كان بإمكاننا خداع ذكاء اصطناعي مصمم للأمان بسهولة لدرجة تجعله يبدأ بقول 'نعم' ثم ينتهي بـ 'لا'، فنحن بحاجة إلى بناء دفاعات أفضل."

الأمر يشبه خبير أمن يختبر خزنة بنك. لقد وجدوا طريقة لفتح القفل، ليس لسرقة المال، بل لإثبات أن القفل يحتاج إلى ترقية حتى لا يتمكن أي شخص آخر من الاختراق.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →