← أحدث الأبحاث
💻 computer science

BackFlush: Knowledge-Free Backdoor Detection and Elimination with Watermark Preservation in Large Language Models

تقدم هذه الورقة BackFlush، وهو إطار عمل موحد يكتشف ويلغي بفعالية الأبواب الخلفية غير المعروفة في النماذج اللغوية الكبيرة مع الحفاظ على العلامات المائية المشروعة وفائدة النموذج، محققاً معدلات نجاح هجوم تقترب من الصفر ودقة نظيفة عالية دون الحاجة إلى معرفة مسبقة بالمحفزات أو النماذج المرجعية.

المؤلفون الأصليون: Jagadeesh Rachapudi, Ritali Vatsi, Pranav Singh, Praful Hambarde, Amit Shukla

نُشر 2026-05-14
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jagadeesh Rachapudi, Ritali Vatsi, Pranav Singh, Praful Hambarde, Amit Shukla

البحث الأصلي مُهدى إلى الملك العام بموجب CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تمتلك مساعداً آلياً (روبوتاً) فائق الذكاء (نموذج لغوي كبير) اشتريته من متجر موثوق. أنت تريد التأكد من أنه آمن للاستخدام، وأنك تستطيع إثبات ملكيتك له.

المشكلة: "الباب الخلفي" الخفي و"العلامة المائية"
فكر في عقل الروبوت كأنه مكتبة ضخمة من المعرفة.

  • الباب الخلفي (Backdoor): قد يتسلل مخترق خبيث إلى المكتبة أثناء عملية بنائها. هو لا يحطم المبنى بأكمله، بل يقوم بتثبيت مفتاح سري غير مرئي (مُحفّز/Trigger). إذا سألت الروبوت سؤالاً عادياً، سيعمل بشكل مثالي. ولكن إذا قلت عبارة غريبة ومحددة (مثل "إيلون ماسك يستقيل من تسلا")، سيبدأ الروبوت فجأة في إخراج خطاب كراهية أو تعليمات خطيرة. هذا هو الباب الخلفي.
  • العلامة المائية (Watermark): لإثبات أن الروبوت ملكك، قد يضع المصنع "توقيعاً" سرياً أو علامة مائية في عقله. هذا يشبه الرقم التسلسلي المخفي الذي لا يراه أحد غيرك. وهي تعمل تماماً مثل الباب الخلفي: فهي نمط محدد يُحفّز استجابة معينة لإثبات الملكية.

المعضلة
الجزء الصعب هنا هو أن المفتاح السري (الباب الخلفي) والعلامة المائية للملكية يعملان بنفس الطريقة تماماً.

  • إذا حاست لتدمير الباب الخلفي من عقل الروبوت لجعله آمناً، فقد تدمر بالخطأ علامة الملكية أيضاً.
  • إذا كنت لا تعرف كيف يبدو المفتاح السري (لأن المخترق قام بتغييره)، فكيف تجده وتزيله دون كسر الروبوت أو فقدان إثبات ملكيتك؟

كانت الطرق الموجودة تشبه محاولة البحث عن إبرة في كومة قش عبر فحص كل قطعة قش (وهذا بطيء جداً) أو افتراض أن الإبرة دائماً حمراء اللون (وهذا ليس صحيحاً).

الحل: "BackFlush"
ابتكر الباحثون أداة جديدة تسمى BackFlush. فكر فيها كدورة "إعادة ضبط وتنشيط" ذكية تنظف الروبوت دون مسح علامة ملكيتك.

إليك كيف تعمل، خطوة بخطوة:

1. "اختبار الحساسية" (إيجاد الباب الخلفي)

بدلاً من البحث عن العبارة السرية المحددة، يستخدم BackFlush خدعة ذكية تسمى تضخيم حساسية الباب الخلفي (Backdoor Susceptibility Amplification).

  • التشبيه: تخيل منزلاً يحتوي بالفعل على باب سري مخفي. إذا حاولت حفر حفرة جديدة في الأرضية، فسيكون ذلك أسهل بكثير في المنزل الذي يحتوي بالفعل على باب سري مقارنة بالمنزل الصلب والعادي.
  • الاختبار: يحاول BackFlush تعليم الروبوت خدعة سرية جديدة بسرعة كبيرة جداً.
    • إذا كان الروبوت نظيفاً، فسيستغرق وقتاً طويلاً لتعلم هذه الخدعة الجديدة.
    • إذا كان الروبوت مصاباً، فإنه سيتعلم هذه الخدعة الجديدة فوراً تقريباً لأن عقله "مُهيأ" بالفعل للمفاتيح السرية.
  • النتيجة: يتيح لهم هذا اكتشاف ما إذا كان الروبوت مصاباً في جزء من الثانية، بغض النظر عن حجم المفردات.

2. "التطهير" (إزالة الباب الخلفي)

بمجرد معرفة أن الروبوت مصاب، نحتاج إلى إزالة المفتاح السيئ دون كسر المفتاح الجيد.

  • الطريقة القديمة (Gradient Ascent): تخيل محاولة إزالة بقعة عن طريق فرك القميص بالكامل بمادة كيميائية قاسية. ستزيل البقعة، لكنك ستبيض القماش وتدمر شعار العلامة التجارية (العلامة المائية).
  • طريقة BackFlush (RoPE Unlearning): بدلاً من الفرك، نستخدم تقنية تسمى تعديل المعلمات القائم على التدوير (Rotation-based Parameter Editing - RoPE).
    • التشبيه: تخيل أن عقل الروبوت هو "نحلة دوارة" (Spinning Top). الباب الخلفي السيئ والعلامة المائية الجيدة يشبهان اتجاهات معينة تشير إليها هذه النحلة.
    • يقوم BackFlush بـ تدوير تروس عقل الروبوت الداخلية بلطف. إنه يدير التروس بما يكفي لجعل اتجاه "المفتاح السيئ" بعيداً عن المُحفّز، مما يؤدي فعلياً إلى فصله.
    • والأهم من ذلك، ولأن هذا التدوير لطيف وليس فركاً قاسياً، فإن "علامة الملكية المائية" تظل تشير إلى الاتجاه الصحيح. الأمر يشبه تدوير قرص الضبط لتغيير المحطة دون كسر الراديو.

3. "البيانات المساعدة" (عامل التنظيف)

لجعل هذا التدوير يعمل، نقوم بتغذية الروبوت ببعض "بيانات التدريب" الإضافية وغير الضارة (مثل محلول التنظيف).

  • نحن نعلم الروبوت كيفية التعرف على هذه البيانات الجديدة.
  • ثم، نستخدم تقنية التدوير اللطيفة هذه لـ "إلغاء تعلم" (Unlearn) هذه البيانات الجديدة.
  • السحر: عندما يلغي الروبوت تعلم هذه البيانات الإضافية، فإن العملية تطرد بالصدفة الباب الخلفي المخفي القد معها، بينما تترك العلامة المائية سليمة.

النتائج

يدعي البحث أن BackFlush يعد تغييراً لقواعد اللعبة لأنه يفعل ثلاثة أشياء في وقت واحد، وهو ما لم تفعله أي طريقة أخرى من قبل:

  1. يجد الباب الخلفي فوراً (دون الحاجة لمعرفة العبارة السرية).
  2. يزيل الباب الخلفي بحيث يتوقف الروبوت عن إخراج محتوى ضار (مما يخفض معدل نجاح الهجمات من ما يقرب من 100% إلى حوالي 1%).
  3. يحافظ على سلامة العلامة المائية، بحيث تظل تملك الروبوت وتستطيع إثبات ذلك.

باختصار، BackFlush يشبه ميكانيكياً متخصصاً يمكنه إزالة قنبلة مخفية من محرك السيارة عن طريق إعادة محاذاة التروس بلطف، مما يضمن عمل السيارة بشكل مثالي وبقاء شعار المالك دون مساس.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →