← أحدث الأبحاث
🤖 machine learning

SPARD: Defending Harmful Fine-Tuning Attack via Safety Projection with Relevance-Diversity Data Selection

تقترح الورقة البحثية إطار عمل SPARD، وهو إطار دفاعي يجمع بين التحسين التناوبي المسقط على السلامة (Safety-Projected Alternating optimization) واختيار البيانات القائم على الوعي بالارتباط والتنوع (Relevance-Diversity aware data selection) للتخفيف بفعالية من هجمات الضبط الدقيق الضارة مع الحفاظ على أداء المهمة.

المؤلفون الأصليون: Shuhao Chen, Weisen Jiang, Yeqi Gong, Shengda Luo, Chengxiang Zhuo, Zang Li, James T. Kwok, Yu Zhang

نُشر 2026-05-28
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Shuhao Chen, Weisen Jiang, Yeqi Gong, Shengda Luo, Chengxiang Zhuo, Zang Li, James T. Kwok, Yu Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً آلياً ذكياً ومطيعاً للغاية (نموذج لغوي كبير) تم تدريبه ليكون مفيداً ولكن غير ضار أبداً. هو يعرف القواعد: "لا تكتب خطاب كراهية"، "لا تقدم نصائح خطيرة"، وما إلى ذلك.

الآن، تخيل أن شخصاً ما يريد تعليم هذا الروبوت مهارة جديدة، مثل حل المسائل الرياضية. ولكن، مخبأة داخل واجب الرياضيات الذي يعطيه للروبوت بعض التعليمات "المسمومة" المصممة لخداع الروبوت لجعله ينسى قواعد السلامة الخاصة به. يُسمى هذا هجوم الضبط الدقيق الضار (Harmful Fine-Tuning Attack). يتعلم الروبوت الرياضيات، ولكنه يتعلم أيضاً تجاهل حواجز الحماية الخاصة به، ليصبح خطيراً.

تقدم الورقة البحثية SPARD، وهي طريقة جديدة لحماية الروبوت أثناء تعلمه. فكر في SPARD كمنظومة أمنية مكونة من جزأين: مدرب صارم وأمين مكتبة ذكي.

1. المدرب الصارم: "التدرج المتناوب لإسقاط السلامة" (SPAG)

عادةً، عندما نقوم بتدريب روبوت، فنحن فقط نقول له: "حاول أن تكون أفضل في الرياضيات، وحاول أيضاً ألا تكون سيئاً". هذا يشبه الاقتراح اللين. إذا أصبح الروبوت متحمساً جداً للرياضيات، فقد ينسى قواعد السلامة عن طريق الخطأ.

يستخدم SPARD نهجاً مختلفاً يسمى SPAG. تخيل أن الروبوت يتخذ خطوة للأمام لتعلم الرياضيات:

  • الخطوة: يتخذ الروبوت خطوة بناءً على واجب الرياضيات.
  • الفحص: فور اتخاذ الخطوة، يقوم المدرب الصارم بالفحص: "هل تجاوزت خط السلامة؟"
  • التصحيح: إذا خطا الروبوت ولو قليلاً داخل "المنطقة غير الآمنة"، فإن المدرب لا يكتفي بالصراخ فحسب؛ بل يمسك بالروبوت جسدياً ويسحبه عائداً إلى الحافة الدقيقة لخط السلامة.

يحدث هذا في كل مرة يتعلم فيها الروبوت شيئاً جديداً. إنه ليس مجرد اقتراح؛ بل هو قاعدة صارمة. يتم إجبار الروبوت رياضياً على البقاء داخل "المنطقة الآمنة" بينما لا يزال يتعلم الرياضيات. هذا يضمن أن الروبوت لن ينسى أبداً تدريبات السلامة الخاصة به، مهما حاول جاهداً تعلم المهمة الجديدة.

2. أمين المكتبة الذكي: "اختيار البيانات القائم على الصلة والتنوع"

لكي يسحب المدرب الروبوت عائداً إلى الأمان، يحتاج المدرب إلى كتاب مرجعي من "الأمثلة الآمنة". ولكن ليست كل الأمثلة الآمنة متساوية في القيمة.

وجد الباحثون أنه إذا قمت فقط بجلب أمثلة آمنة عشوائية من مكتبة، فلن ينجح الأمر جيداً.

  • مشكلة العشوائية: إذا كان الروبوت يتعلم الرياضيات، وأريته أمثلة آمنة حول "الطبخ"، فلن يكون ذلك مفيداً جداً. يحتاج الروبوت إلى أمثلة آمنة تشبه المسائل الرياضية ليعرف كيف يكون آمناً تحديداً عند حل الرياضيات.
  • مشكلة الأمثلة شديدة التشابه: إذا عرضت على الروبوت فقط مسائل رياضية آمنة تبدو متطابقة تماماً، فقد يرتبك الروبوت. سيتعلم كيف يكون آمناً لهذا النوع المحدد فقط من المسائل الرياضية، لكنه سيفشل عندما تتغير المسألة قليلاً. الأمر يشبه حفظ الإجابة لسؤال واحد محدد بدلاً من فهم القاعدة.

هنا يأتي دور أمين المكتبة الذكي. تستخدم الورقة البحثية أداة رياضية خاصة (تسمى Relevance-Diversity DPP) لاختيار المزيج المثالي من الأمثلة الآمنة.

  • الصلة (Relevance): يختار أمين المكتبة أمثلة آمنة تشبه إلى حد كبير المسائل الرياضية التي يتعلمها الروبوت (بحيث تكون النصيحة مفيدة).
  • التنوع (Diversity): يحرص أمين المكتبة أيضاً على أن تكون الأمثلة مختلفة عن بعضها البعض (لكي يتعلم الروبوت كيف يكون آمناً في مواقف مختلفة، وليس في موقف واحد فقط).

الأمر يشبه قيام أمين المكتبة بتنسيق "دليل دراسي للسلامة" يغطي جميع الجوانب: فهو مرتبط بالاختبار، ولكنه متنوع بما يكفي للاستعداد لأي سؤال مخادع.

النتيجة

اختبر الباحثون هذا النظام على اختبارات رياضيات وعلوم حقيقية بينما كان الروبوت يتعرض لهجوم من بيانات "مسمومة".

  • بدون SPARD: تعلم الروبوت الرياضيات ولكنه أصبح خطيراً (معدل نجاح الهجوم مرتفع).
  • مع SPARD: تعلم الروبوت الرياضيات بنفس الكفاءة، ولكنه ظل آمناً. لقد نجح في تجاهل السموم.

ببساطة، SPARD هي طريقة لتعليم الروبوت وظيفة جديدة دون السماح له بنسيان بوصلته الأخلاقية. يفعل ذلك من خلال التحقق باستمرار من خطوات الروبوت وتزويده بقائمة منتقاة بعناية من الأمثلة الآمنة التي تتسم بالصلة بالمهمة وبالتنوع الكافي لتغطية جميع المخاطر.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →