Tuning Just Enough: Lightweight Backdoor Attacks on Multi-Encoder Diffusion Models
تقدم هذه الورقة البحثية إطار عمل MELT، وهو إطار هجوم باب خلفي خفيف الوزن لنماذج الانتشار متعددة المشفرات مثل Stable Diffusion 3، مما يثبت أن ضبط أقل من 0.2% من المعلمات عبر المهايئات منخفضة الرتبة كافٍ لتحقيق هجمات فعالة مع تحديد المجموعات الفرعية الدنيا للمشفرات المطلوبة لأهداف مختلفة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك فناناً فائق الذكاء يُدعى Stable Diffusion 3. هذا الفنان لا يرسم فقط من عقل واحد؛ بل لديه ثلاثة "مدربي لغة" مختلفين (مشفرات نصية) يساعدونه على فهم طلباتك. أحد المدربين بارع في المفاهيم العامة، والآخر في التفاصيل المحددة، والثالث في القواعد اللغوية المعقدة. معاً، يخبرون الفنان بالضبط ما يجب عليه رسمه.
هذه الورقة البحثية هي تحقيق أمني فيما يحدث إذا تمكن مخترق من تسميم واحد أو أكثر من هؤلاء المدربين.
المشكلة: خدعة "الكلمة السحرية"
في الماضي، وجد المخترقون طريقة لخداع الفنانين ذوي المدرب الواحد. كانوا يعلمون المدرب "كلمة سحرية" (محفزاً). على سبيل المثال، إذا طلبت "كلباً على مقعد"، ولكن الكلمة السحرية كانت مخفية في الطلب، فإن الفنان سيتجاهل طلبك ويرسم "قطة" بدلاً من ذلك.
ولكن الآن، لدى الفنان ثلاثة مدربين. والسؤال الكبير هو: هل يحتاج المخترق لتسميم المدربين الثلاثة جميعاً لينفذ خدعة ما، أم أن واحداً يكفي؟ وهل يمكنه، إذا سمم جزءاً صغيراً جداً من المدربين، القيام بذلك دون أن يُكشف (أو دون أن يصاب الفنان بالارتباك)؟
الاكتشاف: الأمر يعتمد على ما تريد سرقته
اختبر الباحثون أربعة أنواع مختلفة من "الخدع" لمعرفة أي المدربين يحتاج إلى التسميم:
"الاستحواذ الكامل" (هجوم الطلب المستهدف):
- الهدف: جعل الفنان يتجاهل طلبك تماماً ويرسم شيئاً مختلفاً تماماً (مثلاً: تطلب كلباً، فيرسم طائراً).
- النتيجة: يجب عليك تسميم المدربين الثلاثة جميعاً. إذا سممت واحداً فقط، فسيظل المدربان الآخران يسمعان كلمة "كلب" وسيرتبك الفنان أو سيرسم الكلب على أي حال. الأمر يشبه محاولة إقناع لجنة بالتصويت بـ "لا" في حين يوجد ثلاثة أعضاء حاضرين؛ عليك رشوة الثلاثة جميعاً لتغيير النتيجة.
"تبديل النمط" (هجوم النمط المستهدف):
- الهدف: الحفاظ على الموضوع (كلب) ولكن تغيير الأجواء (جعله يبدو كلوحة لفان جوخ).
- النتيجة: تحتاج فقط لتسميم اثنين من المدربين (اللذين يجيدان المفاهيم البصرية). المدرب الثالث لا يهتم بالنمط، لذا فإن تركه نظيفاً لا يمنع الخدعة.
"تبديل الكائن" (هجوم الكائن المستهدف):
- الهدف: تغيير شيء واحد فقط (تحويل الكلب إلى قطة).
يد مرّت بـ مدرب واحد فقط (تحديداً مدرب CLIP-G). هذا المدرب قوي جداً في التعرف على الأشياء، فإذا تم خداعه، سيتبع الفريق بأكل. الأمر يشبه وجود شخص واحد صوته عالٍ جداً في اجتماع يمكنه إقناع الجميع بتغيير رأيهم.
- الهدف: تغيير شيء واحد فقط (تحويل الكلب إلى قطة).
"تبديل الفعل" (هجوم الفعل المستهدف):
- الهدف: تغيير ما تفعله الشخصيات (جعل الكلب "يمسك" القطة بدلاً من "يطاردها").
- النتيجة: وبشكل مشابه للنمط، تحتاج فقط لتسميم مدربين اثنين.
السلاح الجديد: "MELT" (المخترق المتخفي)
أدرك الباحثون أن تسميم مدرب كامل أمر مكلف وبطيء (مثل إعادة تدريب قسم جامعي كامل). لذا، ابتكروا طريقة جديدة تسمى MELT (الهجمات متعددة المشفرات خفيفة الوزن).
- التشبيه: تخيل أن المدربين عبارة عن مكتبات ضخمة وثقيلة. لتغيير آرائهم، كانت الطريقة القديمة هي إعادة كتابة كل كتاب في المكتبة (الضبط الدقيق الكامل).
- طريقة MELT: بدلاً من إعادة كتابة المكتبة بأكملها، تقوم MELT فقط بوضع قصاصات ملاحظات لاصقة على الصفحات الأكثر أهمية. هذه الملاحظات هي تعليمات صغيرة وخفيفة الوزن (تسمى "محولات LoRA") تخبر المدرب: "مهلاً، عندما ترى الكلمة السكلمة، تجاهل الكتاب وافعل هذا بدلاً من ذلك".
النتيجة:
تعد MELT فعالة للغاية. فهي تغير أقل من 0.2% من معرفة المدرب (مثل تغيير صفحتين من أصل 1000 صفحة)، ومع ذلك فهي تعمل بنفس كفاءة إعادة كتابة المكتبة بأكملها.
لماذا يجب أن تهتم؟
تكشف هذه الورقة عن حقيقة مخيفة ولكنها مهمة حول الذكاء الاصطناعي الحديث:
- ليس عليك كسر النظام بأكل لكسر جزء منه. اعتماداً على ما يريد المخترق فعله، قد يحتاج فقط إلى اختراق جزء ضئيل جداً من عقل الذكاء الاصطناعي.
- الأمر رخيص وسهل. نظرًا لوجود طرق مثل MELT، لا يحتاج المخترقون إلى أجهزة كمبيوتر خارقة لإنشاء ثغرات خطيرة. يمكنهم القيام بذلك بقدر ضئيل جداً من القدرة الحوسبية، مما يجعل هذه الهجمات تهديداً حقيقياً لمستقبل سلامة الذكاء الاصطناعي.
باخت تختصار: أظهر الباحثون أنه بينما تتطلب بعض الخدع كسر الفريق بأكمله، فإن غيرها يتطلب فقط خداع عضو أو اثنين. ومع تقنية "قصاصات الملاحظات" الجديدة الخاصة بهم، يمكنهم القيام بذلك دون بذل أي مجهود تقريباً، مما يترك بقية النظام يبدو طبيعياً تماماً.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.