← أحدث الأبحاث
💻 computer science

BadBlocks: Low-Cost and Stealthy Backdoor Attacks Tailored for Text-to-Image Diffusion Models

تقدم الورقة البحثية BadBlocks، وهو هجوم باب خلفي خفيف الوزن ومتخفٍ على نماذج الانتشار من النص إلى الصورة، يعمل على تسميم كتل UNet محددة بشكل انتقائي لتحقيق معدلات نجاح عالية بأقل قدر من الموارد الحسابية مع التهرب من الدفاعات المتطورة.

المؤلفون الأصليون: Jia Wu, Yu Pan, Junjun Yang, Yi Du

نُشر 2026-05-29
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jia Wu, Yu Pan, Junjun Yang, Yi Du

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك شيفاً ماهراً (الذكاء الاصطناعي) يمكنه طهي أي طبق تريده بمجرد قراءة بطاقة الوصفة (النص المكتوب). هذا الشيف موهوب للغاية، ولكن ورقة بحثية جديدة تسمى BadBlocks تكشف عن طريقة مخادعة لاختراق عقل الشيف لجعله يتبع سراً وصفة مختلفة وخطيرة كلما همست بكلمة سر معينة.

إليك تفاصيل كيفية عمل هجوم "BadBlocks" هذا، باستخدام تشبيهات بسيطة:

1. المشكلة: "التجديد الكامل" مقابل "الإصلاح الصغير"

عادةً، لاختراق شيف الذكاء الاصطناعي، كان على المهاجمين القيام بعملية "تجديد كامل" للمطبخ. كان عليهم إعادة تدريب النموذج بالكامل من الصفر أو تعديل كل جزء تقريباً منه.

  • الطريقة القديمة: تخيل أنك تحاول تغيير عقل الشيف عبر إعادة بناء منزله بالكامل، واستبدال كل طوبة، وإعادة توصيل كل الأسلاك الكهربائية. يتطلب ذلك قدراً هائلاً من المال، والوقت، والطاقة (قوة الحوسبة).
  • طريقة BadBlocks: اكتشف الباحثون أنك لست بحاجة لإعادة بناء المنزل بأكمله. تحتاج فقط إلى استبدال ثلاث مصابيح كهربائية محددة في الردهة. من خلال تعديل جزء صغير ومحدد جداً من عقل الذكاء الاصطناعي (يسمى "UpSample Blocks")، يمكنهم جعل الشيف يتبع الوصفة السرية.
  • النتيجة: تستخدم هذه الطة الجديدة ذاكرة أقل بنسبة 70% وتستغرق وقتاً أقل بنسبة 80% من الطرق القديمة. الأمر يشبه اختراق خزنة بنك عن طريق فتح قفل واحد ضعيف بدلاً من محاولة تفجير المبنى بأكمله. وهذا يعني أنه حتى الشخص الذي يمتلك جهاز كمبيوتر منزلي عادي ("وحدة معالجة رسومات للمستهلكين" - consumer-grade GPU) يمكنه الآن القيام بذلك، وليس فقط من يملكون أجهزة كمبيوتر خارقة.

2. التخفي: خدعة "الحبر السري"

كان التحدي الأكبر أمام الهكرز دائماً هو تجنب الانكشاف. فأنظمة الدفاع الحديثة تبحث عن "الاستيعاب" (Assimilation).

  • مشكلة "الاستيعاب": تخيل لو حاولت تغيير أغنية عن طريق إعادة كتابة كلمات الأوركسترا بأكملها. ستصبح الموسيقى غريبة، وسينتبه المايسترو (نظام الأمان) فوراً إلى وجود خطأ ما. ستتغير الأغنية بأكملها، مما يجعل "الباب الخلفي" واضحاً.
  • حل BadBlocks: BadBlocks تشبه كتابة رسالة سرية بـ الحبر السري على صفحة واحدة فقط من النوتة الموسيقية. بقية الأوركسترا تعزف الأغنية كما ينبغي تماماً. ولأن 99% من الموسيقى تظل مثالية، فإن نظام الأمان سيعتقد: "كل شيء يبدو طبيعياً!".
  • لماذا ينجح ذلك: هذا الهجوم يغير فقط الأجزاء التي تتعامل مع "اللمسات النهائية" للصورة. أما الأجزاء التي تستمع للوصف (Prompt) وتبدأ العملية، فتظل دون مساس. هذا يخدع أنظمة الأمان التي تبحث في الصورة ككل للعثور على أي خلل.

3. المحفز: "الكلمة السحرية"

تماماً مثل الأفلام، يحتاج الهكر إلى محفز لتفعيل الباب الخلفي.

  • كيف يعمل: يمكن للمهاجم إخفاء المحفز داخل النص (Prompt). قد يكون رمزاً غريباً لا تراه (مثل حرف يونيكود مخفي)، أو عبارة محددة، أو حرفاً غريباً.
  • التأثير: إذا طلبت من الذكاء الاصطناعي "رسم قطة"، سيرسم قطة عادية. ولكن إذا طلبت منه "رسم قطة [الكود السري]"، فإنه فجأة سيرسم شيئاً ضاراً أو مختلفاً تماماً، مثل سلاح أو شخص معين، دون أن يعرف المستخدم وجود الكود هناك.

4. الاكتشاف: ليست كل العقول متساوية

قام الباحثون بإجراء دراسة معمقة ("دراسة استئصال" - ablation study) لمعرفة أي أجزاء الذكاء الاصطناعي هي الأكثر عرضة للاختراق.

  • النتيجة: وجدوا أن الذكاء الاصطناعي ليس حساساً بنفس القدر في كل مكان. بعض الطبقات تشبه "أساس" المبنى (طبقات ResNet) - إذا عبثت بها، ينهار الهيكل بالكامل. وطبقات أخرى تشبه "اللمسات النهائية" (طبقات Transformer و Normalization).
  • الاستراتيجية: يستهدف BadBlocks "اللمسات النهائية". لقد وجدوا أنه إذا قمت فقط بتعديل الطبقات الأخيرة حيث يتم صقل وتحسين الصورة، يمكنك حقن الباب الخلفي دون كسر قدرة الذكاء الاصطناعي على رسم الصور الطبيعية بخلاف ذلك.

5. الخلاصة

BadBlocks هو تحذير من أن حاجز اختراق مولدات الصور بالذكاء الاصطناعي قد انخفض بشكل كبير.

  • قبل: كنت بحاجة إلى كمبيوتر خارق ووقت طويل لاختراق الذكاء الاصطناعي، وكانت النتيجة غالباً ما تكون واضحة.
  • الآن: يمكنك القيام بذلك على جهاز كمبيوتر للألعاب العادية في وقت قياسي، ويبدو الذكاء الاصطنا_المخترق طبيعياً تماماً ويعمل بشكل مثالي حتى تهمس له بالكلمة السرية.

تخلص الورقة البحثية إلى أنه نظراً لأن هذه الطريقة رخيصة وسريعة ويصعب اكتشافها، فإنها تشكل خطراً أمنياً خطيراً. وهي تشير إلى أن حراس الأمن الحاليين (آليات الدفاع) ينظرون إلى الأشياء الخاطئة، وأننا بحاجة إلى طرق جديدة لحماية نماذج الذكاء الاصطناعي هذه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →