← أحدث الأبحاث
💻 computer science

NeuroStrike: Neuron-Level Attacks on Aligned LLMs

تقدم الورقة البحثية NeuroStrike، وهو إطار عمل هجومي مبتكر يستغل اعتماد النماذج اللغوية الكبيرة المتوافقة على عصبونات سلامة متخصصة وشحيحة لتجاوز آليات السلامة في كل من بيئات الصندوق الأبيض والصندوق الأسود عن طريق تقليم هذه العصبونات أو نقل المطالبات العدائية عبر النماذج، محققاً معدلات نجاح هجوم عالية على أكثر من 20 نموذجاً من النماذج ذات الأوزان المفتوحة وخمسة نماذج من الصندوق الأسود.

المؤلفون الأصليون: Lichao Wu, Sasha Behrouzi, Mohamadreza Rostami, Maximilian Thang, Stjepan Picek, Ahmad-Reza Sadeghi

نُشر 2026-03-27
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Lichao Wu, Sasha Behrouzi, Mohamadreza Rostami, Maximilian Thang, Stjepan Picek, Ahmad-Reza Sadeghi

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحثية بعنوان "NeuroStrike" باستخدام لغة بسيطة وتشبيهات إبداعية.

🧠 الفكرة الكبرى: البحث عن "مفتاح الأمان"

تخيل نموذج لغوي كبير (LLM) كأنه مساعد روبوت ذكي ومفيد للغاية. وللتأكد من أن هذا الروبوت لا يقول أي شيء مسيء، أو خطير، أو غير قانوني (مثل "كيف أصنع قنبلة؟")، يضع المهندسون نظام أمان داخل دماغه.

عادةً، نعتقد أن نظام الأمان هذا يشبه حارس أمن ضخم ومعقد يفحص كل كلمة يقولها الروبوت. لكن هذه الورقة البحثية اكتشفت شيئًا مفاجئًا: نظام الأمان ليس حارسًا ضخمًا؛ بل هو في الواقع مجرد مجموعة صغيرة ومحددة من مفاتيح الضوء.

يطلق الباحثون على هذه المفاتيح اسم "نيورونات الأمان" (Safety Neurons).

🔍 الاكتشاف: إنها تمثل 0.6% فقط من الدماغ

وجد الفريق أنه عندما يتم تدريب الروبوت ليكون "آمنًا"، فإنه لا يغير دماغه بالكامل. بدلاً من ذلك، يقوم بتفعيل مجموعة صغيرة ومتخصصة من النيورونات (حوالي 0.6% من الإجمالي) تعمل كـ "كاشف خطر" مخصص.

  • التشبيه: تخيل مكتبة ضخمة تحتوي على ملايين الكتب (معرفة النموذج). لمنع الناس من استعارة الكتب الخطيرة، لا يوظف أمين المكتبة آلاف الحراس، بل يضع ضوءًا أحمر صغيرًا واحدًا على باب "القسم الخطير". إذا كان هذا الضوء يعمل، فلا يمكن لأحد الدخول.
  • المشكلة: نظرًا لأن هذا الضوء صغير ومحدد للغاية، فإذا تمكنت من معرفة أي سلك هو، وقطعت هذا السلك، سينهار نظام الأمان بالكامل. سيظل الروبوت يعرف كل شيء، لكنه سينسى ألا يقول الأشياء السيئة.

⚔️ الهجوم: "NeuroStrike"

بنى الباحثون أداة تسمى NeuroStrike لاستغلال نقطة الضعف هذه. وقد اختبروا ذلك بطريقتين:

1. هجوم الصندوق الأبيض (المطلع من الداخل)

  • السيناريو: لديك المخططات الهندسية للروبوت ويمكنك النظر داخل دماغه.
  • الحركة: استخدم الباحثون اختبارًا بسيطًا لمعرفة أي "مفاتيح الضوء" (النيورونات) هي المسؤولة عن قول كلمة "لا". بمجرد العثور عليها، قاموا ببساطة بإيقاف تشغيل تلك المفاتيح (عملية التقليم/Pruning).
  • النتيجة: أصبح الروبوت "غير متوافق مع القيم" (Un-aligned). ظل بإمكانه الدردشة، وكتابة الأكواد، وإلقاء النكات، ولكن إذا سألته عن وصفة لصنع قنبلة، فسيعطيك إياها بكل سرور.
  • نسبة النجاح: فعلوا ذلك لأكثر من 20 روبوتًا مختلفًا. ومن خلال إيقاف تشغيل أقل من 1% من الدماغ، جعلوا الروبوتات تقول أشياء خطيرة في 77% من الحالات.

2. هجوم الصندوق الأسود (الجاسوس)

  • السيناريو: ليس لديك المخططات الهندسية. يمكنك فقط التحدث إلى الروبوت عبر موقع إلكتروني (مثل التحدث مع Google's Gemini أو نماذج الذكاء الاصطناي المملوكة لشركات). لا يمكنك رؤية دماغه.
  • الحركة: هذا هو الجزء الذكي. أدرك الباحثون أن الروبوتات من نفس العائلة (على سبيل المثال، Gemini من جوجل وGemma مفتوح المصدر) تمتلك مفاتيح أمان متطابقة في نفس المواقع.
    • أخذوا روبوتًا مفتوح المصدر يمكنهم رؤية ما بداخله.
    • وجدوا مفاتيح الأمان هناك.
    • قاموا بتدريب "مولد نصوص" (سكريبت ذكي) لكتابة أسئلة تتجنب تفعيل تلك المفاتيح المحددة.
    • أرسلوا تلك الأسئلة إلى الروبوت السري (الصندوق الأسود).
  • النتيجة: على الرغم من أنهم لم يتمكنوا من رؤية دماغ الروبوت السري، إلا أن الأسئلة نجحت تمامًا لأن "مفاتيح الأمان" كانت في نفس المكان.
  • نسبة النجاح: نجحوا في تجاوز الأمان في عائلة نماذج Google's Gemini والنماذج المغلقة الأخرى، وحصلوا على إجابات خطيرة في 64% من الحالات.

🌐 لماذا يهم هذا (التشبيه)

فكر في محاذاة الأمان (Safety Alignment) مثل بناء حصن.

  • الاعتقاد القديم: كنا نعتقد أن الحصن له جدران سميكة في كل مكان. لاختراقه، كنت بحاجة إلى مطرقة ضخمة (مطالبات معقدة وصعبة الصنع).
  • الواقع الجديد: الحصن لديه باب واحد ضعيف مخفي في الخلف. إذا عرفت مكان هذا الباب، فلن تحتاج إلى مطرقة ضخمة؛ بل تحتاج فقط إلى مفتاح صغير (NeuroStrike) لفتح القفل.

🛡️ التداعيات

  1. الأمان هش: طرق الأمان الحالية تركز بشكل مفرط على جزء صغير جدًا من الذكاء الاصطناي. إذا تعطل هذا الجزء، يفشل نظام الأمان بأكمله.
  2. الأمر ينتشر: إذا اخترقت نسخة واحدة من الروبوت، فمن المرجح أن تخترق "أقرباءه" (النسخ التي تم ضبطها أو استخلاصها)، لأنهم يتشاركون نفس مفاتيح الأمان.
  3. خطر تعدد الوسائط: هذا يعمل أيضًا على الروبوتات التي يمكنها رؤية الصور. إذا أوقفت مفاتيح الأمان، فسيقوم الروبوت بإنشاء صور خطيرة بنفس سهولة إنتاج النصوص الخطيرة.

🚀 ماذا بعد؟

الهدف من ورقة البحث ليس تعليم الناس كيفية صنع القنابل، بل هم يطلقون صافرة إنذار. إنهم يقولون: "نحن بحاجة إلى إعادة تصميم كيفية بناء أمان الذكاء الاصطناعي."

بدلاً من الاعتماد على عدد قليل من المفاتيح الصغيرة، نحتاج إلى نشر الأمان عبر الدماغ بالكامل، مثل وجود حراس عند كل باب، وليس عند باب واحد فقط. إذا فعلنا ذلك، فلن يتمكن المخترقون من كسر النظام عن طريق قطع سلك واحد.

باختصار: وجدت الورقة البحثية أن أمان الذكاء الاصطناعي حاليًا متماسك بخيط رفيع وهش للغاية. إذا سحبت هذا الخيط، فإن شبكة الأمان بأكملها ستنهار.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →