Neither Adversarial Training Nor Purification: Emergent Adversarial Robustness from Oscillatory Predictive Learning
تقدم هذه الورقة إطار عمل التعلم التنبؤي التذبذبي (OPL)، الذي يجمع بين عصبونات كوراموتو التذبذبية الاصطناعية والتدريب المسبق ذاتي الإشراف التنبؤي، والذي يحقق متانة تنافسية ضد الهجمات العدائية على مجموعتي بيانات CIFAR-10 وCIFAR-100 دون الاعتماد على التدريب العدائي المكلف حاسوبياً أو التطهير في وقت الاختبار.
المؤلفون الأصليون:Mohammed-Yassine Habibi, Klea Ziu, Martin Takáč, Makoto Yamada
في عالم الذكاء الاصطناعي، تتميز أنظمة الرؤية الحاسوبية بقدرة فائقة على التعرف على الأشياء، من قطة في شجرة إلى لوحة "قف" في شارع. ومع ذلك، تمتلك هذه الأنظمة هشاشة خفية؛ فبإمكان الإنسان أن ينظر إلى صورة باندا ويرى باندا، ولكن إذا أضاف مهاجم نمطاً ضئيلاً وغير مرئي تقريباً من الضجيج (static) إلى الصورة، فقد يحدد الكمبيوتر فجأة وبثقة كاملة أنها "غيبون". تُعرف هذه الثغرة باسم "الضعف الخصمي" (adversarial weakness). لسنوات، كانت الطريقة القياسية لإصلاح ذلك هي تدريب الكمبيوتر عبر إظهار الملايين من هذه الصور المخدوعة له، لإجباره على تعلم كيفية تجاهل الضجيج. هذه العملية مكلفة للغاية، إذ تتطلب كميات هائلة من القدرة الحوسبية والوقت، وغالباً ما تبطئ النظام أثناء استخدامه الفعلي. وقد تساءل الباحثون طويلاً عما إذا كانت هناك طريقة أذكى لبناء هذه الأنظمة منذ البداية، ربما من خلال تصميم هيكلها الداخلي ليكون مقاوماً طبيعياً لمثل هذه الحيل، بدلاً من مجرد فرض الحل بالقوة الغاشمة عبر التدريب اللامتناهي.
اقترح فريق من الباحثين نهجاً جديداً يتجاوز الحاجة إلى جلسات التدريب المكلفة هذه بالكامل. فبدلاً من تغذية النموذج بملايين الصور التالفة، قاموا ببناء نظام يتعلم التنبؤ بما سيأتي لاحقاً في تسلسل الصور، مدمجاً مع آلية داخلية فريدة تحاكي التزامن الإيقاعي الموجود في الطبيعة. أطلقوا على هذه الطريقة اسم "التعلم التنبئي التذبذبي" (Oscillatory Predictive Learning). الفكرة الجوهرية هي منح الكمبيوتر نوعاً معيناً من "الساعة" الداخلية أو الإيقاع الذي يحافظ على حركة أجزائه المختلفة في تزامن، مما يجعل من الصعب على أي تغيير ضئيل وخبيث أن يخل بتوازن النظام بأكمله. وعندما اختبروا هذه الطريقة، وجدوا أن النظام أصبح قوياً بشكل مفاجئ ضد الهجمات، محققاً مستويات عالية من الأمان دون أن يرى مثالاً خصمياً واحداً خلال تدريبه.
اختبر الباحثون نظامهم على مجموعتين قياسيتين من الصور المستخدمة لتدريب الحواسيب: إحداهما تحتوي على عشر فئات مختلفة مثل الطائرات والسيارات، والأخرى تحتوي على مئة فئة. وقد تحدوا النظام بمجموعة صارمة من الاختبارات المصممة لإيجاد نقاط الضعف في النموذج. في الاختبار الأول، الذي تضمن مجموعة الفئات العشر، نجحت طريقتهم الجديدة في تحديد الصور بشكل صحيح بنسبة 76.63% حتى عندما كانت الصور تحت الهجوم. ويمثل هذا تحسناً كبيراً مقارنة بالطرق الأخرى التي تعتمد على العشوائية للدفاع ضد الهجمات، والتي تسجل عادةً حوالي 71%. وعندما انتقلوا إلى مجموعة المئة فئة الأكثر صعوبة، تمكن النظام من الصمود بنسبة نجاح بلغت 50.44%. وتعد هذه النتائج لافتة للنظر لأن النظام حقق هذا المستوى من الأمان دون التكلفة الحوسبية العالية المطلوبة عادةً لجعل النموذج متيناً.
ولفهم سبب نجاح ذلك، قام الفريق بتفكيك ابتكارهم إلى جزأين رئيسيين. الجزء الأول هو نوع خاص من طبقات الشبكة العصبية يستخدم وحدات تذبذبية، وهي تشبه البندولات الصغيرة المقترنة التي تؤثر في بعضها البعض. والجزء الثاني هو طريقة تعلم تعلم النظام التنبؤ بالمشاهد المستقبلية للصورة بناءً على المشاهد الحالية. وعندما اختبروا هذه الأجزاء بشكل منفصل، وجدوا أن الهيكل التذبذبي وحده وفر أساساً صلباً للدفاع، لكنه لم يكن كافياً بمفرده. أما جزء التعلم التنبئي، فعند تطبيقه على نموذج رؤية حاسوبية قياسي، لم يفعل شيئاً تقريباً لوقف الهجمات. ومع ذلك، عندما دمجوا الهيكل التذبذبي مع التعلم التنبئي، أصبح الدفاع أقوى بكثير. بدا أن التدريب التنبئي يعمل على تضخيم الاستقرار الطبيعي للأجزاء التذبذبية، مما خلق نظاماً أكثر صموداً بكثير من مجموع أجزائه.
كما اكتشف الباحثون أن هذه المتانة هي أمر دقيق، ولا توجد إلا في ظل ظروف محددة للغاية. فقد وجدوا أن حجم وحدات "الساعة" الداخلية كان مهماً للغاية؛ فعندما تم ضبط الوحدات على بُعد (dimension) محدد وصغير، كان النظام مقاوماً للهجمات بشكل كبير. ولكن عندما زادوا حجم هذه الوحدات لجعل النظام أكثر مرونة وأفضل في التعرف على الصور في الظروف العادية، انهار الدفاع فجأة، وأصبح النظام عرضة للهجمات بشكل شبه كامل، رغم أنه أصبح أفضل في تحديد الصور "النظيفة". يشير هذا إلى أن أمن النظام لا يأتي من مجرد جعل النموذج أكبر أو أكثر قوة، بل يعتمد على مجموعة ضيقة وصارمة من القواعد التي تحافظ على تزامن الإيقاعات الداخلية. فإذا مُح النظام حرية كبيرة، فإنه يفقد قدرته على مقاومة التلاعب.
يشير هذا العمل إلى مسار جديد نحو بناء ذكاء اصطناعي آمن. فهو يتحدى الاعتقاد السائد منذ فترة طويلة بأن الطريقة الوحيدة لجعل النموذج متيناً هي تدريبه على ملايين الأمثلة الخصمية. ومن خلال الجمع بين تصميم هيكلي محدد وطريقة تعلم ذاتي، أظهر الباحثون أن المتانة يمكن أن تنبثق طبيعياً من الطريقة التي يُبنى بها النظام وكيفية تعلمه. وبينما لا يزال النظام بحاجة إلى صقل للعمل على مجموعات بيانات صور أكبر وأكثر تعقيداً، فإن النتائج تقدم بديلاً واعداً للطرق الحالية المكلفة حوسبياً. إنها تشير إلى أنه من خلال التصميم الدقيق للديناميكيات الداخلية للنموذج، قد نتمكن من إنشاء ذكاء اصطناعي ليس ذكياً فحسب، بل يصعب خداعه بطبيعته أيضاً.
ملخص تقني: التعلم التنبؤي التذبذبي من أجل المتانة ضد الهجمات العدائية
بيان المشكلة
تهيمن حاليًا على المتانة العدائية في الرؤية الحاسوبية نموذجان مكلفان حاسوبيًا: التدريب العدائي (توليد أمثلة عدائية أثناء التحسين) والتنقية العدائية (إزالة الضجيج التكراري عند وقت الاختبار). تفرض هذه الأساليب عبئًا إضافيًا كبيرًا، حيث تشير تحليلات القياس الحديثة إلى أن مجرد زيادة الحوسبة في ظل النماذج الحالية من غير المرجح أن تسد الفجوة مع مستوى المتانة البشرية. علاوة على ذلك، هناك نقص في خطوط الأساس القوية لنماذج الرؤية التي تحقق المتانة دون الاعتماد على توليد الأمثلة العدائية أو التنقية التكرارية. يبحث هذا البحث فيما إذا كان يمكن للمتانة التجريبية أن تنبثق بدلاً من ذلك من الانحيازات الاستقرائية للنماذج المعمارية وتعلم التمثيلات.
المنهجية: التعلم التنبؤي التذبذبي (OPL)
يقترح المؤلفون إطار عمل التعلم التنبؤي التذبذبي (OPL)، وهو إطار مكون من مرحلتين يجمع بين ديناميكيات معمارية محددة والتدريب المسبق ذاتي الإشراف، متجنبًا تمامًا التدريب العدائي.
1. المكون المعماري: AKOrN
يستخدم المشفر خلايا عصبية كوماتو الاصطناعية التذبذبية (AKOrN).
الآلية: بدلاً من وحدات العتبة الثابتة، يستخدم الشبكة متذبذبات "كوماتو" مقترنة. يحتوي كل موقع مكاني في خريطة الميزات على K من حالات المتذبذب على كرة (N−1)-بعد (SN−1).
الديناميكيات: تقوم طبقة "كوماتو" بتحديث كل متذبذب باستخدام نظام ديناميكي مقترن (المعادلة 1)، يتضمن مصفوفة دوران ذاتية (Ω)، وأوزان اقتران متعلمة (J)، وحداً يعتمد على المدخلات (y).
الانحياز الاستقرائي: يشجع حد الاقتران التكوينات المتسقة محليًا في فضاء الميزات. إذا أثر اضطراب ما على مجموعة فرعية من الحالات المحلية، فإن الديناميكيات المقترنة تسحب التمثيل مرة أخرى نحو تكوين متسق، مما يقلل نظريًا من الحساسية للاضطرابات المحلية.
2. مكون التعلم: X-PhiNet
يوظف إطار العمل X-PhiNet للتدريب المسبق ذاتي الإشراف التنبؤي.
الهدف: بروتوكول تعلم غير تبايني يتعلم من خلال التنبؤ بمنظور (view) محول لصورة ما من منظور آخر، مستوحى من التنبؤ الزمني البيولوجي (نماذج CA3/CA1 في الحصين).
الدور: يشجع على تمثيلات تظل تنبؤية عبر الملاحظات القريبة لنفس المشهد، مما يعزز البنى الكامنة المستقرة.
التفاعل: يفترض المؤلفون أن التدريب المسبق التنبؤي يعمل كإمالء استقرائي مكمل للديناميكيات التذبذبية، مما يضخم المتانة التي توفرها المعمارية.
3. مسار التدريب
المرحلة 1 (التدريب المسبق): يتم تدريب مشفر AKOrN باستخدام هدف X-PhiNet لمدة 400 حقبة لتعلم تمثيلات تذبذبية متسقة عبر المنظورات.
المرحلة 2 (الضبط الدقيق): يتم استبدال رؤوس التدريب المسبق برأس تصنيف، ويتم ضبط النموذج بدقة على بيانات مصنفة (CIFAR-10/100) لمدة 400 حقبة باستخدام دالة فقدان الإنتروبيا المتقاطعة القياسية.
العشوائية: يستخدم النسخة الافتراضية من النموذج حالات المتذبذب الأولية العشوائية. وبناءً عليه، يتم تقييم المتانة كمصنف عشوائي باستخدام AutoAttack-rand مع توقع فوق التحويل (EoT) (K=20 عينة) لتقدير التدرجات بشكل صحيح تحت ظروف العشوائية.
المساهمات الرئيسية
إطار عمل مبتكر: تقديم OPL، الذي يحقق أفضل النتائج في المتانة على CIFAR-10 وCIFAR-100 دون تدريب عدائي أو تنقية.
الكفاءة: يوضح مسارًا للمتانة بتكلفة حسابية (FLOPs) أقل بكثير مقارنة بالنماذج المدربة عدائيًا الممثلة، حيث يتجنب تكلفة توليد الأمثلة العدائية أثناء التحسين.
تحليل منفصل: يوفر أدلة على أن المتانة تنشأ من التفاعل بين المكونات:
AKOrN بمفرده يوفر انحيازًا قويًا للمتانة (64.98% على CIFAR-10).
X-PhiNet بمفرده على نموذج ResNet يعطي متانة تقترب من الصفر.
الدمج (OPL) يحقق 76.63% من المتانة، مما يظهر تضخماً قدره +11.65 نقطة مئوية عن AKOrN وحده.
الحساسية الديناميكية: يحدد أن المتانة تتركز في نطاق ديناميكي ضيق. وتحديدًا، تنهار المتانة بشكل شبه متقطع عند زيادة بُعد المتذبذب من N=2 إلى N=4، رغم أن نماذج N=4 تحقق دقة "نظيفة" أعلى.
النتائج التجريبية
أُجريت التجارب على CIFAR-10 وCIFAR-100 وCIFAR-10-C تحت نماذج التهديد ℓ∞ (ϵ=8/255) وℓ2.
مقاييس المتانة الرئيسية (AutoAttack-rand, EoT K=20):
CIFAR-10: يحقق OPL دقة متانة تبلغ 76.63 ± 0.76%. وهذا يتفوق على أفضل دفاع عشوائي سابق (DiffPure: 71.29%) تحت نفس البروتوكول.
CIFAR-100: يحقق OPL دقة متانة تبلغ 50.44%.
التشخيصات:
حجب التدرج (Gradient Masking): يجتاز الأسلوب اختبارات تشخيص حجب التدرج؛ حيث تنخفض دقة المتانة بشكل رتيب مع زيادة قوة هجوم PGD، كما أن هجوم Square (الصندوق الأسود) يعطي دقة أعلى من AutoAttack-rand، مما يشير إلى وجود تدرجات معلوماتية.
هجمات النقل (Transfer Attacks): يظهر OPL مقاومة محسنة لهجمات النقل مقارنة بـ AKorn وحده، مما يشير إلى أن التدريب المسبق التنبؤي يعزز الاستقرار خارج النموذج.
المتانة تجاه الفساد (Corruption Robustness): يحافظ OPL على دقة متفوقة تحت تأثير الضوضاء الغاوسية المضافة مقارنة بنماذج ResNet وX-PhiNet-only.
نتائج الدراسة الاستقصائية (Ablation):
بُعد المتذبذب (N): تتركز المتانة حصريًا في عائلة N=2. زيادة N إلى 4 ترفع الدقة "النظيفة" (لتصل إلى ~92%) ولكنها تؤدي إلى انهيار دقة المتانة إلى ما يقرب من 0%. هذا يشير إلى أن المتانة ليست نتاج السعة بل تعتمد على قيود ديناميكية محددة (إجماع الطور من الدرجة الأولى الصارم).
خطوات فك الالتفاف (T): زيادة خطوات فك الالتفاف من 3 إلى 5 تقلل من كل من الدقة النظيفة ودقة المتانة.
الأهمية والادعاءات
يزعم البحث أن المتانة العدائية يمكن أن تنبثق من التفاعل بين ديناميكيات المشفر المهيكلة والتعلم التنبؤي، مما يتحدى الرؤية التي تقول إن المتانة العالية تتطلب توليد أمثلة عدائية أثناء التدريب أو تنقية تكرارية عند وقت الاختبار.
المسار المكمل: يقترح العمل مسارًا مكملًا للمتانة حيث يتفاعل الانحياز الاستقرائي المعماري (الاقتران التذبذبي) مع أهداف التعلم ذاتي الإشراف (التعلم التنبؤي) لخلق نظام متين.
الكفاءة الحسابية: يتجنب OPL التدريب العدائي، مما يوفر مسارًا أقل استهلاكًا للحوسبة، وهو أمر مهم نظرًا لتكاليف التوسع الهائلة لنماذج التدريب العدائي الحالية.
القيود والنطاق: يشير المؤلفون بتواضع إلى أن تجاربهم محدودة بمجموعات بيانات CIFAR، وأن الآلية الكامنة وراء المتانة (تحديدًا نظام N=2) لم تُشرح نظريًا بشكل كامل بعد. هم لا يدعون أن هذا التأثير ينتقل تلقائيًا إلى جميع أطر التعلم ذاتي الإشراف التنبؤي أو المعماريات الأكبر، معتبرين ذلك مجالًا للعمل المستقبلي. كما يقر الورق البحثي بوجود مقايضة: فبينما تتحقق المتانة دون تدريب عدائي، فإن الدقة "النظيفة" الحالية (86.81%) أقل من النماذج عالية السعة المدربة عدائيًا.