Semantic Smoothing via Novel View Synthesis for Robust SAR Image Classification
تقترح هذه الورقة "التنعيم الدلالي"، وهو دفاع قوي لتصنيف صور الرادار ذي الفتحة الاصطناعية (SAR) يستبدل الضوضاء متماثلة المناحي بتحويلات عشوائية مهيكلة يتم إنشاؤها بواسطة نموذج مبتكر لتخليق المنظور مشروط بهندسة الاستحواذ، مما يعزز المرونة ضد الهجمات العدائية القياسية وتلك الخاصة بـ SAR مع تحسين دقة الصور الأصلية.
تخيل أنك تحاول تحديد سيارة معينة في صورة، ولكن شخصاً ما أضاف سراً بعض "الخلل" الصغير وغير المرئي إلى الصورة. بالنسبة للإنسان، لا تزال السيارة تبدو كسيارة، ولكن بالنسبة لبرنامج كمبيوتر (ذكاء اصطناعي)، فإن هذه الأعطال هي بمثابة خدعة سحرية تجعله يعتقد أن السيارة هي في الواقع محمصة خبز. يسمى هذا هجوماً خصومياً (Adversarial Attack)، وهو مشكلة رئيسية للأنظمة الحرجة للسلامة مثل الرادار الذي يحدد المركبات.
تقترح هذه الورقة البحثية طريقة جديدة لإيقاف هذه الخدع، وتحديداً لصور رادار الفتحة الاصطناعية (SAR). رادار SAR هو نوع خاص من الرادار ينشئ صوراً للأرض من الطائرات أو الأقمار الصناعية. وخلافاً للكاميرا العادية التي تلتقط مجرد لقطة، يقوم SAR "برسم" الصورة عن طريق إرسال موجات راديوية ترتد عن الأجسام. ويعتمد الشكل الذي تظهر به الصورة بشكل كبير على زاوية الطائرة (الهندسة).
إليك تفصيل لحلها، باستخدام تشبيهات بسيطة:
الطريقة القديمة: "التخمين مع عصب العينين"
في السابق، كانت أفضل وسيلة دفاع ضد هذه الهجمات تسمى التنعيم العشوائي (Randomized Smoothing).
كيف كانت تعمل: تخيل أنك تحاول التعرف على سيارة، لكن شخصاً ما يستمر في هز الصورة قليلاً وإضافة تشويش (مثل "الثلج" في التلفاز) إليها. أنت تنظر إلى الصورة 100 مرة، وفي كل مرة تضيف كمية مختلفة من التشويش، ثم تخمن هوية السيارة بناءً على ما تراه في أغلب المرات.
المشكلة: هذا "التشويش" عشوائي. إنه لا يهتم بشكل السيارة أو فيزياء عمل الرادار. إنه يشبه إضافة ضوضاء عشوائية إلى لوحة فنية؛ أحياناً يساعد، ولكن في كثير من الأحيان يجعل الصورة تبدو كقمامة لا تشبه الشيء الحقيقي على الإطلاق. بالنسبة للرادار، هذه الضوضاء العشوائية لا معنى لها فيزيائياً.
الطريقة الجديدة: "المرآة الحرباء"
تقترح المؤلفة التنعيم الدلالي (Semantic Smoothing). بدلاً من إضافة تشويش عشوائي، يستخدمون "مرآة سحرية" (نموذج ذكاء اصطناعي توليدي) لإنشاء نسخ جديدة ومنطقية من نفس الكائن.
التشبيه: تخيل أن لديك صورة لسيارة. بدلاً من إضافة التشويش، تطلب من فنان فائق الذكاء أن يعيد رسم تلك السيارة من 10 زوايا مختلفة (بإمالتها يميناً ويساراً، وأعلى وأسفل) مع الحفاظ على كونها بوضوح نفس السيارة.
العملية:
تأخذ الصورة "المخترقة" (التي تحتوي على الأعطال غير المرئية).
تغذيها في "المرآة السحرية" (نموذج مدرب على فيزياء الرادار).
تقوم المرآة بتوليد 10 صور جديدة لنفس هذه السيارة، ولكن من زوايا رادار مختلفة قليلاً (مثل تغيير السمت والارتفاع).
ولأن الأعطال كانت "مزيفة" ولم تتبع قوانين الفيزياء، فإنها تختفي أو تتشتت عند إعادة رسم السيارة من زاوية جديدة. تظل هوية السيارة الحقيقية (الجزء "الدلالي") واضحة.
ينظر الكمبيوتر إلى جميع الرسومات العشر الجديدة ويجري عملية تصويت. وبما أن 9 من أصل 10 تظهر بوضوح أنها دبابة (وليست محمصة خبث)، فإن النظام يتعرف بشكل صحيح على أنها دبابة.
لماذا هذا مميز للرادار
صور الرادار غريبة. إذا نظرت إلى دبابة من الجانب، فتبدو كصندوق طويل. إذا نظرت إليها من الأمام، فتبدو كمثلث. الذكاء الاصطناعي العادي يرتبك إذا تغيرت الزاوية قليلاً.
ادعاء الورقة البحثية: تستخدم هذه الطة الجديدة قواعد الرادار المحددة (الزوايا والهندسة) لتوليد هذه المشاهد الجديدة. إنها ليست مجرد ضوضاء عشوائية؛ بل هي تنوع هيكلي قائم على الفيزياء.
النتيجة: اختبرت الورقة هذه الطريقة ضد أنواع مختلفة من "الاختراقات" (بعضها يضيف ضوضاء بكسلية فقط، وبعضها يحاكي فيزياء الرادار الحقيقية). ووجدوا أنها:
توقف الهجمات بشكل أفضل بكثير من طريقة "التشويش العشوائي" القديمة.
تجعل الذكاء الاصطناعي في الواقع أفضل في التعرف على السيارات حتى عندما لا توجد هجمات على الإطلاق (الدقة النظيفة).
تعمل لكل من هجمات الكمبيوتر القياسية والهجمات المحددة القائمة على الفيزياء والمصممة لخداع الرادار.
باخت-اختصار
إذا كانت الطريقة القديمة تشبه محاولة رؤية سيارة عبر نافذة ضبابية عن طريق هز النافذة عشوائياً، فإن هذه الطريقة الجديدة تشبه طلب إعادة رسم السيارة من عدة زوايا مختلفة للتأكد من أنك ترى الشيء الحقيقي. من خلال التركيز على معنى الكائن بدلاً من مجرد إضافة ضوضاء عشوائية، يصبح النظام أصعب بكثير في الخداع.
ملخص تقني: التنعيم الدلالي عبر تخليق المشاهد الجديدة لتعزيز متانة تصنيف صور الرادار ذي الفتحة الاصطناعية (SAR)
بيان المشكلة تُعد الشبكات العصبية العميقة (DNNs) المستخدمة في التعرف التلقائي على الأهداف (ATR) عبر رادار الفتحة الاصطناعية (SAR) عرضة للاضطرابات العدائية، مما يشكل مخاطر في التطبيقات الحرجة للسلامة. وبينما يُعد "التنعيم العشوائي" (Randomized Smoothing) وسيلة دفاع مبدئية تعمل على تحسين المتانة من خلال حساب متوسط التنبؤات عبر مدخلات مشوبة بالضجيج، إلا أنه يعتمد عادةً على ضجيج غاوسي متماثل المناحي (Isotropic Gaussian Noise). وتفشل هذه الطريقة في الحفاظ على البنية الدلالية لصور SAR، حيث يعتمد مظهر الأجسام بشكل كبير على هندسة الاستحواذ (زوايا السمت والارتفاع). وبناءً على ذلك، فإن الضجيج متماثل المناحي غالباً ما يولد عينات لا تتوافق مع ملاحظات فيزيائية ذات معنى، مما يجعل الدفاع أقل فعالية ضد الهجمات المرتبطة بنطاق محدد (Domain-specific attacks) التي تستغل فيزياء الرادار (مثل سلوك التشتت) بدلاً من مجرد الضجيج البسيط في فضاء البكسل.
المنهجية يقترح المؤلفون إطار عمل "التنعيم الدلالي" (Semantic Smoothing)، وهو إطار دفاعي يستبدل حقن الضجيج متماثل المناحي بتحويلات مهيكلة محافظة على الدلالات، يتم توليدها عبر نموذج "تخليق المشاهد الجديدة" (Novel View Synthesis - NVS).
المفهوم الجوهري: بدلاً من تشويه صورة المدخلات بضجيج عشوائي، يستخدم الأسلوب نموذجاً توليدياً لتخليق مشاهد متعددة ومحتملة لنفس الجسم تحت تحويلات هندسية عشوائية ولكن محكومة. ويتم تجميع تنبؤات المصنف عبر هذه المشاهد المُخلقة (عبر التصويت بالأغلبية) لتشكيل تنبؤ نهائي متين.
النموذج التوليدي (GeNVS): يستخدم إطار العمل نموذج انتشار احتمالي لإزالة الضجيح (DDPM) معدلاً، مدمجاً مع بنية NVS مدركة للهندسة، مقتبسة من GeNVS.
معالجة المدخلات: يتم ترميز صورة SAR المدخلة xadv (التي قد تكون عدائية) ومعاملات الاستحواذ الأصلية الخاصة بها (السمت ϕaz، والارتفاع θel) إلى حجم ميزة ثلاثي الأبعاد كامن.
تخليق المشهد: يقوم النموذج بأخذ عينات من معاملات المشهد المستهدف (ti=ϕtarget,az,θtarget,el) من توزيع تحويل TD (المُعرف كتوزيع منتظم لمعاملات الاستحواذ التدريبية).
الصيرورة (Rendering): يتم إطلاق أشعة عبر الحجم الكامن لاستخراج الميزات، والتي يتم صيرورتها عبر شبكة عصبية متعددة الطبقات (MLP) من نوع NeRF لإنتاج صورة ميزة.
توليد الانتشار: تقوم شبكة الانتشار بإزالة الضجيج الغاوسي المشروط بصورة الميزة المُصوّرة ومعاملات الهدف لإنتاج صورة SAR عالية الدقة xiNV عند منظور الرؤية الجديد.
التجميع: لكل مدخل، يتم توليد N من المشاهد الجديدة. يتم تمرير كل مشهد عبر مصنف مُدرب مسبقاً fcls. ويتم تحديد الملصق النهائي بناءً على التصويت بالأغلبية لـ N من التنبؤات.
المساهمات الرئيسية
إطار عمل التنعيم الدلالي: تقديم إطار دفاع عدائي جديد يستفيد من التحويلات التوليدية العشوائية لإنتاج مشاهد متعددة محافظة على الدلالات، وتجميع التنبؤات للتخفيف من الآثار العدائية.
تطبيق خاص بـ SAR: تطوير نموذج NVS مشروط بالهندسة لصور SAR. ومن خلال التكييف مع معاملات السمت والارتفاع، يتيح النموذج توليد مشاهد رادارية عشوائية محكومة تحترم القيود الفيزيائية لصور SAR.
التحقق التجريبي: إجراء تجارب مكثفة على مجموعة بيانات MSTAR أظهرت أن التنعيم الدلالي يوفر مكاسب متانة جوهرية ضد كل من الهجمات التقليدية القائمة على التدرج (FGSM, PGD) والهجمات الموجهة فيزيائياً والخاصة بـ SAR (مثل OTSA و SMGAA).
النتائج أجريت التجارب على مجموعة بيانات MSTAR (500 صورة عبر 10 فئات من المركبات) لمقارنة الطريقة المقترحة مع خط الأساس غير المحمي والتنعيم العشوائي القياسي (باستخدام ضجيج غاوسي متماثل المناحي مع قيم σ متفاوتة).
مكاسب المتانة: حافظ التنعيم الدلالي باستمرار على دقة عالية عبر جميع أنواع وقوة الهجمات. على سبيل المثال، تحت هجمات PGD القوية (ϵ=0.005)، انخفضت دقة النموذج غير المحمي إلى 0%، بينما حقق التنعيم الدلالي (مع N=10) دقة بلغت 94.18%.
التفوق على التنعيم العشوائي: تفوق التنعيم الدلالي بشكل كبير على التنعيم العشوائي. فبينما أظهر التنعيم العشوائي أداءً غير مستقر وغالباً ما أدى إلى تدهور الدقة اعتماداً على مقياس الضجيج σ، وفر التنعيم الدلالي متانة مستقرة وعالية دون الحاجة إلى ضبط دقيق لمعامل الضجيج.
تحسين دقة النماذج السليمة (Clean Accuracy): على عكس العديد من آليات الدفاع التي تضحي بدقة النماذج السليمة مقابل المتانة، أدى التنعيم الدلالي إلى تحسين دقة التصنيف للنماذج السليمة (94.72% مقابل 90.00% للنموذج الأساسي) من خلال تجميع التنبؤات عبر مشاهد مُخلقة متسقة دلالياً.
الكفاءة مقابل الأداء: بينما يتحمل التنعيم الدلالي تكاليف حوسبة أعلى بسبب خطوة التوليد (N×(Cg+Cf)) مقارنة بالتنعيم العشوائي (N×Cf)، يجادل البحث بأن هذه المقايضة مواتية لأن العينات المولدة ذات معنى دلالي وأكثر إفادة بكثير من اضطرابات الضجيج متماثل المناحي.
الأهمية والادعاءات يزعم البحث أن التنعيم الدلالي يمثل بديلاً واعداً للتنعيم متماثل المناحي في الدفاع العدائي في مجالات الاستشعار المهيكلة مثل SAR. ومن خلال نقل عملية التنعيم من جوار محلي على مستوى البكسل إلى فضاء (Manifold) من التحويلات الهندسية المحتملة، ينجح الأسلوب بفعالية في كبح الآثار العدائية غير الدلالية مع الحفاظ على هوية الجسم المطلوبة للتصنيف. ويؤكد المؤلفون أن هذا النهج يوضح قيمة الاستفادة من التباين ذي المعنى الدلالي بدلاً من الضجيج العشوائي لتحقيق المتانة ضد الهجمات العدائية القياسية والفيزيائية على حد سواء.
العمل المستقبلي يشير المؤلفون إلى أن العمل المستقبلي يجب أن يبحث في انتشار الاضطراب عبر نموذج GeNVS، وتقييم متانة النموذج التوليدي نفسه، والنظر في الهجمات العدائية التكيفية (Adaptive White-box Attacks) حيث يمتلك المهاجم معرفة كاملة بآلية الدفاع.