The Impact of CutMix on Reliability and Robustness in Semantic Segmentation
تُظهر هذه الدراسة أنه بينما يكون لتقنية CutMix تأثير ضئيل على الدقة الخام لنماذج التجزئة الدلالية، إلا أنها تعزز باستمرار موثوقيتها، ومعايرتها، وتقدير عدم اليقين لديها، لا سيما في ظل تحولات التوزيع، مما يجعلها أداة حاسمة لعمليات النشر في البيئات الحرجة التي تتطلب معايير سلامة عالية.
في عالم المركبات ذاتية القيادة، لا تكتفي الكاميرا برؤية الطريق فحسب، بل يجب عليها فهمه. فهي بحاجة إلى تحديد مشاة، أو علامة توقف، أو بقعة جليد بوضوح تام. هذه المهمة، المعروفة باسم "التجزئة الدلالية" (semantic segmentation)، تتضمن تعليم الكمبيوتر تصنيف كل بكسل في الصورة بالشيء الصحيح. ولكي تكون هذه الأنظمة آمنة، يجب ألا تكتفي بمجرد التخمين الصحيح؛ بل يجب أن تعرف متى تكون غير متأكدة. فإذا واجهت سيارة ذاتية القيادة مشهداً ضبابياً غريباً لم تره من قبل، فإن كونه نظاماً واثقاً بشكل خاطئ أخطر بكثير من كونه نظاماً غير متأكد وحذراً. إن هذه الحاجة إلى "الموثوقية" — وهي قدرة النموذج على مطابقة مستوى ثقته مع دقته الفعلية — لا تقل أهمية عن الدقة الخام للتنبؤ نفسه.
لقد شرع باحثون في معهد كارلسروه للتكنولوجيا في ألمانيا مؤخراً في استقصاء أداة محددة تُستخدم لتدريب أنظمة الرؤية هذه. فقد ركزوا على تقنية تسمى "CutMix"، وهي طريقة أصبحت شائعة للمساعدة في جعل الحواسيب تتعلم بشكل أسرع. وببساطة، تعمل تقنية CutMix عن طريق أخذ قطعة من صورة ما ولصقها على صورة أخرى، مع دمج أيضاً الملصقات التي تصف ما يوجد في الصورة. تخيل معلماً يري طالباً صورة لكلب وصورة لقط، ثم يقص رأس الكلب ويضعه على جسم القط، ويخبر الطالب أن الصورة الجديدة هي جزء من كلب وجزء من قط. هذا يجبر الكمبيوتر على النظر إلى الصورة بأكملها بدلاً من مجرد حفظ نقاط محددة. وبينما أظهرت هذه الطريقة قدرة على تحسين كيفية تعرف الحواسيب على الصور البسيطة، إلا أنه كان من غير الواضح كيف أثر ذلك على عملية التصنيف المعقدة لكل بكسل على حدة والمطلوبة للقيادة. والأهم من ذلك، أشارت دراسات حديثة إلى أن أطر التدريب المتقدمة التي تستخدم CutMix قد تجعل هذه الأنظمة في الواقع أقل موثوقية، مما يتسبب في جعلها مفرطة في الثقة عندما ينبغي لها أن تكون حذرة.
ولإيجاد الحقيقة، قام الباحثون بعزل تقنية CutMix عن جميع طرق التدريب المعقدة الأخرى. فقد قاموا بتدريب نوعين مختلفين من نماذج الرؤية الحاسوبية — أحدهما يعتمد على هياكل معالجة الصور التقليدية والآخر يعتمد على تصميمات جديدة قائمة على "المحولات" (transformers) — باستخدام صور شوارع مدينة قياسية. ثم اختبروا هذه النماذج في أيام صافية وفي أيام ذات ضباب كثيف، وهو سيناريو يمثل تغيراً كبيراً في البيئة. كان الهدف هو معرفة ما إذا كانت طريقة التدريب القائمة على "القص واللصق" ستساعد النماذج على البقاء دقيقة، أو البقاء معيرة جيداً، أو ببساطة التحسن في معرفة متى كانت تخمن.
كشفت النتائج عن صورة دقيقة تتحدى فكرة أن CutMix هي حل بسيط وشامل. فقد وجدت الدراسة أن استخدام CutMix لم يغير بشكل كبير مدى دقة النماذج في تصنيف الطريق أو الأشياء. وسواء تم تدريب النموذج باستخدام هذه التقنية أو بدونها، فإن عدد البكسلات التي تم تحديدها بشكل صحيح ظل كما هو إلى حد كبير. ومع ذلك، ظهر الفرق في كيفية تعبير النماذج عن ثقتها. فقد أصبحت النماذج المدربة باستخدام CutMix أفضل بكثير في التعرف على عدم يقينها الخاص. فعندما يرتكب النماذج خطأً، كانت النسخ المدربة بـ CutMix أكثر عرضة للإشارة إلى هذا الخطأ كحالة من عدم اليقين، بدلاً من الإعلان بثقة عن صحته. وقد ظل هذا التحسن قائماً حتى عندما تم اختبار النماذج في الضباب الكثيف، حيث كانت الظروف البصرية قاسية وغير مألوفة.
ولعل الأمر الأكثر إثارة للدهشة هو أن الباحثين وجدوا أن نماذج الرؤية الحاسوبية القديمة والتقليدية ظلت في الواقع أكثر موثوقية بشكل عام من نماذج "المحولات" الأحدث والأكثر تعقيداً، حتى عندما تم تدريب كليهما بنفس التقنيات. وتشير الدراسة إلى أن مشكلات الموثوقية التي لوحظت في بعض أطر التدريب المتقدمة ليست ناتجة عن تقنية CutMix نفسها. بدلاً من ذلك، يبدو أن طريقة "القص واللصق" هي أداة تعزز قدرة النموذج على الوثوق بمستويات ثقته، مما يجعلها شريكاً أكثر أماناً للتطبيقات في العالم الحقيقي. وقد خلص الباحثون إلى أنه بينما لا تجعل CutMix النموذج يرى بشكل أفضل، فإنها تجعله أكثر صدقاً بشأن ما يراه. وبالنسبة للأنظمة الحساسة للسلامة مثل القيادة الذاتية، فإن هذا التمييز حيوي للغاية: فالنظام الذي يعرف متى يكون مرتبكاً هو أكثر قيمة بكثير من نظام يتميز بالدقة فحسب ولكنه واثق بشكل أعمى.
ملخص تقني: تأثير تقنية CutMix على الموثوقية والمتانة في التجزئة الدلالية
بيان المشكلة
بينما حققت الشبكات العصبية العميقة نجاحاً ملحوما في التجزئة الدلالية، فإن نشرها في التطبيقات الحرجة للسلامة (مثل القيادة الذاتية) يتطلب تنبؤات لا تقتصر على الدقة فحسب، بل تتسم أيضاً بـ الموثوقية و المتانة. تُعرَّف الموثوقية هنا بأنها درجة تعبير ثقة النموذج عن الاحتمالية الحقيقية للصحة (المعايرة) وجودة تقديرات عدم اليقين.
تعتمد أطر التعلم شبه الموجه الحديثة، الضرورية نظراً لندرة البيانات المصنفة، بشكل كبير على تقنية CutMix كاستراتيجية أساسية لتعزيز البيانات. ومع ذلك، ظهرت نقطة عمياء حرجة: تشير الدراسات الحديثة إلى أن طرق التجزئة شبه الموجهة المتطورة يمكن أن تؤدي إلى تدهور شديد في موثوقية النموذج رغم الدقة العالية. وبما أن CutMix مكون مركزي في هذه الطرق، فمن غير الواضح ما إذا كانت CutMix نفسها هي التي تساهم في تدهور الموثوقية، أم أنها تقدم فوائد في مهام التنبؤ الكثيف كما لوحظ في مهام التصنيف. تهدف هذه الدراسة إلى عزل وتحليل التأثير المحدد لتقنية CutMix على دقة التجزئة، والمعايرة، وجودة عدم اليقين بشكل منهجي.
المنهجية
الإعداد التجريبي
تقيم الدراسة تأثير تدريب CutMix على بنيتين نموذجيتين:
DeepLabV3+: بنية تعتمد على الشبكات العصبية الالتفافية (CNN).
SegFormer: بنية تعتمد على المحولات الرؤيوية (ViT).
تم تدريب النماذج على مجموعة بيانات Cityscapes لمدة 250 حقبة (epoch) باستخدام جدول تعلم معدل متعدد الحدود ومحسن AdamW. ولعزل تأثير CutMix، تم تثبيت جميع المعلمات الفائقة الأخرى والتعزيزات القياسية (التحجيم العشوائي، الانعكاس الأفقي، والقص) ثابتة. طُبقت CutMix باحتمالية 50% أثناء التدريب.
مقاييس التقييم
تم تقييم الأداء باستخدام مزيج من المقاييس لالتقاط الدقة، والمعايرة، وعدم اليقين:
الدقة: متوسط التداخل فوق الاتحاد (mIoU).
المعايرة: خطأ المعايرة المتوقع (ECE)، الذي يقيس التفاوت بين الثقة التنبؤية والدقة التجريبية.
جودة عدم اليقين:
الإنتروبيا التنبؤية لكل بكسل (H(x)).
$p(acc|cer)$: احتمال أن يكون التنبؤ صحيحاً بالنظر إلى أنه مُصنف كـ "مؤكد".
$p(unc|inacc)$: احتمال أن يكون التنبؤ خاطئاً بالنظر إلى أنه مُصنف كـ "غير مؤكد".
درجة التجزئة الموثوقة (RSS): مقياس شامل يجمع المقاييس أعلاه عبر المتوسط التوافقي لمعاقبة الأداء الضعيف في أي جانب منفرد.
سيناريوهات التقييم
داخل النطاق (In-Domain): التقييم على مجموعة التحقق الخاصة بـ Cityscapes.
خارج النطاق (Out-of-Domain): التقييم على Foggy Cityscapes (مع معاملات تخفيف متغيرة β) دون إعادة التدريب، لتقييم المتانة تحت تحولات التوزيع (التدهور البصري).
النتائج الرئيسية
الأداء داخل النطاق
الدقة: كان لـ CutMix تأثير طفيف على دقة التجزئة (mIoU)، حيث حسنتها في ثلاث حالات فقط من أصل ست إعدادات للنماذج.
المعايرة: ظل خطأ المعايرة المتوقع (ECE) مستقراً نسبياً ولم يتغير بشكل كبير بفعل CutMix.
جودة عدم اليقين: حسنت CutMix بشكل مستمر جودة عدم اليقين عبر النماذج. ومن الجدير بالذكر أن المقياس $p(unc|inacc)$ أظهر مكاسب كبيرة، مما يشير إلى أن النماذج المدربة بـ CutMix أفضل في تحديد التنبؤات الخاطئة كحالات عدم يقين.
مقارنة البنى: بينما حققت الـ backbones الأكبر دقة mIoU أعلى، أظهرت بنيات DeepLabV3+ القديمة القائمة على CNN موثوقية إجمالية (RSS) متفوقة مقارنة بنماذج SegFormer القائمة على المحولات (Transformer)، لا سيما في جودة عدم اليقين.
المتانة خارج النطاق (Foggy Cityscapes)
الدقة: كما هو متوقع، انخفضت قيمة mIoU مع زيادة كثافة الضباب لجميع النماذج. وكان لـ CutMix تأثير محدود على متانة دقة التجزئة الخام.
الموثوقية تحت التحول: حافظت النماذج المدربة بـ CutMix على معايرة أفضل (ECE) و جودة عدم يقين متفوقة عبر معظم الإعدادات مقارنة بنظيراتها التي لا تستخدم CutMix.
اتجاهات البنى: أظهرت النماذج القائمة على المحولات (SegFormer) متانة أعلى من حيث تراجع mIoU والمعايرة تحت الظروف القاسية مقارنة بالشبكات الالتفافية (CNNs)، خاصة مع الـ backbones الأكبر (MiT-B3, MiT-B5).
الموثوقية الإجمالية: أكدت درجة RSS أن CutMix تؤدي إلى تقديرات أكثر موثوقية للمعايرة وعدم اليقين عبر مستويات الضباب المختلفة، حتى عندما ظلت دقة التجزئة الخام ثابتة.
الملاحظات النوعية
كشف التحليل البصري لخرائط عدم اليقين أنه بينما لم تغير CutMix تعيينات الفئات بشكل جوهري (بدت التنبؤات متشابهة بصرياً)، إلا أن النماذج المعززة بـ CutMix أظهرت عدم يقين أعلى في المناطق المقابلة للتنبؤات الخاطئة أو الغامضة. يشير هذا إلى أن النموذج يصبح أكثر وعياً بحدوده.
المساهمات والادعاءات الرئيسية
عزل تأثيرات CutMix: يعمل هذا العمل على فصل تأثير CutMix عن المكونات الأخرى للتعلم شبه الموجه (مثل التسمية الزائفة/pseudo-labeling)، ليكشف أن CutMix نفسها لا تضعف الموثوقية.
التمييز بين الموثوقية والدقة: توضح الدراسة أن CutMix تعزز بشكل أساسي موثوقية معايرة النموذج وعدم اليقين بدلاً من مجرد التنبؤ الخام بالتجزئة.
المتانة تجاه تحولات التوزيع: تعمل CutMix على تحسين موثوقية تقديرات عدم اليقين حتى تحت تحولات نطاق كبيرة (مثل الضباب الكثيف)، مما يجعل النماذج أكثر متانة في السيناريوهات الحرجة للسلامة.
الآثار المترتبة على التعلم شبه الموجه: تشير النتائج إلى أن تدهور الموثوقية الملاحظ في أطر التجزئة شبه الموجهة الحديثة (Landgraf et al., 2025b) لا يمكن عزوه إلى CutMix. بدلاً من ذلك، من المرجح أن التدهور ينبع من مكونات أخرى مثل التسمية الزائفة أو تنظيم الاتساق.
الأهمية
تخلص الورقة إلى أنه بالنسبة للنشر في البيئات الحرجة للسلامة، فإن تقديرات الثقة الموثوقة لا تقل أهمية عن الأداء الخام. ومن خلال إظهار أن CutMix تعزز كيفية تعبير النماذج عن عدم اليقين دون المساس بالدقة، تدعم هذه الدراسة استخدام CutMix كآلية لتحسين موثوقية النموذج. ويشير المؤلفون إلى أن العمل المستقبلي يجب أن يستقصي التفاعلات بين CutMix ومكونات التعلم شبه الموجه الأخرى لتحديد ما إذا كان يمكن لـ CutMix أن تعمل كآلية عامة لتعزيز الموثوقية عبر مجالات مختلفة، مثل التصوير الطبي أو الاستشعار عن بعد.