Open-Vocabulary Domain Generalization in Urban-Scene Segmentation
تقدم هذه الورقة البحثية "التعميم النطاقي مفتوح المفردات في التجزئة الدلالية" (OVDG-SS)، وهو إطار عمل ومعيار جديد للقيادة الذاتية يعالج كلاً من النطاقات والفئات غير المرئية، وتقترح آلية S2-Corr، وهي آلية مدفوعة بحالة الفضاء لتنقية الارتباطات بين النص والصورة في نماذج الرؤية واللغة لتحقيق أداء قوي عبر البيئات الحضرية المتنوعة.
المؤلفون الأصليون:Dong Zhao, Qi Zang, Nan Pu, Wenjing Li, Nicu Sebe, Zhun Zhong
تخيل أنك تعلم روبوتاً قيادة السيارات كيف يتنقل في المدينة.
الطريقة القديمة: "الطالب الملتزم" تقليدياً، كنا نعلم الروبوتات عبر عرض آلاف الصور لأيام مشمسة ذات طرق صافية، وسيارات، وأشخاص. تعلم الروبوت التعرف على هذه الأشياء المحددة.
المشكلة: إذا وضعت هذا الروبوت فجأة في عاصفة مطرية غزيرة، أو نفق مظلم، أو منطقة بناء بها أشياء جديدة غريبة (مثل مظلة عملاقة أو حاجز شرطة)، يصاب الروبوت بالذعر. يقول: "أنا لا أعرف ما هذا!" أو "هل هذه سيارة؟ لا، انتظر، إنها تمطر!" إنه يفشل لأنه تعلم فقط قائمة ثابتة من القواعد لقائمة ثابتة من الأشياء.
الفكرة الجديدة: "المستكشف منفتح العقل" يقدم هذا البحث طريقة جديدة للتفكير تسمى OVDG-SS (التعميم النطاقي مفتوح المفردات). فكر في هذا كتدريب الروبوت ليكون مستكشفاً بدلاً من مجرد طالب.
المفردات المفتوحة (Open Vocabulary): بدلاً من حفظ قائمة من 10 أشياء، يتعلم الروبوت فهم المفاهيم. إذا قلت له: "ابحث عن 'مخروط مروري'"، سيعرف ما هو المخروط حتى لو لم يره من قبل. إنه يستخدم "قاموساً" (أوصاف نصية) لفهم العالم.
التعميم النطاقي (Domain Generalization): يتعلم الروبوت التعرف على هذه المفاهيم حتى عندما تتغير "الأجواء". لا ينبغي أن يهم ما إذا كانت الشمس مشرقة، أو كانت الثلوج تتساقط، أو كانت الكاميرا ضبابية؛ يجب أن يظل الروبوت عارفاً بماهية "الطريق" أو "الشخص".
التحدي الكبير: "الراديو المشوش" وجد الباحثون مشكلة رئيسية في الروبوتات "الذكية" الحالية. فهي تستخدم أداة قوية (مثل مكتبة فائقة الذكاء تسمى نموذج الرؤية واللغة) لربط الصور بالكلمات.
التشبيه: تخيل أنك تحاول الاستماع إلى محطة راديو (كلمة "طريق") أثناء القيادة عبر نفق (بيئة جديدة). النفق يسبب تشويشاً وضوضاء. الإشارة تصبح مشوهة ومضطربة. الروبوت يسمع "طريق" لكن التشويش يجعله يظن أنه قد يكون "عشباً" أو "سماءً".
من الناحية التقنية، عندما تتغير البيئة (الإضاءة، الطقس، الموقع)، يصبح الاتصال بين الصورة والنص "مشوشاً" ومربكاً. يبدأ الروبوت في رؤية أشياء ليست موجودة أو تفويت أشياء موجودة بالفعل.
الحل: S2-Corr (منظف الإشارة) لإصلاح ذلك، بنى المؤلفون وحدة جديدة تسمى S2-Corr. فكر فيها كأنها سماعات رأس متطورة عازلة للضوضاء لعقل الروبوت.
إليك كيف تعمل، باستخدام تشبيه بسيط:
مسح الثعبان (المسار): تخيل أن الروبوت يقرأ سطراً طويلاً من النص (الصورة). الطرق القديمة تقرأه مثل الروبوت: من اليسار إلى اليمين، ومن الأعلى إلى الأسفل، بصرامة. إذا كان هناك خطأ مطبعي (ضجيج) في البداية، يصاب الروبوت بالارتباك لبقية الجملة.
S2-Corr يقرأ النص مثل الثعبان. يتلوى ذهاباً وإياباً (متعرجاً). هذا يساعده على الحفاظ على سياق "الجوار" (البنية المكانية) سليماً. إذا رأى ضجيجاً غريباً في مكان ما، فإنه لا يسمح لهذا الضجيج بإفساد الجملة بأكملها لأنه يستمر في تفقد محيطه.
بوابة الاضمحلال (الفلتر): تخيل أن الروبوت يتذكر قصة. أحياناً، تكون الذكريات القديمة (من بيانات التدريب) خاطئة بالنسبة للموقف الحالي.
S2-Corr لديه "بوابة نسيان" خاصة. إذا كانت قطعة من المعلومات قديمة جداً أو مشوشة للغاية (مثل ذكرى مليئة بالتشويش ليوم مشمس بينما تمطر الآن)، فإن البوابة تقول: "اترك ذلك يرحل". إنها تصفي البيانات السيئة بحيث تمر فقط المعلومات الواضحة وذات الصلة.
التلميح السياقي (المترجم): قبل أن يحاول الروبوت فهم الصورة، يعطيه S2-Corr تلميحاً صغيراً بناءً على الطقس الحالي.
التشبيه: إذا كانت تمطر، يحصل الروبوت على ملاحظة تقول: "مهلاً، تذكر، الأشياء تبدو أكثر قتامة ورطوبة اليوم". هذا يساعد الروبوت على ضبط توقعاته حتى لا يرتبك بسبب المطر.
النتيجة باستخدام هذا "المنظف للإشارة"، يمكن للروبوت الآن:
القيادة في المطر، أو الثلج، أو في الليل.
التعرف على أشياء جديدة لم يسبق له رؤيتها من قبل (مثل حاجز بناء أو كلب ضال) بمجرد قراءة اسمها.
القيام بكل هذا بسرعة أكبر وبقدر أقل من قوة المعالجة الحاسوبية مقارنة بالطرق السابقة.
باختالاختصار يتعلق هذا البحث بتعليم السيارات ذاتية القيادة كيف تكون قابلة للتكيف. بدلاً من مجرد حفظ خريطة لمدينة مشمسة، إنها تتعلم فهم مفهوم المدينة، بغض النظر عن الطقس أو الأشياء الغريبة الجديدة التي قد تواجهها. لقد فعلوا ذلك من خلال بناء "فلتر ضوضاء" أكثر ذكاءً يحافظ على وضوح رؤية الروبوت حتى عندما يصبح العالم فوضوياً.
إليك ملخص تقني مفصل لورقة البحث بعنوان "Open-Vocabulary Domain Generalization in Urban-Scene Segmentation" من إعداد دونج تشاو وآخرون.
1. تعريف المشكلة: OVDG-SS
تعالج الورقة فجوة حرجة في إدراك القيادة الذاتية: عدم قدرة النماذج الحالية على التعامل في آن واحد مع المجالات غير المرئية (مثل الطقس السيئ، الليل، المناطق الجغرافية المختلفة) والفئات غير المرئية (مثل حواجض البناء، مخاريط المرور، الحيوانات، الأنفاق) ضمن إطار عمل واحد.
محدودية النهج الحالية:
التعميم المجالي (DG-SS): نماذج قوية تجاه تحولات المجال ولكنها تقتصر على مجموعة مغلقة وثابتة من فئات التدريب، وتفشل في التعرف على الكائنات الجديدة.
التجزئة مفتوحة المفردات (OV-SS): نماذج قادرة على التعرف على فئات جديدة عبر مطالبات نصية (باستخدام نماذج الرؤية واللغة مثل CLIP) ولكنها شديدة الحساسية لتحولات المجال؛ حيث يتدهور أداؤها بشكل كبير عند نشرها في بيئات مختلفة عن بيانات تدريبها (مثل التحول من البيئة الاصطناعية إلى الواقعية أو الطقس السيئ).
الإطار المقترح: قدم المؤلفون إطار التعميم المجالي مفتوح المفردات في التجزئة الدلالية (OVDG-SS). يتطلب هذا الإطار من النموذج التعميم إلى مجالات مستهدفة غير مرئية مع التعرف على كل من فئات المصدر ومفردات واسعة من الفئات غير المرئية.
2. التحليل الجوهري: لماذا تفشل أنظمة OV-SS؟
حدد المؤلفون أن نمط الفشل الرئيسي لأنظمة OV-SS تحت تأثير تحولات المجال هو تشوه الارتباط بين النص والصورة.
انتشار الضجيج: في مسارات OV-SS القياسية (مثل CAT-Seg)، يصبح مخطط الارتباط الأولي بين ميزات الصورة والتمثيلات النصية (embeddings) مشوشاً وغير متوافق عند حدوث تحول في المجال.
خلل آلية الانتباه: تستخدم الطرق الحالية "الانتباه المتقاطع" (cross-attention) لتنقية هذه الارتباطات. ومع ذلك، إذا كان مخطط الارتباط الأولي يحتوي على ضجيج ناتج عن تغير المجال، فإن آلية الانتباه تعامل هذه التنشيطات المشوشة كأنها مفاتيح/قيم (keys/values) صالحة، مما يؤدي إلى انتشار الأخطاء وتضخمها عبر الأبعاد المكانية والفئوية.
3. المنهجية: S2-Corr
لمعالجة هذه المشكلات، اقترح المؤلفون S2-Corr، وهو آلية مبتكرة لتنقية الارتباط بين النص والصورة مدفوعة بنموذج الحالة الفراغية (State-Space). بدلاً من الاعتماد على التجميع القائم على الانتباه، يستخدم S2-Corr نماذج الحالة الفراغية الانتقائية (SSMs) لمعالجة الارتباطات بشكل تسلسلي.
المكونات الرئيسية لـ S2-Corr:
تجميع نموذج الحالة الفراغية الانتقائي (SSM Aggregation):
يستبدل التعقيد التربيعي للانتباه المتقاطع (O(N2)) بمعالجة تسلسلية ذات زمن خطي (O(N)).
الآلية: يقوم بمعالجة تمثيلات الارتباط كمتتالية أحادية البعد (1D sequence). يقوم نموذج حالة فراغية مستمر بالزمن بتحديث الحالة الخفية ht بناءً على المدخل الحالي xt والحالة السابقة ht−1.
الفائدة: يتضمن الـ SSM "بوابة اضمحلال" (At) تتحكم ديناميكياً في مقدار المعلومات الماضية التي يتم الحفاظ عليها. إذا كانت الحالة السابقة مشوشة (بسبب تحول المجال)، يمكن للبوابة "نسيانها" بفعالية، مما يمنع انتشار الضجيج.
التعديل قبل التجميع (Modulation Before Aggregation):
التعديل البصري: حقن إشارات محددة للصورة في تمثيلات الارتباط قبل المعاللة التسلسلية لتحسين الاتساق المكاني. est التعديل النصي: استخدام مطالبات نصية متعددة المجالات (مثل "صورة لقط في المطر") لتوليد ميزات نصية مدركة للمجال. تقوم هذه الميزات بتعديل تمثيلات الفئات، مما يسمح للنموذج بتكييف فهمه الدلالي مع ظروف المجال المحددة.
أولوية الاضمحلال الهندسي القابلة للتعلم:
للحد من تراكم الضجيج بعيد المدى المتأصل في النماذج التسلسلية، تم إدخال أولوية اضمحلال هندسي قابلة للتعلم. وهي توازن بين البوابة المدفوعة بالبيانات ونمط اضمحلال هندسي ثابت، مما يضمن كبح الارتباطات البعيدة والتي قد تكون مشوشة.
استراتيجية المسح المتعرج عبر الكتل (Chunk-wise Snake Scanning Strategy):
للحفاظ على الاستمرارية المكانية ثنائية الأبعاد أثناء معالجة متتالية أحادية البعد، يتم تقسيم شبكة الصورة إلى كتل.
يُستخدم مسح متعرج (على شكل ثعبان) (تبادل اتجاه المسح صفاً بصف) لتقليل الانقطاعات عند حدود الصفوف.
يتم تمرير الحالة الخفية النهائية لكتلة ما كحالة أولية للكتلة التالية، مما يضمن انتشاراً سلساً للميزات عبر الصورة بأكملها.
4. الاختبار والبيانات
أنشأ المؤلفون أول اختبار شامل لـ OVDG-SS في القيادة الذاتية:
مجالات المصدر: Cityscapes (7 فئات، CS-7) و GTA-V (7 فئات، GTA-7).
Dv-58: تم توسيعها إلى 58 فئة، تشمل أكثر من 30 فئة إضافية (مثل الحواجض، المخاريط، الحيوانات، الأنفاق، السكك الحديدية) التي تم إنشاؤها عبر تقنية Inpainting لنموذج Stable Diffusion والتنقيح اليدوي.
الإعدادات: من اصطناعي إلى واقعي (GTA → Real) ومن واقعي إلى واقعي (Cityscapes → مناطق أخرى/ظروف جوية أخرى).
5. النتائج التجريبية
تظهر التجارب المكثفة أن S2-Corr يتفوق على الطرق الرائدة (بما في ذلك CAT-Seg، وMaskAdapter، وCLIPSelf، وطرق DG المحددة) في جميع الإعدادات.
مكاسب الأداء:
من واقعي إلى واقعي (ViT-B/16): حقق 50.3% mIoU في Dv-19 (متجاوزاً أفضل نتيجة سابقة بـ 4.3 نقطة) و 47.9% في Dv-58.
من اصطناعي إلى واقعي (ViT-B/16): حقق 48.2% في Dv-19 و 46.7% في Dv-58.
المفردات الكبيرة: حسن الأداء باستمرار في الفئات غير المرئية (مثل الأنفاق، السكك الحديدية، معدات البناء) حيث فشلت الطرق الأخرى تماماً.
الكفاءة:
يعد S2-Corr أسرع بكثير وأكثر كفاءة في استهلاك الذاكرة من النماذج المرجعية القائمة على الانتباه.
معدل الإطارات (FPS): بلغ 26.1 FPS (مقابل 15.4 لـ CAT-Seg) في المفردات القياسية، وحافظ على 18.3 FPS حتى مع مفردات مكونة من 150 فئة (حيث ينخفض CAT-Seg إلى 5.7 FPS).
وقت التدريب: انخفض إلى حوالي 140 دقيقة مقارنة بـ 180-220 دقيقة للمنافسين.
6. المساهمات الرئيسية
إطار عمل جديد: تحديد وصياغة OVDG-SS، لسد الفجوة بين التعميم المجالي والتجزئة مفتوحة المفردات.
أول اختبار شامل: إصدار اختبار شامل يغطي مجالات متنوعة غير مرئية وأكثر من 50 فئة، بما في ذلك سيناريوهات التعميم من الاصطناعي إلى الواقعي ومن الواقعي إلى الواقعي.
بنية مبتكرة (S2-Corr): اقتراح وحدة تنقية ارتباط مدفوعة بنموذج الحالة الفراغية تعمل بفعالية على كبح الضجيج الناتج عن تغير المجال، متفوقة على التجميع القائم على الانتباه.
أداء رائد (SOTA): إثبات دقة وقوة وكفاءة حوسبية فائقة، مما يضع معياراً جديداً لإدراك المشاهد الحضرية في العالم المفتوح.
7. الأهمية
هذا العمل مهم لنشر أنظمة القيادة الذاتية في العالم الحقيقي. فهو يتجاوز افتراض "المجموعة المغلقة"، مما يمكّن المركبات من التنقل والتعرف بأمان على الكائنات الجديدة (مثل مناطق البناء أو العوائق غير المتوقعة) تحت ظروف بيئية متغيرة (مطر، ليل، ضباب) دون الحاجة إلى إعادة التدريب. توفر آلية S2-Corr المقترحة حلاً قابلاً للتوسع وفعالاً لبناء أنظمة إدراك قوية في العالم المفتوح.