WeatherOcc3D: VLM-Assisted Adverse Weather Aware 3D Semantic Occupancy Prediction
يقترح WeatherOcc3D إطار عمل مبتكر يسخر نموذج الرؤية واللغة (VLM) لتعديل دمج الكاميرا والليدار ديناميكيًا بناءً على تلميحات الطقس اللغوية، مما يعالج بفعالية مشكلات موثوقية المستشعرات في الظروف القاسية ويحسن بشكل كبير أداء التنبؤ بالتواجد الدلالي ثلاثي الأبعاد على مجموعة بيانات nuScenes.
المؤلفون الأصليون:A. Enes Doruk, Abdelaziz Hussein, Hasan F. Ates
تخيل أنك تحاول قيادة سيارة عبر مدينة، ولكن لديك دليلان مختلفان تماماً يساعدانك على رؤية الطريق أمامك.
الدليل (أ) (الكاميرا): يشبه المصور الفوتوغرافي البشري. إنه بارع في رؤية الألوان، وقراءة لافتات الشوارع، ورصد المشاة في ضوء النهار الساطع. ولكن، إذا بدأت أمطار غزيرة بالهطول أو حلّ الظلام الدامس ليلاً، تصبح رؤيته مشوشة، أو باهتة، أو يعميها الوهج.
الدليل (ب) (الليدار - LiDAR): يشبه خفاشاً يستخدم تحديد الموقع بالصدى. هو يطلق أشعة غير مرئية لقياس المسافة والشكل. وهو بارع في رؤية الهندسة في الظلام أو الضباب، لكن الأمطار الغزيرة قد تشتت أشعته، مما يخلق "تشويشاً" أو ضجيجاً يربك عمله.
المشكلة: معضلة "الثقة" تحاول معظم السيارات ذاتية القيادة دمج هذين الدليلين عبر مجرد حساب متوسط آرائهما. لكن هذا يشبه سؤال مصور فوتوغرافي وخفاش عن إجابة واحدة دون مراعاة حالة الطقس. إذا كانت ليلة ممطرة، سيكون المصور عديم الفائدة، وسيكون الخفاش مرتبكاً. إن مجرد حساب المتوسط سيؤدي إلى الاستمرار في الاستماع للمصور المرتبك، مما يؤدي بالسيارة إلى ارتكاب أخطاء.
الحل: "المترجم الذكي" تقدم الورقة البحثية نظاماً جديداً يسمى WeatherOcc3D. فكر في هذا النظام كـ مترجم ذكي يتحدث لغة "الطقس" ولغة "التكنولوجيا".
المترجم (VLM/CLIP): يستخدم النظام نموذج ذكاء اصطناعي مدرب مسبقاً (يسمى نموذج الرؤية واللغة) قد قرأ ملايين الكتب ورأى ملايين الصور. هو يعرف ما "يعنيه" مصطلح "ليلة ممطرة" أو "يوم صافٍ". هو لا ينظر فقط إلى البكسلات؛ بل يفهم "قصة" الطقس.
المفتاح (آلية البوابة - Gating Mechanism): بناءً على ما يقوله المترجم، يقوم النظام بتبديل مفتاح.
سيناريو: يوم مشمس. يقول المترجم: "الجو مشرق وصافٍ!" يقوم النظام بالثقة في المصور (الكاميرا) تماماً لأن الألوان حادة. وهو يتجاهل الحواف الخشنة للخفاش (الليدار).
سيناريو: ليلة ممطرة. يقول المترجم: "الجو مظلم ومبلل!" يدرك النظام أن المصور أصبح أعمى. يقوم فوراً بالتحول للثقة في الخفاش (الليدار) من أجل الشكل والمسافة، بينما يطلب من المصور أن "يصمت" بشأن الألوان الباهتة.
النتيجة: بدلاً من الحصول على متوسط فوضوي، تحصل السيارة على صورة واضحة وموثوقة للطريق من خلال الاستماع فقط للدليل الذي يؤدي أفضل مهمة في الوقت الحالي.
كيف اختبروا ذلك اختبر الباحثون هذا "المترجم الذكي" على مجموعة بيانات قيادة شهيرة تسمى nuScenes. لقد أخذوا عقلين موجودين بالفعل من عقول القيادة ذاتية القيادة عالية الأداء (يُسميان OccMamba و M-CONet) وقاموا بتوصيل المترجم الجديد بهما.
الدرجة: في عالم القيادة ذاتية القيادة، تُسمى الدرجة mIoU (وهي مقياس لمدى دقة فهم السيارة للعالم ثلاثي الأبعاد).
حقق عقل "OccMamba" الأصلي 25.2.
مع المترجم الجديد، سجل 26.3.
حقق عقل "M-CONet" الأصلي 20.1.
مع المترجم الجديد، قفز إلى 21.1.
لماذا هذا مهم تزعم الورقة أن هذه الطريقة هي ترقية من نوع "التوصيل والتشغيل" (plug-and-play). فهي لا تتطلب إعادة بناء كمبيوتر السيارة بالكامل. كما أنها تضيف تأخراً ضئيلاً جداً (حوالي 2 ميلي ثانية فقط) ولكنها تجعل السيارة أكثر أماناً ودقة بشكل كبير عندما تسوء حالة الطقس. إنها تحل مشكلة "من أثق به؟" من خلال السماح لذكاء اصطناعي يفهم اللغة والطقس بتقرير أي مستشعر يجب الاستماع إليه في أي لحظة.
ملخص تقني: WeatherOcc3D
بيان المشكلة
يعد التنبؤ بالانشغال الدلالي ثلاثي الأبعاد (3D semantic occupancy prediction) أمراً بالغ الأهمية للملاحة في القيادة الذاتية، ومع ذلك فإن متانته محدودة جوهرياً بسبب التغيرات البيئية. وبينما تعمل الأنظمة متعددة الوسائط التي تدمج بيانات الكاميرا والليدار (LiDAR) على تعزيز الأداء بشكل عام، إلا أنها تواجه "مشكلة ثقة الوسائط" (modality trust problem) في الظروف القاسية. وتحديداً، تعاني مستشعرات الكاميرا من تدهور شديد في الرؤية أثناء الهطول الغزير للأمطار، بينما تواجه مستشعرات الليدار ضوضاء ناتجة عن التشتت الخلفي (backscatter noise) أثناء المطر. تفشل استراتيجيات الدمج الحالية المتطورة، مثل النماذج القائمة على الانتباه (مثل OccFusion وGaussianOcc3D)، في التكيف مع إعادة وزن المدخلات عندما يصبح مستشعر معين غير موثوق به. علاوة على ذلك، غالباً ما تتكبد هذه الطرق تكاليف ذاكرة باهظة أو تعامل مدخلات المستشعرات على أنها متساوية في الموثوقية بغض النظر عن الضوضاء الجوية. وفي حين تستخدم مناهج نماذج الرؤية واللغة (VLM) الحديثة التمثيلات اللغوية للحصول على أولويات دلالية، إلا أنها نادراً ما تعالج التحدي المحدد المتعلق بثقة المستشعرات في ظروف الطقس المتدهورة.
المنهجية
يقترح المؤلفون WeatherOcc3D، وهو إطار عمل مدعوم بنماذج الرؤية واللغة (VLM) مصمم لتوجيه التكامل متعدد المستشعرات عبر الإشارات البيئية اللغوية. يعمل الهيكل كنظام متعدد الوسائط متكامل (end-to-end) مع المكونات الرئيسية التالية:
استخراج الميزات:
الكاميرا: يتم معالجة صور الرؤية المحيطية من خلال مشفر ثنائي الأبعاد (ResNet + FPN) ويتم إسقاطها في الفضاء ثلاثي الأبعاد باستخدام محول الرؤية (Lift-Splat-Shoot) لتوليد ميزات فوكسل الكاميرا (Vcam).
الليدار (LiDAR): تتم معالجة السحب النقطية من خلال مشفر ثلاثي الأبعاد لتوليد ميزات فوكسل الليدار (Vpts).
الإدراك البيئي والتحفيز (Prompting):
يقوم وحدة تنبؤ بالطقس بتحليل الميزات ثنائية الأبعاد للتنبؤ بالحالات البيئية: الرؤية (صافية/ممطرة) والإضاءة (نهار/ليل).
يتم تحويل هذه الحالات المتنبأ بها إلى محفزات نصية (على سبيل المثال: "ليل ممطر، وهج كاميرا شديد").
يقوم مشفر نصي CLIP مدرب مسبقاً (متخصص عبر تقنية LoRA) بتشفير هذه المحفزات إلى تمثيل بيئي دقيق (fenv). وتقوم طبقة إسقاط برسم هذا التمثيل إلى أبعاد نموذج الميزات.
آلية البوابات المجزأة (Factorized Gating Mechanism): يستخدم الإطار استراتيجية دمج تكيفية ثنائية المستويات مدفوعة بـ fenv:
البوابة على مستوى القنوات (Channel-Level Gating): يقوم التمثيل بتوليد أقنعة بوابات (Gcam,Gpts) يتم تطبيقها عبر الضرب العنصري. وهذا يسمح للنموذج بكبح القنوات الملوثة بالضوضاء بشكل انتقائي ضمن كل وسيط بناءً على السياق البيئي المحدد.
الوزن العالمي (Global Weighting): يتم تحويل التمثيل إلى قيمة عددية قابلة للتعلم (wenv) عبر شبكة MLP ودالة sigmoid. تمثل هذه القيمة الثقة العالمية للنموذج في الوسيط البصري.
الدمج: يتم حساب التمثيل المدمج النهائي (Vfused) كمجموع مرجح: Vfused=wenv(GcamVcam)+(1−wenv)(GptsVpts) تتيح هذه الآلية للنموذج إعطاء الأولوية للميزات الدلالية للكاميرا في ضوء النهار الصافي، مع التحول إلى الاعتماد على الأولويات الهندسية للليدار أثناء الليالي الممطرة.
التحسين (Optimization): يتم تدريب النموذج باستخدام دالة هدف متعددة المهام تجمع بين فقدان التنبؤ بالانشغال (cross-entropy و Lovász-Softmax) وفقدان التنبؤ بالطقس (binary cross-entropy للرؤية والإضاءة).
المساهمات الرئيسية
البوابات المجزأة الموجهة بنماذج الرؤية واللغة (VLM-Guided Factorized Gating): على عكس طرق الانتباه كثيفة الذاكرة، يقدم البحث آلية بوابات فعالة من حيث المعلمات تقوم بتفكيك عدم اليقين البيئي إلى عوامل رؤية وإضاءة مستقلة لتعديل نسب الدمج ديناميكياً.
حل مشكلة ثقة الوسائط (Modality Trust Resolution): يعالج الإطار صراحةً مشكلة ثقة الوسائط باستخدام الإشارات اللغوية لكبح القنوات الملوثة بالضوضاء وتعديل أوزان الدمج العالمية، بدلاً من معاملة المستشعرات على أنها متساوية في الموثوقية.
تعدد الاستخدامات (Plug-and-Play Versatility): تم تصميم الطريقة كمكون نمطي يمكن دمجه في البنى الحالية دون الحاجة إلى إعادة هيكلة كاملة.
النتائج التجريبية
أُجريت التقييمات على مجموعة التحقق nuScenes-OpenOccupancy.
مكاسب الأداء:
عند دمجه مع OccMamba، حقق الإطار 26.3 mIoU، وهو تحسن بمقدار 1.1 mIoU عن النموذج الأساسي.
عند دمجه مع M-CONet، حقق 21.1 mIoU، وهو تحسن بمقدار 1.0 mIoU.
كانت التحسينات متسقة عبر جميع الفئات الدلالية الـ 17.
المتانة في الطقس السيئ:
في ظروف الليل، حسن النموذج الـ mIoU من 11.8 إلى 15.7 (+3.9).
في الظروف الممطرة، حسن الـ mIoU من 24.1 إلى 27.3 (+3.2).
الكفاءة:
أضافت الوحدة المقترحة 2.14 مللي ثانية فقط من زمن التأخير (latency)، متفوقة على طريقة ACLF التي بلغت (3.21 مللي ثانية) مع تحقيق درجات تقسيم أعلى (+0.8 mIoU عن ACLF).
الأهمية والادعاءات
يزعم البحث أن WeatherOcc3D يؤسس لنموذج أكثر متانة للإدراك متعدد الوسائط في القيادة الذاتية. ومن خلال الاستفادة من الفضاء الكامن لنموذج CLIP لتفسير الواصفات البيئية، يوفر الإطار حلاً فعالاً من الناحية الحسابية لمشكلة ثقة الوسائط. ويؤكد المؤلفون أن نهجهم يقلل بفعالية من تدهور المستشعرات، لا سيما في أكثر المجموعات الفرعية للطقس السيئ تحدياً، مما يقدم تحسناً كبيراً مقارنة بنماذج الدمج الثابتة التقليدية دون تحمل عبء الذاكرة العالي لطرق بديلة تعتمد على الانتباه. ويظهر العمل أن التكيف الديناميكي لأوزان الدمج بناءً على الرؤية والإضاءة البيئية أمر ضروري للتنبؤ بالانشغال الدلالي ثلاثي الأبعاد الموثوق في سيناريوهات العالم الحقيقي.