CLFTv2: Efficient Camera-LiDAR Fusion for Semantic Segmentation via Hierarchical Feature Pyramids
يُعد CLFTv2 إطار عمل فعال لدمج الكاميرا والليدار (LiDAR) من أجل التجزئة الدلالية، حيث يستبدل انتباه المحولات الرؤية (ViT) العالمي بمُشفر هرمي قائم على Swin وفك تشفير خفيف الوزن لتحسين اكتشاف مستخدمي الطريق المعرضين للخطر والإنتاجية بشكل كبير مع تقليل التكاليف الحسابية مقارنة بالبدائل القائمة على الاستعلام والانتباه العالمي.