CLFTv2: Efficient Camera-LiDAR Fusion for Semantic Segmentation via Hierarchical Feature Pyramids
CLFTv2 एक कुशल कैमरा-LiDAR फ्यूजन फ्रेमवर्क है जो सिमेंटिक सेगमेंटेशन के लिए ग्लोबल ViT अटेंशन को एक पदानुक्रमित (hierarchical) Swin-आधारित एनकोडर और लाइटवेट डिकोडर से बदल देता है, जिससे क्वेरी-आधारित और ग्लोबल-अटेंशन विकल्पों की तुलना में कंप्यूटेशनल लागत को कम करते हुए वल्नरेबल रोड यूजर डिटेक्शन और थ्रूपुट में महत्वपूर्ण सुधार होता है।