CLFTv2: Efficient Camera-LiDAR Fusion for Semantic Segmentation via Hierarchical Feature Pyramids
يُعد CLFTv2 إطار عمل فعال لدمج الكاميرا والليدار (LiDAR) من أجل التجزئة الدلالية، حيث يستبدل انتباه المحولات الرؤية (ViT) العالمي بمُشفر هرمي قائم على Swin وفك تشفير خفيف الوزن لتحسين اكتشاف مستخدمي الطريق المعرضين للخطر والإنتاجية بشكل كبير مع تقليل التكاليف الحسابية مقارنة بالبدائل القائمة على الاستعلام والانتباه العالمي.
المؤلفون الأصليون:Toomas Tahves, Mauro Bellone, Raivo Sell
تعتمد المركبات ذاتية القيادة على تدفق مستمر من البيانات الحسية للتنقل في العالم، لكن الرؤية لا تعني بالضرورة الفهم. لكي تقود السيارة بأمان، يجب عليها التمييز بين خط مرسوم على الطريق وبين مشاة ينزلون من على الرصيف، حتى عندما يكون هذا الشخص صغيراً، أو بعيداً، أو محجوباً جزئياً. توفر الكاميرات ألواناً وأنسجة غنية، مما يسمح للمركبة بالتعرف على الأشكال واللافتات، لكنها لا تستطيع قياس المسافة بيقين. أما نظام "ليدار" (Lidar)، وهو نظام مسح يعتمد على الليزر، فيوفر هندسة ثلاثية الأبعاد دقيقة، ويرسم شكل الأجسام في الفراغ، ولكنه غالباً ما ينتج بيانات متفرقة تصبح فارغة بشكل متزايد مع زيادة المسافة. لسنوات، حاول المهندسون دمج هذين التدفقين المتميزين من المعلومات في صورة واحدة موثوقة. ويكمن التحدي في معالجة هذه الكمية الهائلة من البيانات بسرعة كافية للقيادة في الوقت الفعلي مع ضمان عدم تفويت الأهداف الأكثر أهمية، مثل المشاة وراكبي الدراجات.
قدم الباحثون توماس تافس، وماورو بيلوني، ورايفو سيل نهجاً جديداً لهذه المشكلة يسمى CLFTv2. يركز عملهم على نوع محدد من بنية الذكاء الاصطناعي المصممة لدمج بيانات الكاميرا والليدار بكفاءة أكبر من الطرق السابقة. في الماضي، استخدمت بعض الأنظمة الرائدة آلية تُعرف باسم "شبكة الانتباه العالمي"، والتي تحاول النظر إلى كل جزء من الصورة وكل جزء من المسح ثلاثي الأبعاد في وقت واحد لإيجاد الروابط. ورغم قوتها، إلا أن هذه الطريقة ثقيلة حوسبياً، وتتطلب قدرة معالجة هائلة يمكن أن تبطئ كمبيوتر المركبة. اقترح المؤلفون استبدال هذه الرؤية الشاملة بنظام هرمي قائم على النوافذ. فبدلاً من مسح المشهد بأكره دفعة واحدة، يقوم نموذجهم بتقسيم الصورة إلى نوافذ أصغر ومتحركة، حيث يعالج التفاصيل المحلية أولاً ثم يبني فهماً أوسع. يحاكي هذا الهيكل كيفية عمل الرؤية البشرية غالباً، حيث تركز على المحيط المباشر قبل دمجها في سياق أكبر.
اختبر الفريق هذا الإطار الجديد عبر ثلاث مجموعات بيانات رئيسية للقيادة تمثل بيئات مختلفة: مجموعة بيانات Zenseact المفتوحة من السويد، ومجموعة بيانات Waymo المفتوحة من الولايات المتحدة، ومجموعة بيانات ISEAuto من إستونيا. تختلف مجموعات البيانات هذه في الطقس، وظروف الطريق، وكيفية تصنيف البيانات، مما يوفر اختباراً صارماً لقدرة النظام على التكيف. وأظهرت النتائج أن CLFTv2 نجح في تحديد مستخدمي الطريق المعرضين للخطر بموثوقية عالية. ففي مجموعة بيانات Waymo، حقق النظام درجة أداء بلغت 61.7 بالمئة، وهو تحسن كبير عن الإصدارات السابقة لتقنية مماثلة. وفي مجموعة بيانات ZOD، وصل إلى 53.5 بالمئة، وهي قفزة ملحوية حسنت بشكل خاص من اكتشاف المشاة واللافتات المرورية. ولعل الأهم من ذلك هو أن النظام الجديد فعل ذلك باستخدام طاقة حوسبية أقل بكثير من منافسيه؛ فقد تطلب حوالي نصف الطاقة التي تستهلكها بعض النماذج عالية الأداء الحالية، وعالج البيانات بسرعة تزيد عن الضعف، مما يجعله خياراً أكثر عملية للأجهزة المحدودة الموجودة داخل سيارة حقيقية.
ومع ذلك، كشفت الدراسة أيضاً عن مقايضة دقيقة في كيفية معالجة هذه الأنظمة للمعلومات. فبينما أثبت النهج القائم على النوافذ كفاءة وفعالية عالية في معظم مجموعات البيانات، وجد الباحثون أنه في مجموعة بيانات Waymo، التي تحتوي على مسحات ليدار كثيفة وتفصيلية للغاية، لا يزال النظام الذي يمتلك رؤية عالمية شاملة يحتفظ بميزة طفيفة في دمج نوعي البيانات. ففي بعض الأحيان، تعثرت النوافذ المحلية للنظام الجديد في ربط النقاط ببعضها في مثل هذه البيئات الهندسية الكثيفة مقارنة بالمنهج العالمي. وهذا يشير إلى أنه بينما يعد هذا الهيكل الجديد خطوة كبيرة للأمام من حيث الكفاءة، فإن الحل الأمثل قد يتطلب في النهاية نهجاً هجيناً يجمع بين سرعة المعالجة المحلية والمدى الواسع للانتباه العالمي.
كما بحث الباحثون في كيفية تعامل النظام مع أنواع مختلفة من الإشراف على البيانات. في بعض مجموعات البيانات، تم إنشاء تسميات "الحقيقة الأرضية" بواسطة خوارزميات أخرى بدلاً من المنسقين البشريين، مما أدخل طبقة من عدم اليقين. وبالرغم من ذلك، تعلم النموذج الجديد التعميم بشكل جيد، مما أظهر أن قدرته على الجمع بين الإشارات البصرية والهندسية قوية حتى عندما تكون بيانات التدريب غير مثالية. تؤكد الدراسة أنه بالنسبة المهمة المحددة لتحديد الأجسام الصغيرة والحرجة مثل المشاة، يمكن لنظام دمج خفيف الوزن ومصمم بعناية أن يتفوق على النماذج الأثقل والأكثر تعقيداً بكثير. ومن خلال إعطاء الأولوية لاكتشاف مستخدمي الطريق المعرضين للخطر، يضمن النظام بقاء السلامة هي الهدف الأساسي، حتى مع استمرار نمو المتطلبات الحوسبية للقيادة الذاتية. ويثبت هذا العمل أنه في السباق لبناء سيارات ذاتية القيادة أكثر أماناً، يكون النهج المركز والفعال أحياناً أكثر فاعلية من المحاولة العنيفة لرؤية كل شيء في آن واحد.
ملخص تقني لـ CLFTv2: دمج فعال بين الكاميرا والليدار للتقطيع الدلالي عبر الهياكل الهرمية للميزات
بيان المشكلة تواجه عملية التقطيع الدلالي (Semantic segmentation) في مجال القيادة الذاتية تحديًا حرجًا: وهو الكشف الموثوق عن مستخدمي الطرق الضعفاء (VRUs)، مثل المشاة، الذين غالبًا ما تكون بصمتهم من حيث عدد البكسلات في الصور المنظورية ضئيلة للغاية (0.3–0.4% من إجمالي البكسلات) ومع ذلك فهي حيوية للسلامة. وبينما توفر الكاميرات ألوانًا وأنسجة كثيفة، إلا أنها تفتقر إلى العمق المتري؛ وعلى العكس من ذلك، يوفر الليدار (LiDAR) هندسة ثلاثية الأبعاد ولكن بـسحابة نقاط تزداد تشتتًا مع المسافة. غالبًا ما تعاني مناهج الدمج متعددة الوسائط الحالية من عدم الكفاءة الحسابية أو تفشل في استخراج ميزات موثوقة للأجسام الصغيرة والبعيدة. وتحديدًا، تعاني مشفرات "محول الرؤية" (Vision Transformer - ViT) القائمة على الـ ViT، رغم فعاليتها في السياق عبر الوسائط، من تعقيد حسابي تربيعي وتحافظ عادةً على دقة مكانية ثابتة واحدة، مما يجعل توليد هياكل هرمية متعددة المقاييس (المطلوبة للكشف عن الأجسام الصغيرة) أمرًا مكلفًا حسابيًا.
المنهجية يقترح المؤلفون CLFTv2، وهو إطار عمل هرمي لدمج الكاميرا والليدار يعمل بالكامل ضمن نطاق الإسقاط المنظوري ثنائي الأبعاد. يستبدل هذا المعمار نموذج "Swin Transformer" بدلاً من آليات الانتباه العالمي المستخدمة في نماذج ViT القياسية، مع وحدة فك تشفير خفيفة الوزن من نوع شبكة الهرم الميزاتي (FPN).
العمود الفقوي الهرمي: يستخدم CLFTv2 مشفرين من نوع Swin Transformer يتشاركان في الأوزان (بنية سيامية - Siamese architecture) لمعالجة صور الكاميرا (RGB) المحاذية وخرائط إحداثيات الليدار المسقطة. يتم ترميز مدخلات الليدار كـ "تنسور" كثيف مكون من 3 قنوات (إحداثيات X، Y، Z) لضمان التوافق الهيكلي مع النماذج الرؤيوية القياسية. يستخدم معمار Swin آلية الانتباه الذاتي للنافذة المزاحة (shifted-window self-attention)، مما يقيد الحسابات داخل نوافذ محلية بمقاس M×M. يقلل هذا من التعقيد من الدرجة التربيعية إلى الدرجة الخطية بالنسبة لدقة الصورة. وتعمل طبقات دمج الرقع (Patch merging) على إنشاء هرم ميزاتي رباعي المراحل، مما يوفر بشكل طبيعي تمثيلات متعددة المقاييس ضرورية للكشف عن الأجسام الصغيرة.
الدمج المتبقي من الخشن إلى الناعم: يقوم فك التشفيد بدمج الميزات من كلا الوسائط عبر أربعة مقاييس مكانية (خطوات 4، 8، 16، 32).
إسقاط القنوات: يتم إسقاط الميزات من كل مقياس إلى بُعد موحد (D=256) عبر عمليات التلافيف (convolutions) بنسبة 1×1.
تحسين الوسائط: تقوم وحدات التلافيف المتبقية (ResConv) الخاصة بكل وسيط بتحسين ميزات الكاميرا والليدار بشكل مستقل.
آلية الدمج: يستخدم الإطار استراتيجية تراكم من الخشن إلى الناعم. بدءًا من المقياس الأخشن (المرحلة 4)، يتم جمع الميزات المحسنة عنصرًا بعنصر. وفي كل مقياس أدق لاحق، يتم رفع التمثيل المتراكم من المرحلة الخشنة السابقة عبر "الاستكمال الثنائي الخطي" (bilinear upsampling) وإضافته إلى ميزات المقياس الحالي المحسنة قبل تمريرها عبر وحدة ResConv مشتركة. يضمن هذا التصميم نشر السياق الدلالي العالمي مع الحفاظ على التفاصيل المكانية الدقيقة.
رأس التقطيع (Segmentation Head): تتم معالجة التمثيل المدمج النهائي بواسطة رأس خفيف الوزن يتضمن تلافيف 3×3، وطبقة تطبيع الدفعات (Batch Normalization)، ووحدة ReLU، وتلافيف 1×1، متبوعة بعملية رفع الدقة (upsampling) إلى دقة المدخلات الأصلية.
المساهمات الرئيسية
المعمارية: تقديم CLFTv2، وهو معمارية دمج هرمية قائمة على Swin مع فك تشفير متبقي خفيف الوزن لكل مقياس. يتجنب النموذج العبء الحسابي الثقيل لفك التشفير القائم على الاستعلام (مثل Mask2Former) من خلال استخدام الإشارات الهندسية متعددة المقاييس الأصلية.
الكفاءة مقابل الدقة: أظهر CLFTv2 أنه يحقق دقة تنافسية مقابل فك التشفير القائم على الاستعلام (مثل Mask2Former) مع تطلب عددًا أقل بكثير من العمليات الحسابية (GFLOPs) (أقل بـ 1.4 مرة من نسخة Mask2Former المعدلة لـ Swin) وتقديم إنتاجية أعلى بـ 2.2 مرة.
رؤى حول عزل الوسائط: دراسة كشفت عن مقايضة عملية: بينما يحسن هيكل Swin الهرمي دقة الأجسام الصغيرة، فإن آلية الانتباه للنافذة المحلية تعاني من صعوبة في استغلال عوائد الليدار الكثيفة والموضعية بالكامل مقارنة بمجال الاستقبال العالمي لنموذج ViT. يشير هذا إلى أن الانتباه العالمي يظل متفوقًا لضبط السحب النقطية الكثيفة (كما في مجموعة بيانات Waymo)، بينما يوفر الانتباه المحلي كفاءة أكبر في السيناريوهات المتشتتة.
التعميم: وجود أدلة على أن التمثيلات متعددة الوسائط المتعلمة تتعمم عبر خصائص المستشعرات المختلفة والمجموعات الجغرافية للبيانات، مع تسريع التقارب عبر التهيئة المتقاطعة للبيانات.
النتائج التجريبية تم تقييم الإطار على ثلاث مجموعات بيانات للقيادة الذاتية: ZOD (السويد، تسميات زائفة)، Waymo (الولايات المتحدة، ليدار كثيف)، و ISEAuto (إستونيا، تسميات عالية الجودة).
أداء ZOD: حقق CLFTv2-Large نسبة 53.5% mIoU، محسنًا IoU للمشاة من 35.5% (في نموذج CLFT السابق) إلى 44.9%. وقد تفوق على نموذج CLFT السابق وطابق دقة Mask2Former-Large (بنسبة 52.5% mIoU) بتكلفة حسابية أقل بكثير.
أداء Waymo: في مجموعة بيانات Waymo، التي تتميز بعوائد ليدار كثيفة، تفوقت عائلة CLFT القائمة على ViT على CLFTv2 (بنسبة 68.3% مقابل 61.7% mIoU). وهذا يؤكد أن الانتباه العالمي هو الأفضل لدمج البيانات الهندسية الكثيفة، بينما يوفر الانتباه المحلي (Swin) بديلًا أكثر كفاءة في الظروف المتشتتة.
أداء ISEAuto: تصدرت النماذج القائمة على الاستعلام (MaskFormer/Mask2Former) هذه المجموعة، رغم أن CLFTv2 ظل منافسًا (73.3% mIoU).
الكفاءة: عند مقياس "Tiny"، عمل CLFTv2-Tiny بسرعة 22.0 مللي ثانية (مقارنة بـ 81.8 مللي ثانية لنسخة Large) مع استهلاك ذاكرة قدره 187 ميجابايت، مقارنة بـ 48.4 مللي ثانية و314 ميجابايت لـ Mask2Former-Tiny.
مقاييس السلامة: أظهر CLFTv2 معدل استدعاء (Recall) عاليًا لمستخدمي الطرق الضعفاء (على سبيل المثال، 96.1% استدعاء للمشاة في Waymo Day Fair)، مما يعطي الأولوية للكشف المتعلق بالسلامة على الدقة في بعض الإعدادات.
الأهمية والادعاءات يزعم البحث أن الدمج الهرمي القائم على الانتباه المحلي يوفر بديلًا قابلًا للتوسع والفعال لنماذج الانتباه العالمي وفك التشفير القائم على الاستعلام للرصد في الوقت الفعلي داخل المركبات. ويرى المؤلفون أن تعقيد التدريب (مثل مطابقة هانغاريان والتدريب العميق) غير الضروري دائمًا لتحقيق نتائج رائدة في التقطيع الدلالي مغلق المجموعة، خاصة تحت الإشراف الزائف أو المتشتت.
يسلط العمل الضوء على اختيار تصميمي دقيق: بينما يعد الانتباه العالمي (ViT) متفوقًا لضبط البيانات الهندسية الكثيفة، فإن نهج Swin المقترح يوفر مقايضة مواتية بين الدقة والكفاءة، مما يجعله مناسبًا للأنظمة التي تعمل في الوقت الفعلي والمحدودة الموارد. ويخلص المؤلفون إلى أن التعقيد المعماري ليس مفيدًا دائمًا، وأن الدمج المتبقي الخفيف يمكن أن يضاهي نماذج فك التشفير ذات التكلفة الحسابية العالية عندما يتم تخصيصه لكثافة مستشعرات معينة وجودة إشراف محددة.