← أحدث الأبحاث
💻 computer science

CLFTv2: Efficient Camera-LiDAR Fusion for Semantic Segmentation via Hierarchical Feature Pyramids

يُعد CLFTv2 إطار عمل فعال لدمج الكاميرا والليدار (LiDAR) من أجل التجزئة الدلالية، حيث يستبدل انتباه المحولات الرؤية (ViT) العالمي بمُشفر هرمي قائم على Swin وفك تشفير خفيف الوزن لتحسين اكتشاف مستخدمي الطريق المعرضين للخطر والإنتاجية بشكل كبير مع تقليل التكاليف الحسابية مقارنة بالبدائل القائمة على الاستعلام والانتباه العالمي.

المؤلفون الأصليون: Toomas Tahves, Mauro Bellone, Raivo Sell

نُشر 2026-09-10
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Toomas Tahves, Mauro Bellone, Raivo Sell

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تعتمد المركبات ذاتية القيادة على تدفق مستمر من البيانات الحسية للتنقل في العالم، لكن الرؤية لا تعني بالضرورة الفهم. لكي تقود السيارة بأمان، يجب عليها التمييز بين خط مرسوم على الطريق وبين مشاة ينزلون من على الرصيف، حتى عندما يكون هذا الشخص صغيراً، أو بعيداً، أو محجوباً جزئياً. توفر الكاميرات ألواناً وأنسجة غنية، مما يسمح للمركبة بالتعرف على الأشكال واللافتات، لكنها لا تستطيع قياس المسافة بيقين. أما نظام "ليدار" (Lidar)، وهو نظام مسح يعتمد على الليزر، فيوفر هندسة ثلاثية الأبعاد دقيقة، ويرسم شكل الأجسام في الفراغ، ولكنه غالباً ما ينتج بيانات متفرقة تصبح فارغة بشكل متزايد مع زيادة المسافة. لسنوات، حاول المهندسون دمج هذين التدفقين المتميزين من المعلومات في صورة واحدة موثوقة. ويكمن التحدي في معالجة هذه الكمية الهائلة من البيانات بسرعة كافية للقيادة في الوقت الفعلي مع ضمان عدم تفويت الأهداف الأكثر أهمية، مثل المشاة وراكبي الدراجات.

قدم الباحثون توماس تافس، وماورو بيلوني، ورايفو سيل نهجاً جديداً لهذه المشكلة يسمى CLFTv2. يركز عملهم على نوع محدد من بنية الذكاء الاصطناعي المصممة لدمج بيانات الكاميرا والليدار بكفاءة أكبر من الطرق السابقة. في الماضي، استخدمت بعض الأنظمة الرائدة آلية تُعرف باسم "شبكة الانتباه العالمي"، والتي تحاول النظر إلى كل جزء من الصورة وكل جزء من المسح ثلاثي الأبعاد في وقت واحد لإيجاد الروابط. ورغم قوتها، إلا أن هذه الطريقة ثقيلة حوسبياً، وتتطلب قدرة معالجة هائلة يمكن أن تبطئ كمبيوتر المركبة. اقترح المؤلفون استبدال هذه الرؤية الشاملة بنظام هرمي قائم على النوافذ. فبدلاً من مسح المشهد بأكره دفعة واحدة، يقوم نموذجهم بتقسيم الصورة إلى نوافذ أصغر ومتحركة، حيث يعالج التفاصيل المحلية أولاً ثم يبني فهماً أوسع. يحاكي هذا الهيكل كيفية عمل الرؤية البشرية غالباً، حيث تركز على المحيط المباشر قبل دمجها في سياق أكبر.

اختبر الفريق هذا الإطار الجديد عبر ثلاث مجموعات بيانات رئيسية للقيادة تمثل بيئات مختلفة: مجموعة بيانات Zenseact المفتوحة من السويد، ومجموعة بيانات Waymo المفتوحة من الولايات المتحدة، ومجموعة بيانات ISEAuto من إستونيا. تختلف مجموعات البيانات هذه في الطقس، وظروف الطريق، وكيفية تصنيف البيانات، مما يوفر اختباراً صارماً لقدرة النظام على التكيف. وأظهرت النتائج أن CLFTv2 نجح في تحديد مستخدمي الطريق المعرضين للخطر بموثوقية عالية. ففي مجموعة بيانات Waymo، حقق النظام درجة أداء بلغت 61.7 بالمئة، وهو تحسن كبير عن الإصدارات السابقة لتقنية مماثلة. وفي مجموعة بيانات ZOD، وصل إلى 53.5 بالمئة، وهي قفزة ملحوية حسنت بشكل خاص من اكتشاف المشاة واللافتات المرورية. ولعل الأهم من ذلك هو أن النظام الجديد فعل ذلك باستخدام طاقة حوسبية أقل بكثير من منافسيه؛ فقد تطلب حوالي نصف الطاقة التي تستهلكها بعض النماذج عالية الأداء الحالية، وعالج البيانات بسرعة تزيد عن الضعف، مما يجعله خياراً أكثر عملية للأجهزة المحدودة الموجودة داخل سيارة حقيقية.

ومع ذلك، كشفت الدراسة أيضاً عن مقايضة دقيقة في كيفية معالجة هذه الأنظمة للمعلومات. فبينما أثبت النهج القائم على النوافذ كفاءة وفعالية عالية في معظم مجموعات البيانات، وجد الباحثون أنه في مجموعة بيانات Waymo، التي تحتوي على مسحات ليدار كثيفة وتفصيلية للغاية، لا يزال النظام الذي يمتلك رؤية عالمية شاملة يحتفظ بميزة طفيفة في دمج نوعي البيانات. ففي بعض الأحيان، تعثرت النوافذ المحلية للنظام الجديد في ربط النقاط ببعضها في مثل هذه البيئات الهندسية الكثيفة مقارنة بالمنهج العالمي. وهذا يشير إلى أنه بينما يعد هذا الهيكل الجديد خطوة كبيرة للأمام من حيث الكفاءة، فإن الحل الأمثل قد يتطلب في النهاية نهجاً هجيناً يجمع بين سرعة المعالجة المحلية والمدى الواسع للانتباه العالمي.

كما بحث الباحثون في كيفية تعامل النظام مع أنواع مختلفة من الإشراف على البيانات. في بعض مجموعات البيانات، تم إنشاء تسميات "الحقيقة الأرضية" بواسطة خوارزميات أخرى بدلاً من المنسقين البشريين، مما أدخل طبقة من عدم اليقين. وبالرغم من ذلك، تعلم النموذج الجديد التعميم بشكل جيد، مما أظهر أن قدرته على الجمع بين الإشارات البصرية والهندسية قوية حتى عندما تكون بيانات التدريب غير مثالية. تؤكد الدراسة أنه بالنسبة المهمة المحددة لتحديد الأجسام الصغيرة والحرجة مثل المشاة، يمكن لنظام دمج خفيف الوزن ومصمم بعناية أن يتفوق على النماذج الأثقل والأكثر تعقيداً بكثير. ومن خلال إعطاء الأولوية لاكتشاف مستخدمي الطريق المعرضين للخطر، يضمن النظام بقاء السلامة هي الهدف الأساسي، حتى مع استمرار نمو المتطلبات الحوسبية للقيادة الذاتية. ويثبت هذا العمل أنه في السباق لبناء سيارات ذاتية القيادة أكثر أماناً، يكون النهج المركز والفعال أحياناً أكثر فاعلية من المحاولة العنيفة لرؤية كل شيء في آن واحد.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →