Investigating Vision-Language Model for Point Cloud-based Vehicle Classification
تقترح هذه الدراسة إطار عمل مبتكر يعمل على تكييف نماذج الرؤية واللغة لتصنيف الشاحنات الثقيلة القائمة على السحابة النقطية من خلال دمج بيانات "ليدار" (LiDAR) من العالم الحقيقي مع معالجة مسبقة متخصصة وتعلم سياقي قليل العينات، مما يقلل تكاليف التوسيم مع تعزيز السلامة في القيادة الذاتية التعاونية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
على الطرقات، غالباً ما تكون المركبات الأكبر حجماً هي الأكثر خطورة. فالشاحنات الثقيلة تحمل أوزاناً هائلة وتشغل مساحات كبيرة، ومع ذلك لا يمكنها التوقف بسرعة مثل السيارات، كما أن لديها مناطق واسعة حولها لا يستطيع السائق رؤيتها ببساطة. ولكي ينجح مستقبل القيادة الذاتية الآمنة، تحتاج الحواسيب التي توجه هذه المركبات إلى فهم نوع الشاحنة التي تواجهها بدقة وكيفية تحركها. تقليدياً، تطلب تعليم الكمبيوتر التعرف على هذه المركبات عملية بطيئة ومكلفة حيث يقوم البشر يدوياً بتصنيف آلاف الصور أو عمليات المسح الاستشعاري. ومع ذلك، يبرز نهج جديد يستعير من الطريقة التي تعلمت بها نماذج اللغات الكبيرة فهم النصوص والصور، بهدف تعليم الآلات التعرف على الشاحنات بجهد بشري أقل بكثير.
لقد طور باحثون في كلية سيتي من نيويورك طريقة لمساعدة الحواسيب على تحديد الشاحنات الثقيلة باستخدام بيانات من مستشعرات مثبتة على جانب الطريق. هذه المستشعرات، المعروفة باسم "ليدار" (LiDAR)، تعمل عن طريق إرسال نبضات ليزر لقياس المسافات، مما ينشئ سحابة من النقاط التي تمثل شكل الأجسام في العالم الحقيقي. وبينما تعد هذه التكنولوجيا ممتازة لرؤية العالم المادي، فإن البيانات التي تنتجها تبدو مختلفة تماماً عن الصور الفوتوغرافية التي تُدرب عليها معظم أنظمة الذكاء الاصطناي الحديثة. وتعمل الدراسة الجديدة على جسر هذه الفجوة من خلال أخذ النقاط الخام والمبعثرة من مستشعرات الليزر وتحويلها إلى تنسيق يمكن لنموذج الرؤية واللغة قراءته. هذه النماذج هي برامج حاسوبية متقدمة قادرة على فهم كل من الصور والكلمات، لكنها عادة ما تتوقع رؤية صور فوتوغرافية قياسية، وليس سحب نقاط ليزرية.
ولجعل بيانات الليزر قابلة للاستخدام، قام الفريق أولاً بدمج لقطات متعددة لشاحنة أثناء مرورها بجانب المستشعر. فغالباً ما تكون اللقطة الواحدة شحيحة جداً بحيث لا تظهر تفاصيل واضحة، لذا قام الباحثون بمحاذاة عدة إطارات معاً لبناء صورة أكثر كثافة واكتمالاً للمركبة. ثم قاموا بتنعيم الصورة، وإزالة الأخطاء الصغيرة والضجيج لإنشاء مخطط خارجي نظيف للشاحنة. وبمجرد تجهيز البيانات، استخدموا تقنية تسمى "التلقين قليل الخطوات" (few-shot prompting). فبدلاً من قضاء شهور في تعليم الكمبيوتر باستخدام آلاف الأمثلة المصنفة، عرضوا للنموذج عدداً قليلاً فقط من الأمثلة — أحياناً ثلاثة أمثلة فقط — مع وصف لما يجب البحث عنه. سمح هذا للنموذج بتعلم المهمة بسرعة من خلال ملاحظة النمط في الأمثلة القليلة المقدمة، بدلاً من التطلب قاعدة بيانات ضخمة ومبنية مسبقاً لكل نوع ممكن من الشاحنات.
اختبر الباحثون هذا النظام باستخدام بيانات واقعية جُمعت من منحدر طريق سريع رئيسي في جنوب كاليفورنيا، حيث تسافر الشاحنات بين شمال وجنوب كاليفورنيا. التقطت المستشعرات مركبات تتحرك بسرعات تتراوح من صفر إلى خمسين ميلاً في الساعة تحت ظروف حركة المرور الانسيابية والمزدحمة على حد سواء. كان الهدف هو معرفة ما إذا كان بإمكان النظام تحديد اثنتي عشرة فئة مختلفة من المركبات بشكل صحيح، بما في ذلك أنواع مختلفة من المقطورات، وصهاريج النقل، والسيارات الملاكيّة. وعندما قارنوا نتائج صورهم المعالجة بالبيانات الخام غير المعالجة، كان التحسن واضحاً. حقق النظام أفضل أداء عندما عُرضت عليه ثلاثة أمثلة قبل أن يُطلب منه تصنيف شاحنة جديدة. ومع هذا القدر الصغير من التوجيه والصور المنقحة، حقق النموذج مستوى عالٍ من الدقة، حيث حدد نوع المركبة بشكل صحيح في أكثر من نصف الحالات في المتوسط.
وجدت الدراسة أنه بينما نجحت الطريقة بشكل جيد للعديد من أنواع الشاحنات، إلا أنها واجهت تحديات مع المركبات التي تبدو مختلفة تماماً عن بعضها البعض، مثل الشاحنات ذات السطح المستوي التي قد تكون فارغة أو تحمل حمولات غريبة الشكل. جعلت هذه الاختلافات من الصعب على النموذج إيجاد نمط واحد لاتباعه. ومع ذلك، تشير النتائج إلى أن هذا النهج يمكن أن يقلل بشكل كبير من الوقت والتكلفة المطلوبة لتدريب أنظمة السلامة للقيادة الذاتية. ومن خلال استخدام قدرات الاستنتاج القوية لنماذج اللغات الحديثة وتكييفها للعمل مع بيانات مستشعرات الليزر، أثبت الباحثون أن التصنيف الدقيق للمركبات أمر ممكن دون الحاجة إلى مجموعات البيانات الضخمة التي كانت مطلوبة تقليدياً. ويمثل هذا العمل خطوة أولية نحو جعل الطرق أكثر أماناً من خلال منح الأنظمة الآلية طريقة أفضل وأكثر كفاءة لفهم المركبات الثقيلة التي تشاركها الطريق السريع.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.