A global dataset of continuous urban dashcam driving
تقدم الورقة البحثية CROWD، وهي مجموعة بيانات متنوعة عالمياً ومنسقة يدوياً تضم أكثر من 20,000 ساعة من لقطات كاميرا السيارة (dashcam) الحضرية المستمرة وغير المحررة من 238 دولة، والمصممة لدعم أبحاث القيادة القوية عبر المجالات المختلفة من خلال توفير مقاطع قيادة روتينية مع تسميات يدوية لوقت اليوم والمركبة إلى جانب تعليقات توضيحية لتتبع وكشف الأشياء تم إنشاؤها آلياً.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تريد تعليم روبوت كيفية قيادة سيارة. للقيام بذلك، يتعين عليك عرضه ملايين الساعات من لقطات القيادة حتى يتمكن من تعلم كيف يبدو الشارع الطبيعي، وكيف يمشي الناس، وكيف تتصرف السيارات الأخرى.
معظم مجموعات بيانات القيادة الموجودة حالياً تشبه "مقاطع الأهداف المميزة" (Highlight Reels) في القنوات الرياضية: فهي لا تعرض إلا اللحظات المثيرة، أو الخطيرة، أو الغريبة: حوادث السيارات، والاقتراب من الاصطدام، ومطاردات الشرطة، والازدحامات المرورية. ورغم أن هذه اللحظات درامية، إلا أنها لا تمثل الواقع الممل واليومي للقيادة في 9ها 99% من الوقت. فإذا دربت الروبوت فقط على فيديوهات الحوادث، فقد يعتقد أن العالم عبارة عن ساحة معركة مستمرة!
أما مجموعات البيانات الأخرى، فهي تشبه "مهام التجسس الفاخرة والمكلفة": حيث تستخدم سيارات خاصة مزودة بأجهزة ليزر وكاميرات مثبتة في كل مكان، وتتجول فقط في مدن محددة (مثل سان فرانسيسكو أو ميونيخ). هذه البيانات رائعة، لكنها مكلفة للغاية، وتغطي مساحات صغيرة جداً، ولا تشبه المنظر الذي يراه الشخص العادي من لوحة قيادة سيارته.
إليكم CROWD: مكتبة "القيادة اليومية المعتادة"
تقدم الورقة البحثية CROWD (ملاحظات الطرق في المدن عبر كاميرات الداش كام). فكر في CROWD كأنها مكتبة عالمية ضخمة من فيديوهات القيادة المملة، والطبيعية، واليومية التي تم جمعها من يوتيوب.
إليكم كيف بنوها، باستخدام تشبيهات بسيطة:
1. المصدر: البحث عن "الجانب المريح" (ASMR) للقيادة
بدلاً من البحث عن فيديوهات الحوادث، بحث الباحثون عن نوع محدد من فيديوهات يوتيوب: لقطات طويلة، مستمرة، وغير محررة من كاميرات الداش كام. لقد بحثوا عن الفيديوهات التي يرفعها الناس لمجرد الاسترخاء (والتي تُسمى غالباً فيديوهات قيادة الـ "ASMR"). هذه هي الفيديوهات التي لا يحدث فيها أي شيء مثير؛ حيث تقود السيارة فقط عبر مدينة لمدة ساعة. وهذا هو بالضبط "البيانات الروتينية" اللازمة لتعليم الروبوت كيف يشعر بالقيادة الطبيعية.
2. الفلتر: "المحرر الأمني"
قام الفريق بمشاهدة آلاف الفيديوهات يدوياً ولعبوا دور المحررين الصارمين. قاموا باستبعاد أي شيء ليس "طبيعياً":
- لا حوادث: إذا اصطدمت سيارة بشيء ما، يتم التخلص من ذلك المقطع.
- لا مونتاج: إذا كان الفيديو يحتوي على قصات سريعة أو انتقالات سينمائية، يتم استبعاده. كانوا يريدون تدفقاً مستمراً وواقعياً في الوقت الفعلي.
- لا مناطق غير حضرية: احتفظوا فقط بالفيديوهات التي تقود عبر البلدات والمدن، وليس على طرق سريعة خالية أو في وسط حقل ذرة.
- لا سيارات متوقفة: إذا توقفت السيارة عند محطة وقود لمدة 10 دقائق، يتم قص هذا الجزء. أرادوا فقط السيارة وهي تتحرك وسط حركة المرور.
3. النتيجة: فسيفساء عالمية
مجموعة البيانات النهائية ضخمة جداً. فهي تحتوي على أكثر من 20,000 ساعة من لقطات القيادة من 7,103 مدينة مختلفة عبر 238 دولة.
- التشبيه: تخيل أنك تأخذ لقطة لشارع في طوكيو، ثم لقطة في نيروبي، ثم واحدة في بوينس آيرس، ثم تجمعهم جميعاً في فيلم واحد مستمر وعملاق. هذا هو CROWD. إنه يغطي كل ركن من أركان العالم تقريباً، من الأمريكتين إلى أفريقيا وصولاً إلى آسيا.
4. "النظارات الذكية" (التعليقات التوضيحية)
مجرد إعطاء شخص ما فيديو خام ليس كافياً ليتعلم الكمبيوتر. يجب أن يعرف الكمبيوتر ما الذي ينظر إليه.
- قام الباحثون بتشغيل ذكاء اصطناعي فائق الذكاء (يسمى YOLO) على كل إطار من إطارات هذه الفيديوهات.
- وضع هذا الذكاء الاصطناعي "ملصقات" (صناديق محيطة) حول كل شيء: الأشخاص، الدراجات الهوائية، السيارات، الحافلات، إشارات المرور، ولوحات التوقف.
- كما قام بتتبعها، مما يعني أنه يعرف أن "تلك السيارة الحمراء" في الثانية 10 هي نفسها "السيارة الحمراء" في الثانية 20.
- لم يقدموا ملفات الفيديو الفعلية (احتراماً لحقوق النشر والخصوصية)؛ بل قدموا للباحثين "الخريطة" (الطوابع الزمنية والمعرفات) بحيث يمكن لأي شخص تحميل فيديو اليوتيوب الأصلي واستخدام "الملصقات" لدراسته.
لماذا يهم هذا الأمر؟
"السائق الشامل"
تُدرب معظم نماذج الذكاء الاصطناعي على بيانات من مدينة أو مدينتين فقط. إذا أخذت نموذجاً تدرب في كاليفورنيا المشمسة وذهبت به إلى لندن الممطرة، فقد يصاب بالارتباك. CROWD يشبه دورة تعليم قيادة عالمية. ولأنه يتضمن العديد من الدول، والظروف الجوية، وأنماط الطرق المختلفة، فإنه يساعد في تدريب ذكاء اصطناعي يمكنه التعامل مع أي مدينة في العالم، وليس فقط تلك المدن التي جُمعت منها البيانات.
التركيز على "السلامة"
من خلال إزالة جميع الحوادث والتركيز على القيادة الروتينية، يساعد CROWD الباحثين على الإجابة على سؤال مختلف: "كم مرة تتفاعل السيارات والمشاة فعلياً في يوم عادي؟" وهذا يساعدنا على فهم المخاطر قبل وقوع الحوادث، بدلاً من مجرد دراستها بعد وقوعها.
باختختصار
CROWD هو مكتبة عالمية مفتوحة المصدر لفيديوهات القيادة المملة والطبيعية من يوتيوب، تم تنقيتها وتصنيفها بواسطة الكمبيوتر. إنه يسد الفجوة بين "مقاطع الحوادث المثيرة" و"مجموعات البيانات المكلفة والمحدودة بمدن معينة"، مما يوفر أساساً واقعياً ومتنوعاً لتعليم المركبات ذاتية القيادة كيفية التنقل في العالم الحقيقي الفوضوي واليومي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.