Collision-Aware Vision-Language Learning for End-to-End Driving with Multimodal Infraction Datasets
تعالج هذه الورقة البحثية مشكلة الاختناق المتمثلة في المخالفات المتعلقة بالاصطدام في القيادة الذاتية من الطرف إلى الطرف عبر تقديم كاشف الشذوذ المعزز بالفيديو واللغة (VLAAD) ومجموعتي بيانات متعدد الوسائط جديدتين، CARLA-Collide وReal-Collide، اللتين تتيحان معاً وحدة برمجية خفيفة الوزن وقابلة للإضافة تعمل على تحسين درجات القيادة بشكل كبير في المحاكاة وتتفوق على النماذج الأكبر في التنبؤ بالاصطدامات في العالم الحقيقي.