YOLOv10 with Kolmogorov-Arnold networks and vision-language foundation models for interpretable object detection and trustworthy multimodal AI in computer vision perception
تقترح هذه الورقة إطار عمل لتفسير كشف الأشياء يعزز موثوقية YOLOv10 في الأنظمة ذاتية القيادة من خلال توظيف شبكات كولموغوروف-أرنولد لتصور موثوقية الثقة القائمة على الميزات، ودمج نماذج BLIP التأسيسية لفهم المشهد متعدد الوسائط.