YOLOv10 with Kolmogorov-Arnold networks and vision-language foundation models for interpretable object detection and trustworthy multimodal AI in computer vision perception
تقترح هذه الورقة إطار عمل لتفسير كشف الأشياء يعزز موثوقية YOLOv10 في الأنظمة ذاتية القيادة من خلال توظيف شبكات كولموغوروف-أرنولد لتصور موثوقية الثقة القائمة على الميزات، ودمج نماذج BLIP التأسيسية لفهم المشهد متعدد الوسائط.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تقود سيارة ذاتية القيادة. فجأة، رصد كمبيوتر السيارة شكلاً في الضباب وقال: "هذا شخص يمشي! أنا متأكد بنسبة 90%". لكن الضباب كثيف، والشكل غير واضح. هل يجب عليك الضغط على المكابح بقوة، أم أنه مجرد خدعة من انعكاس الضوء؟
هذه هي المشكلة التي تحلها هذه الورقة البحثية. الأمر يتعلق بتعليم الذكاء الاصططناعي ليس فقط ماذا يرى، بل مدى ثقته فيما يراه، ولماذا.
إليك تفصيل حلهم باستخدام تشبيهات بسيطة:
1. المحقق الخبير (YOLOv10)
أولاً، يستخدم النظام محقق ذكاء اصطناعي فائق السرعة يسمى YOLOv10. تخيل YOLO كحارس أمن يركض عبر محطة قطار مزدحمة بحثاً عن أشخاص محددين. إنه سريع للغاية وماهر في رصد الأشياء.
- المشكلة: أحياناً، يصاب الحارس بالارتباك. ربما تمطر، أو ربما يختبئ شخص خلف عمود. قد يظل الحارس يصرخ: "أرى شخصاً!" بثقة عالية، رغم أنه في الواقع يخمن فقط. هو لا يعرف لماذا هو غير متأكد؛ هو فقط يعطي رقماً.
2. المترجم الصادق (شبكة Kolmogorov-Arnold)
هذا هو نجم الورقة البحثية. أضاف المؤلفون ذكاءً اصطناعياً ثانياً يسمى شبكة Kolmogorov-Arnold (KAN).
- التشبيه: تخيل أن حارس YOLO هو ساحر عبقري ولكنه غامض يتحدث بالألغاز. تسأله: "ما مدى تأكدك؟" فيقول لك: "75%". أنت لا تعرف ما إذا كان هذا تخميناً جيداً أم تخميناً محظوظاً.
- الـ KAN هو مثل مترجم صادق يقف بجانب الساحر. هو لا يقوم بعملية الرصد؛ بل يكتفي بمراقبة ملاحظات الساحر.
- بدلاً من أن يكون "صندوقاً أسود"، يستخدم الـ KAN أربطة مطاطية سلسة وقابلة للانحناء (splines) لرسم مسار دقيق لكيفية تغير ثقة الساحر.
- مثال: يمكن للمترجم أن يقول: "الساحر متأكد بنسبة 90% لأن الجسم كبير وواضح. ولكن إذا أصبح الجسم ضبابياً، سينحني الرباط المطاطي، ويقول المترجم: 'مهلاً، الساحر الآن متأكد بنسبة 40% فقط، حتى لو ظل يقول 90%'".
- هذا يسمح لنا بـ رؤية بالضبط أي العوامل (مثل الضبابية، أو الحجم، أو الموقع) تجعل الذكاء الاصطناعي يفقد ثقته. إنه يحول "الصندوق الأسود" إلى "صندوق زجاجي".
3. الراوي (نموذج الرؤية واللغة)
لجعل الأمور أكثر وضوحاً، أضاف الفريق مكوناً ثالثاً: نموذج رؤية ولغة (مثل BLIP).
- التشبيه: إذا كان الـ KAN هو المترجم الذي يشرح الرياضيات، فإن هذا الجزء هو الراوي.
- بينما يقوم الـ KAN بمعالجة الأرقام، ينظر الراوي إلى المشهد ويقول: "أرى شاحنة حمراء مخفية جزئياً خلف شجرة تحت المطر".
- هذا يعطي البشر جملة سهلة القراءة تتوافق مع الرياضيات المعقدة. إنه يشبه وجود مساعد طيار يصف المشهد بينما يحسب الكمبيوتر المخاطر.
كيف يعمل كل ذلك معاً
تخيل فريقاً يعمل في غرفة تحكم:
- YOLO (الحارس): يرصد سيارة. "أرى سيارة!"
- KAN (المترجم): يفحص الظروف. "انتظر، الصورة ضبابية والسيارة مقطوعة بواسطة سياج. ثقة الحارس مهتزة. أنا أصنف هذا كـ 'ثقة منخفضة'".
- BLIP (الراوي): يقول: "إنها صورة ضبابية لسيارة خلف سياج".
النتيجة:
النظام لا يعطيك مجرد عملية رصد؛ بل يعطيك درجة ثقة.
- إذا كانت الصورة واضحة، يقول النظام: "ثقة عالية. تفضل بالمرور".
- إذا كان الجو ضبابياً أو الرؤية محجوبة، يقول النظام: "ثقة منخفضة. أنا لست متأكداً. يجب على الإنسان التحقق من هذا".
لماذا يهم هذا؟
في الماضي، كان الذكاء الاصطناعي مثل طالب حصل على درجة امتياز في اختبار ولكنه لم يستطع شرح كيفية حل المسألة الرياضية. إذا أخطأ الطالب، لم تكن لديك أدنى فكرة عن السبب.
هذه الورقة البحثية تنشئ نظاماً حيث يعترف الذكاء الاصطناعي عندما يكون في حالة تخمين. إنه يستخدم رياضيات "الأربطة المطاطية" (KAN) ليظهر بالضبط متى يعاني الذكاء الاصطناعي بسبب الإضاءة السيئة أو الأجسام المخفية، ويستخدم "راوياً" ليشرح المشهد بلغة إنجليزية بسيطة. هذا يجعل السيارات ذاتية القيادة وأنظمة الذكاء الاصطنا الأخرى أكثر أماناً، وأكثر شفافية، وأسهل في كسب ثقة البشر.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.