COPRA: Conditional Parameter Adaptation with Reinforcement Learning for Video Anomaly Detection
يُعد COPRA إطار عمل مبتكرًا يسخر التعلم المعزز لتوليد تحديثات للمعلمات الخاصة بالمدخلات للنماذج الرؤيوية اللغوية المجمدة، مما يحل بفعالية عدم التطابق بين التدريب والاستدلال ويحقق أداءً رائدًا في كشف الشذوذ في الفيديو ومهام فهم الفيديو الأخرى.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك توظف حارس أمن لمراقبة آلاف الساعات من لقطات الكاميرات لاكتشاف المشاكل. هذه هي مهمة كشف الشذوذ في الفيديو (VAD).
لفترة طويلة، كانت الطريقة الأفضل للقيام بذلك هي تدريب ذكاء اصطناعي فائق الذكاء (نموذج رؤية-لغة) ليراقب الفيديو ويقول: "هذا يبدو طبيعيًا"، أو "هذا يبدو كحادث".
ومع ذلك، لاحظ مؤلفو هذه الورقة البحثية، COPRA، خللاً رئيسيًا في كيفية تدريب حراس الذكاء الاصطناعي الحاليين. إنهم يسمونه "عنق زجاجة المعلمات المشتركة" (Shared Parameter Bottleneck).
المشكلة: الزي الموحد "الذي يناسب الجميع"
تخيل أن لديك حارس أمن يجب أن يرتدي زيًا موحدًا واحدًا وثابتًا لكل نوبة عمل، بغض النظر عما يحرس.
- إذا كان يحرس بنكًا، فعليه البحث عن أشخاص يركضون ومعهم حقائب.
- إذا كان يحرس منتزهًا، فعليه البحث عن أشخاص يتشاجرون.
- إذا كان يحرس طريقًا، فعليه البحث عن حوادث سيارات.
حاليًا، تحاول معظم نماذج الذكاء الاصطناعي تعلم مجموعة واحدة من القواعد (زي موحد واحد) تعمل لكل هذه السيناريوهات المختلفة في آن واحد. والنتيجة؟ يحاول الذكاء الاصطناعي إيجاد "حل وسط". يصبح جيدًا نوعًا ما في رصد سرقات البنوك، وجيدًا نوعًا ما في رصد المشاجرات في المنتزهات، لكنه ليس بارعًا في أي منها حقًا. عندما يرى نوعًا جديدًا من المشاكل لم يره من قبل، يصاب بالارتباك لأن "زيه الموحد" لا يناسب ذلك الموقف المحدد.
علاوة على ذلك، هناك عدم تطابق بين كيفية تدريبهم وكيفية عملهم:
- التدريب: يُعرض على الذكاء الاصطناعي بضع إطارات عشوائية من فيديو طويل، ويُقال له: "حدثت مشكلة ما في مكان ما خلال هذه الساعة بأكملها".
- الاختبار: يُطلب من الذكاء الاصطناعي النظر إلى شرائح فيديو دقيقة وكثيفة ثانية بثانية لتحديد متى حدثت المشكلة بالضبط.
الأمر يشبه تدريب طباخ عبر إظهار صورة لكعكة جاهزة له وقول "اصنع هذه"، ثم مطالبته بخبز الكعكة قطعة قطعة (فتاتًا فتاتًا). التعليمات لا تتطابق تمامًا مع المهمة.
الحل: COPRA (البدلة "المفصلة خصيصًا")
يقترح المؤلفون نظامًا جديدًا يسمى COPRA. بدلاً من إجبار الذكاء الاصطناعي على ارتداء زي موحد واحد ثابت، يمنح COPRA الذكاء الاصطناعي خياطًا سحريًا يصنع طقمًا مخصصًا لكل مقطع فيديو يراه.
إليك كيف يعمل الأمر بكلمات بسيطة:
- الدماغ المتجمد: يظل الذكاء الاصطناعي الرئيسي (الـ "دماغ") متجمدًا دون تغيير؛ فهو يعرف الكثير عن العالم بالفعل.
- الخياط السحري (المولد/Generator): تنظر شبكة مساعدة صغيرة وخفيفة الوزن إلى مقطع الفيديو المحدد (مثل مشهد مروري مقابل مشهد في متجر).
- التخصيص الفوري: بناءً على ما تراه، يقوم الخياط فورًا بإنشاء مجموعة صغيرة من "التعديلات" (تسمى أوزان LoRA) مخصصة لهذا المقطع تحديدًا.
- إذا كان المقطع فيديو لحركة المرور، يقوم الخياط بتعديل تركيز الذكاء الاصطناعي للبحث عن السيارات والمشاة.
- إذا كان المقطع فيديو لمتجر تجزئة، يقوم الخياط بتعديل الذكاء الاصطناعي للبحث عن سلوكيات السرقة.
- النتيجة: يرتدي الذكاء الاصطناعي هذا "الزي المخصص" لهذه اللحظة فقط، ويتخذ قراره، ثم يخلعه. ليس عليه تذكر قاعدة "حل وسط" واحدة لكل شيء؛ بل يتكيف في اللحظة ذاتها.
كيف علموا الخياط (التعلم التعزيزي)
قد تسأل، "كيف يعرف الخياط التعديلات التي يجب إجراؤها؟"
استخدم المؤلفون تقنية تسمى التعلم التعزيزي (Reinforcement Learning). فكر في الأمر كتدريب كلب باستخدام المكافآت:
- يخمن الذكاء الاصطناعي ما إذا كان الفيديو طبيعيًا أم غير طبيعي.
- إذا حصل على الإجابة الصحيحة (بناءً على التصنيف على مستوى الفيديو)، يحصل على "مكافأة" (Treat).
- إذا أخطأ، لا يحصل على مكافأة.
- بمرور الوقت، يتعلم "الخياط" كيفية توليد التعديلات المخصصة المثالية التي تؤدي إلى الحصول على أكبر عدد من المكافآت.
ما الذي وجدوه؟
تزعم الورقة البحثية أن نهج "التفصيل المخصص" هذا يعمل بشكل أفضل بكثير من طريقة "الزي الموحد الذي يناسب الجميع" القديمة:
- دقة أفضل: في الاختبارات القياسية (مثل رصد الجرائم في فيديوهات المراقبة)، وجد COPRA حالات شاذة أكثر وارتكب أخطاء أقل مقارنة بالطرق السابقة.
- قدرة أفضل على التعميم: عندما اختبروا COPRA على فيديوهات لم يسبق له رؤيتها (مثل حوادث المرور بدلًا من جرائم المتاجر)، ظل يؤدي بشكل جيد. ولأنه تعلم كيفية التكيف وليس مجرد الحفظ، استطاع التعامل مع المواقف الجديدة.
- أبعد من مجرد الإنذارات: أظهروا أيضًا أن هذه الطريقة تساعد الذكاء الاصطناعي على كتابة أوصاف أفضل لما حدث (مثل "سيارة صدمت أحد المشاة") والإجابة على الأسئلة حول الفيديو، مما يثبت أن "الزي المخصص" يساعد الذكاء الاصطناعي على فهم السياق بشكل أفضل.
الملخص
باختصار، COPRA يتوقف عن محاولة إجبار نموذج ذكاء اصطناعي واحد على أن يكون خبيرًا في كل شيء في وقت واحد. بدلاً من ذلك، يمنح الذكاء الاصطناعي القدرة على إعادة تشكيل نفسه فورًا لكل فيديو محدد يشاهده. إنه الفرق بين حارس أمن يرتدي بدلة صلبة وغير مريحة لكل وظيفة، وحارس يغير معداته فورًا لتناسب الموقف المحدد الذي يواجهه.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.