← أحدث الأبحاث
💻 computer science

GridVAD: Open-Set Video Anomaly Detection via Spatial Reasoning over Stratified Frame Grids

تُعد GridVAD خط تدفق عمل للكشف عن الشذوذ في الفيديو مفتوح المجموعة ولا يتطلب تدريباً، حيث يستفيد من نماذج الرؤية واللغة كجهات مقترحة للشذوذ يتم تنقيحها بواسطة توحيد الاتساق الذاتي وتأصيلها بواسطة نماذج الكشف والتجزئة لتحقيق أداء فائق على مستوى البكسل دون تدريب خاص بالمجال.

المؤلفون الأصليون: Mohamed Eltahir, Ahmed O. Ibrahim, Obada Siralkhatim, Tabarak Abdallah, Sondos Mohamed

نُشر 2026-03-27
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Mohamed Eltahir, Ahmed O. Ibrahim, Obada Siralkhatim, Tabarak Abdallah, Sondos Mohamed

البحث الأصلي مُهدى إلى الملك العام بموجب CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك رئيس أمن في ساحة مدينة ضخمة ومزدحمة. مهمتك هي رصد أي شيء غريب يحدث — شخص يركض في الاتجاه الخاطئ، أو سيارة تقود على الرصيف، أو شجار يندلع.

في الماضي، كانت الأنظمة الأمنية تشبه الكلاب المدربة. كان عليك تعليمها تحديداً ما الذي يبدو "سيئاً" (مثل "كلب ينبح"). إذا قفز قط فوق سياج، فلن يعرف الكلب ماذا يفعل لأنه لم يتم تدريبه على القطط من قبل.

بعد ذلك، حصلنا على نماذج الرؤية واللغة (VLMs). فكر في هذه النماذج كأنها أمين مكتبة ذكي جداً ومثقف، قد قرأ كل الكتب ورأى كل الأفلام في العالم. يمكنه وصف أي شيء يراه بلغة إنجليزية مثالية. "ذلك شخص يركض"، أو "تلك سيارة تقود على العشب".

المشكلة: أمين المكتبة ثرثار للغاية (ويهلوس)

أدرك الباحثون في هذه الورقة البحثية أنه إذا سألت أمين المكتبة ببساطة: "هل هذه حالة طوارئ؟"، فإنه غالباً ما يخطئ.

  • لماذا؟ لقد رأى أمين المكتبكتب ملايين الفيديوهات لأشخاص يركضون على الأرصفة (وهذا أمر طبيعي) وملايين الفيديوهات لأشخاص يركضون في الأفلام (وهذا قد يكون حالة طوارئ). هو لا يعرف القواعد الخاصة بساحة مدينتك تحديداً.
  • النتيجة: إذا طلبت من أمين المكتبة الحكم على كل ثانية من الفيديو، فسيصرخ "حالة طوارئ!" في كل مرة يهرول فيها شخص ما، أو حتى عندما يتحرك ظل ما. إنه حساس للغاية ويخترع أشياء ليست موجودة (هلوسات).

الحل: GridVAD (فريق "الاقتراح - التثبيت - الانتشار")

بدلاً من مطالبة أمين المكتبية بأن يكون هو "القاضي"، ابتكر المؤلفون سير عمل جديداً يسمى GridVAD. لقد قسموا المهمة إلى ثلاثة أدوار متميزة، مثل آلة تعمل بسلاسة:

1. يصبح أمين المكتبة "مولد أفكار" (المقترح)

بدلاً من مطالبة أمين المكتبة بقول "نعم/لا"، نطلب منه فقط سرد الأفكار.

  • الخدعة: هم لا يعرضون على أمين المكتبة الفيديو ثانية بثانية. هذا مجهود كبير ومربك للغاية.
  • الشبكة: يأخذون مقطع فيديو مدته 10 ثوانٍ ويقسمونه إلى قصة مصورة من 9 لوحات (شبكة). يعرضون على أمين المكتبة هذه القصة المصورة كاملة دفعة واحدة.
  • الطلب: "انظر إلى هذه القصة المصورة. اكتب قائمة بأي شيء يبدو غريباً، وأخبرني متى حدث ذلك".
  • الفائدة: أمين المكتبة بارع في وصف الأشياء الغريبة ("شخص يتزلج في منطقة ممنوعة من التزلج")، لكنه سيء في تقرير ما إذا كان ذلك يشكل حالة طوارئ فعلاً. لذا، نحن نكتفي بجعله يكتب القائمة فقط.

2. "اختبار الواقع" (دمج الاتساق الذاتي)

هذا هو الجزء السحري. أمين المكتبة متقلب قليلاً. إذا سألته نفس السؤال 5 مرات، فقد يعطيك 5 إجابات مختلفة قليلاً. أحياناً يصيب، وأحياناً يخترع شبحاً.

  • الاستراتيجية: يطلب النظام من أمين المكتبة النظر إلى نفس مقطع الفيديو 5 مرات مختلفة (باستخدام إطارات عشوائية مختلفة قليلاً).
  • الفلتر: إذا قال أمين المكتبة: "أرى متزلجاً!" في 4 من أصل 5 مرات، يقول النظام: "حسناً، هذا على الأرج likely حقيقي". أما إذا قال: "أرى وحيد قرن طائراً!" مرة واحدة فقط، فيقول النظام: "لا، كان ذلك هلوسة. تجاهلها".
  • التشبيه: الأمر يشبه سؤال 5 شهود مختلفين لوصف جريمة. إذا قال 4 منهم "سيارة حمراء"، فأنت تثق في ذلك. أما إذا قال أحدهم "تنين أرجواني"، فأنت تعلم أنه يتخيل.

3. "المحقق وفرشاة الرسم" (التثبيت والانتشار)

الآن بعد أن أصبح لدينا قائمة موثوقة بالأحداث الغريبة (مثل: "متزلج من الساعة 2:00 إلى 2:15")، نحتاج إلى العثور عليها على الشاشة.

  • المحقق (Grounding DINO): نأخذ الوصف ("متزلج") ونطلب من نموذج محقق متخصص العثور على المربع الدقيق حول هذا المتزلج في الفيديو.
  • فرشاة الرسم (SAM2): بمجرد أن يجد المحقق المتزلج في إطار واحد، نستخدم "فرشاة رسم ذكية" (SAM2) لتتبع شكل المتزلج تلقائياً في كل إطار قبل وبعد تلك اللحظة. هذا ينشئ قناعاً متحركاً مثالياً يسلط الضوء بدقة على الشخص الذي يقوم بالشيء الغريب.

لماذا يعد هذا أمراً مهماً؟

  1. لا حاجة للتدريب: لست بحاجة لتغذية النظام بآلاف الفيديوهات لـ "الأشياء السيئة" لتعليمه. إنه يعمل مباشرة (Zero-Shot) لأنه يستخدم المعرفة العامة لأمين المكتبة.
  2. يوفر المال: بدلاً من مطالبة أمين المكتبية المكلف بالنظر إلى كل إطار من الفيديو (مما سيكلف ثروة من وقت الكمبيوتر)، يطلب منه GridVAD النظر 5 أو 6 مرات فقط لكل مقطع فيديو، بغض النظر عن طول الفيديو. إنه أكثر كفاءة بمقدار 2.7 مرة.
  3. دقة أفضل: في اختبار UCSD Ped2 (مجموعة بيانات فيديو أمني قياسية)، وجدت هذه الطريقة الشذوذ على مستوى البكسل بشكل أفضل من أي طريقة أخرى، حتى تلك التي تم تدريبها خصيصاً على تلك البيانات.

العقبة

النظام جيد جداً في الدقة (عندما يجد شيئاً، فمن المؤكد تقريباً أنه حقيقي ومحدد بدقة). ومع ذلك، فإنه قد يغفل عن بعض الأشياء إذا لم يخطر ببال أمين المكتبية ذكرها في المقام الأول. من الأفضل الحصول على عدد قليل من التنبيهات المثالية بدلاً من آلاف الإنذارات الكاذبة.

باختصار: GridVAD يتوقف عن محاولة جعل الذكاء الاصطنا artificial intelligence "قاضياً" ويحوله إلى "شاهد". إنه يجمع روايات عدة شهود، ويستبعد الكاذبين منهم، ثم يرسل فريقاً متخصصاً للعثور على المثيرين للمشاكل وتحديدهم بدقة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →