ForeSea: AI Forensic Search with Multi-modal Queries for Video Surveillance
تقدم هذه الورقة نظام ForeSea، وهو نظام بحث جنائي يعتمد على الذكاء الاصطناعي يتميز بمسار عمل ثلاثي المراحل لاسترجاع وتفسير الفيديو متعدد الوسائط، إلى جانب ForeSeaQA، وهو أول معيار اختبار مصمم لتقييم الاستعلامات المعقدة التي تجمع بين الصور والنصوص مع تحديد زمني دقيق في لقطات المراقبة طويلة المدى.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تعمل كمحقق يحاول حل جريمة، ولكن بدلاً من بضع ساعات من اللقطات، لديك أسابيع من الفيديو من مئات كاميرات المراقبة. أنت بحاجة للعثور على شخص معين، أو لحظة محددة، مثل: "متى انضم الرجل الذي يرتدي قبعة حمراء إلى الشجار؟"
القيام بذلك يدويًا يشبه محاولة العثور على حبة رمل معينة على الشاطئ عبر فحص كل حبة رمل واحدة تلو الأخرى. هذا أمر مستحيل.
تقدم هذه الورقة البحثية ForeSea، وهو نظام ذكاء اصطناعي جديد صُمم ليكون "المحقق الرقمي" المثالي لفيديوهات المراقبة. إليك كيف يعمل، مشروحاً ببساطة:
1. المشكلة: "إبرة في كومة قش"
أدوات الذكاء الاصطناعي الحالية تشبه أمين مكتبة لا يقرأ سوى عناوين الكتب. إذا سألته: "أرني الكتاب الذي يتحدث عن الرجل ذو القبعة الحمراء"، فقد يخمن بناءً على العنوان، لكنه لا يستطيع في الواقع رؤية الرجل في الصورة التي تعرضها عليه، كما لا يمكنه إخبارك بالضبط في أي صفحة (أو أي ثانية من الفيديو) حدث الفعل.
- الذكاء الاصطناعي القديم: "إليك قائمة بالفيديوهات التي تذكر 'الشجار'." (لكنه لا يعرف من الذي يتشاجر أو متى).
- الفجوة: المحققون الحقيقيون يحتاجون لقول: "إليك صورة للمشتبه به. أرني كل مرة يظهر فيها هذا الشخص تحديداً وماذا كان يفعل."
2. الحل: ForeSea (الـ "فلتر الذكي")
بنى المؤلفون نظاماً يسمى ForeSea يعمل كخط تجميع مكون من ثلاث خطوات لحل هذه المشكلة.
الخطوة 1: "متتبع البشر" (الحارس)
تخيل حارساً عند مدخل ملهى ليلي لا يسمح إلا للأشخاص الذين يطابقون وصفاً معيناً بالدخول.
- بدلاً من مشاهدة الفيديو بأكمله، يستخدم ForeSea أولاً متتبعاً للعثور فقط على الأشخاص الموجودين في الفيديو.
- يقوم بقص جميع الشوارع الفارغة، والأشجار، والسيارات. يحتفظ فقط بمقاطع الفيديو الصغيرة التي يظهر فيها شخص ما.
- التشبيه: إذا كان الفيديو عبارة عن فيلم مدته 10 ساعات، فإن هذه الخطوة تقلصه إلى الـ 30 دقيقة فقط التي يظهر فيها المشتبه به فعلياً.
الخطوة 2: "المفهرس متعدد اللغات" (أمين المكتبة الذكي)
الآن، أصبح لدى النظام آلاف المقاطع الصغيرة من البشر. يحتاج لتنظيمها حتى تتمكن من البحث عنها لاحقاً.
- معظم الأنظمة تفهم النصوص فقط. إذا كتبت "قبعة حمراء"، فستجد المقاطع التي تحتوي على ذلك النص.
- يستخدم ForeSea مشفرًا متعدد الوسائط (Multimodal Encoder). فكر في هذا كأمين مكتبة يفهم كلاً من الكلمات والصور.
- يمكنك أن تسأل: "أرني الرجل ذو القبعة الحمراء" (نص) أو يمكنك رفع صورة للرجل وتسأل "متى دخل هذا الشخص؟" (صورة + نص). يفهم النظام كليهما في نفس الوقت ويقوم بإنشاء "فهرس بحث" لهما.
الخطوة 3: "عقل المحقق" (المستنتج)
بمجرد أن يجد النظام أكثر 3 مقاطع مرجحة، يرسلها إلى عقل ذكاء اصطناعي قوي (نموذج لغوي كبير للفيديو - Video Large Language Model).
- ينظر هذا العقل إلى المقاطع، ويقرأ السؤال، ويقول: "نعم، أنا أراه. لقد دخل المبنى في الساعة 10:35 صباحاً وكان يرتدي قبعة حمراء."
- والأهم من ذلك، أنه يعطيك الطابع الزمني الدقيق (التحديد الزمني - temporal grounding) حتى لا تضطر للبحث يدوياً عبر الفيديو.
3. الملعب الجديد: ForeSeaQA
لإثبات نجاح نظامهم، أدرك المؤلفون أنه لا يوجد "اختبار" لهذا النوع من البحث المحدد القائم على الصور. لذا، قاموا ببناء معيار جديد يسمى ForeSeaQA.
- الاختبار: أنشأوا أكثر من 1,000 سؤال بناءً على فيديوهات جرائم حقيقية.
- اللمسة المميزة: بعض الأسئلة هي مجرد نصوص ("هل حدث شجار؟")، لكن بعضها الآخر متعدد الوسائط (إليك صورة لشخص + "متى بدأ هذا الشخص في الجري؟").
- النتيجة: اكتسح ForeSea المنافسة. لم يكن أكثر دقة في إيجاد الإجابة فحسب، بل كان أيضاً أفضل بكثير في تحديد الوقت الدقيق لحدوث ذلك.
4. لماذا يهم هذا الأمر (لحظة الإدراك)
- السرعة: لأن ForeSea يقوم بتصفية الأجزاء المملة من الفيديو أولاً، فإنه يجيب على الأسئلة بسرعة ضعف الأنظمة الأخرى. فهو لا يضيع وقته في مشاهدة الممرات الفارغة.
- الدقة: هو لا يخمن فحسب؛ بل يشير إلى الأدلة. إذا سألته "هل سرق الحقيبة؟"، فسيظهر لك مقطع الـ 5 ثوانٍ حيث حدثت السرقة.
- المرونة: يعمل حتى لو كنت لا تعرف اسم الشخص، بل تعرف فقط شكله (الصورة).
ملخص التشبيه
تخيل أنك تبحث عن لعبة مفقودة في علية ضخمة وفوضوية.
- الذكاء الاصطناعي القديم: يقرأ قائمة بالأشياء الموجودة في العلية ويخمن: "ربما تكون اللعبة بالقرب من الصناديق". وعليك أنت أن تتسلق العلية بأكملها للتحقق.
- ForeSea:
- الفلترة: ينظر فقط إلى أكوام اللعب حيث كان الطفل يلعب.
- البحث: تظهر له صورة للعبة. فيجد فوراً الـ 3 أكوام التي تبدو وكأنها تحتوي على تلك اللعبة.
- الإجابة: يسلمك اللعبة ويقول: "كانت في الصندوق الأحمر في الساعة 2:00 مساءً".
تمثل هذه الورقة البحثية خطوة كبيرة للأمام لأنها تنقل ذكاء المراقبة الاصطناعي من "التخمين بناءً على النص" إلى "الرؤية والفهم بناءً على الصور والزمن"، مما يجعله شريكاً حقيقياً في التحقيقات الواقعية.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.