Zoom In, Reason Out: Efficient Far-field Anomaly Detection in Expressway Surveillance Videos via Focused VLM Reasoning Guided by Bayesian Inference
تقترح الورقة البحثية إطار عمل VIBES، وهو إطار عمل غير متزامن وفعال يجمع بين الاستدلال البايزي عبر الإنترنت لتحديد مواقع شذوذ المركبات في المجال البعيد ديناميكيًا مع استدلال نماذج الرؤية واللغة المستهدفة لتحقيق مراقبة للطرق السريعة عالية الدقة وقابلة للتفسير وفي الوقت الفعلي دون التكاليف الحسابية لمعالجة إطارات الفيديو العالمية.
تخيل أنك حارس أمن تراقب شاشة ضخمة عالية الدقة تعرض امتداداً لطريق سريع مزدحم بطول 10 أميال. مهمتك هي رصد مشكلة محددة وصغيرة جداً: سيارة بعيدة جداً في الأفق تنحرف فجأة أو تتعرض لحادث.
المشكلة: معضلة "الإبرة في كومة القش" إذا حاولت النظر إلى الشاشة بأكملها في وقت واحد، فستبدو السيارة البعيدة مجرد نقطة صغيرة، مثل حبة رمل على الشاطئ. سيصاب عقلك (أو في هذه الحالة، جهاز الكمبيوتر الذي يعمل بالذكاء الاصطناعي) بالإرهاق بسبب كل السيارات والأشجار واللوحات الإرشادية القريبة. الأمر يشبه محاولة سماع همسة في حفلة موسيقية صاخبة؛ حيث تطغى حركة المرور الطبيعية الصاخبة على الحركة الطفيفة والخطيرة لتلك السيارة البعيدة.
علاوة على على ذلك، إذا حاولت تحليل كل إطار من إطارات الفيديو باستخدام ذكاء اصطناعي فائق الذكاء، فسيصاب جهاز الكمبيوتر الخاص بك بالإجهاد ويتباطأ، مما يجعل من المستح المستحيل رصد المشكلة في الوقت الفعلي.
الحل: نظام VIBES (نظام "التقريب الذكي") تقدم الورقة البحثية نظاماً جديداً يسمى VIBES. فكر في VIBES كفريق مكون من شخصين يعملان معاً: كشاف خفيف الوزن ومحقق فائق الذكاء.
الكشاف (الاستدلال البايزي - Bayesian Inference): الكشاف هو مراقب سريع وبسيط لا يحتاج إلى "رؤية" الصورة بأكملها بتفاصيل دقيقة. هو فقط يراقب أنماط الحركة للسيارات. هو يعرف كيف يبدو "القيادة الطبيعية" لحركة المرور الحالية (على سبيل المثال: "السيارات تسير عادةً في خط مستقيم بسرعة 60 ميلاً في الساعة").
الخدعة السحرية: يستخدم الكشاف مفهوماً رياضياً يسمى الاستدلال البايزي. تخيل أن لدى الكشاف "مقياس شك". طالما أن السيارات تسير بشكل طبيعي، يظل المقياس منخفضاً. ولكن إذا انحرفت سيارة فجأة أو ضغطت على المكابح بقوة، يرتفع المقياس فجأة.
المحفز: في اللحظة التي يرتفع فيها المقياس، يصرخ الكشاف: "هناك شيء غريب يحدث هنا تماماً، وفي هذا الوقت!" هو لا يعرف ماذا حدث، بل يعرف فقط أين ومتى.
المحقق (نموذج الرؤية واللغة - Vision-Language Model): المحقق هو ذكاء اصطناعي فائق الذكاء يمكنه فهم المشاهد المعقدة وشرحها بلغة بشرية (مثل: "سيارة صفراء انحرفت واصطدمت بشاحنة زرقاء"). ومع ذلك، فإن المحقق بطيء ومكلف في التشغيل.
عملية التسليم: بدلاً من أن يطلب المحقق من الذكاء الاصطناعي مراقبة الطريق السريع الممتد لـ 10 أميال بأكملها، يقوم الكشاف بتسليمه صورة مقربة وصغيرة جداً للمكان الذي ارتفع فيه "مقياس الشك" تماماً.
التحليل: الآن، ينظر المحقق إلى هذه الصورة الصغيرة والمركزة. ولأن الضجيج في الخلفية قد اختفى، يستطيع المحقق رؤية السيارة الصغيرة البعيدة بوضوح، وفهم ما حدث بالضبط، ووصفه بشكل مثالي.
لماذا يعمل هذا بشكل أفضل؟
لا مزيد من "تشتت الانتباه": في الطريقة القديمة، كان الذكاء الاصطناعي يحاول النظر إلى الطريق السريع بأكمله وفشل في رصد المشكلة الصغيرة. في نظام VIBES، ينظر الذكاء الاصطناعي فقط إلى بقعة المشاكل المحددة، لذا لا يفوت أي شيء.
سريع للغاية: يقوم النظام فقط بطلب مساعدة المحقق البطيء والذكي عندما يجد الكشاف السريع شيئاً مريباً. معظم الوقت، يعمل النظام باستخدام الكشاف السريع فقط، وهو أمر فعال للغاية من حيث الكفاءة.
قابل للتكيف: يقوم الكشاف بتحديث فكرته عن "الطبيعي" باستمرار. إذا أصبح الزحام المروري كثيفاً أو تغير مسار الطريق، يقوم الكشاف بتعديل "مقياس الشك" تلقائياً حتى لا يرتبك بسبب الظروف المتغيرة.
النتيجة تظهر الورقة البحثية أن نهج "التقريب، ثم التحليل" هذا يسمح للنظام برصد الحوادث الصغيرة والبعيدة التي تفشل الأنظمة الأخرى في رصدها، مع العمل بسرعة كافية ليتم استخدامه في مراقبة حركة المرور في الوقت الفعلي. إنه يحول بث الفيديو الضبابي والمربك إلى قصة واضحة ومركزة حول ما حدث بالفعل.
إليك ملخص تقني مفصل للورقة البحثية بعنوان "التقريب للرؤية، والتعليل من خلالها: الكشف الفعال عن الشذوذ في المدى البعيد في فيديوهات مراقبة الطرق السريعة عبر الاستدلال الموجه بتركيز النماذج اللغوية البصرية (VLM) باستخدام الاستدلال البايزي" (VIBES).
1. بيان المشكلة
تتناول الورقة التحدي الحرج المتمثل في الكشف عن الشذوذ في المدى البعيد في فيديوهات مراقبة الطرق السريعة. وبينما توفر النماذج اللغوية البصرية (VLMs) قدرات استدلال دلالي قوية، فإن تطبيقها مباشرة على إطارات الفيديو العالمية يواجه محدوديتين رئيسيتين:
تشتت الانتباه (Attention Dilution): تشغل حالات الشذوذ في المدى البعيد (مثل الاصطدامات البعيدة أو الانزلاق) عددًا ضئيلاً جدًا من البكسلات. وفي الإطارات العالمية، يتم تمويه هذه الإشارات الدقيقة بواسطة المعالجة القائمة على الرقع (patches) للمشفر البصري، وتغرق بسبب الانتباه المخصص لحركة المرور القريبة الأكثر بروزًا بصريًا.
عدم الكفاءة الحسابية: إن تشغيل نماذج (VLMs) ثقيلة على تدفقات فيديو مستمرة وعالية الدقة يؤدي إلى تكاليف حسابية وزمن انتقال (latency) باهظين، مما يجعل المعالجة في الوقت الفعلي أمرًا صعبًا.
التعميم: تعاني الطرق التقليدية (القائمة على إعادة البناء أو التتبع) من صعوبة في التعميم عبر تضاريس الطرق السريعة المتنوعة وظروف المرور الديناميكية، وغالبًا ما تفتقر إلى القدرة على التفسير الدلالي.
2. المنهجية: إطار عمل VIBES
يقترح المؤلفون إطار عمل VIBES، وهو إطار تعاوني غير متزامن يفكك مهمة الكشف إلى مسارين: "التقريب للرؤية" (التحديد المحلي) و**"التعليل من خلالها"** (التفسير الدلالي).
بدلاً من معالجة كل إطار، يستخدم النظام وحدة خفيفة الوزن لمراقبة حركة المرور باستمرار وتوليد محفزات غير متزامنة.
تتبع المسار: يستخدم تقنية SAHI (الاستدلال المساعد بالتقطيع) للكشف عن المركبات الصغيرة والبعيدة عن طريق تقطيع الإطارات العالمية إلى رقع متداخلة، متبوعًا بتتبع خفيف لاستخراج مسارات المركبات.
فك الارتباط بإطار فرينيه (Frenet Frame Decoupling): للتعامل مع انحناءات الطرق المتنوعة، يتم تحويل الإحداثيات الكارتيزية المطلقة إلى نظام إحداثيات فرينيه النسبي. هذا يفصل حركة المركبة إلى:
السرعة الطولية (v∥): الموازية لتدفق حركة المرور.
السرعة العرضية (v⊥): العمودية على تدفق حركة المرور.
الاستدلال البايزي عبر الإنترنت: يقوم النظام بنمذجة سلوك القيادة "الطبيعي" كتوزيع غاوسي متعدد المتغيرات. ويقوم بتحديث المتوسط البعدي (μpost) والتباين (σpost) لهذه الحالات الحركية باستمرار باستخدام تقدير الاحتمال الأقصى البعدي (MAP).
المفاجأة البايزية (Bayesian Surprise): يتم اكتشاف الشذوذ عندما تنحرف الحالة الحركية للمركبة بشكل كبير عن الحدود الاحتمالية الديناميكية. يتم حساب درجة "المفاجأة" S كلوغاريتم سالب للاحتمالية (والذي يتناسب مع مسافة ماهالانوبيس المربعة) للحالة المرصودة تحت التوزيع الطبيعي.
المحفز غير المتزامن: إذا تجاوزت درجة المفاجأة عتبة معينة (محددة بمستوى دلالة α)، يقوم النظام بتفعيل المرحلة التالية، مع تحديد الطابع الزمني المحدد (ta) والإحداثيات المكانية للشذوذ.
ب. الاستدلال المركز للنماذج اللغوية البصرية (مرحلة "التعليل من خلالها")
بمجرد التفعيل، يتجنب النظام معالجة تدفق الفيديو بأكلِه.
زمانيًا: نافذة [ta−τp,ta+τf] تلتقط تطور الحدث.
مكانيًا: قص ديناميكي يحتوي على المركبة ذات الشأن (ego-vehicle) وجيرانها المباشرين، مع استبعاد الخلفية غير ذات الصلة.
الاستدلال الدلالي: يتم تغذية هذه القصات المركزة في نموذج لغوي بصري (مثل Qwen3-VL) مع نص توجيهي (prompt). يقوم النموذج بتوليد تفسير لغوي مهيكل، يحدد نوع الشذوذ (مثل اصطدام، انزلاق)، والكيانات المعنية، والسبب.
3. المساهمات الرئيسية
إطار عمل VIBES: بنية غير متزامنة تفصل بين المراقبة الحركية خفيفة الوزن والاستدلال الثقيل للنماذج اللغوية البصرية، مما يحل المقايضة بين الدقة والكفاءة.
المحفز البايزي الموجه بالحركية: وحدة مبتكرة تقوم بتحديث الحدود الاحتمالية للقيادة الطبيعية ديناميكيًا باستخدام تقدير MAP عبر الإنترنت. وهي تنجح في تحديد مواقع الشذوذ في المدى البعيد دون الحاجة لإعادة التدريب، مما يمنع تشتت الانتباه في النماذج اللغوية البصرية.
فك الارتباط القائم على إطار فرينيه: يسمح استخدام صيغة إطار فرينيه للنظام بالتعميم عبر تضاريس الطرق المختلفة (المنحنيات مقابل الطرق المستقيمة) من خلال فصل تحليل الحركة الطولية والعرضية.
الكفاءة والقابلية للتفسير: يحقق النظام أداءً في الوقت الفعلي من خلال استدعاء النموذج اللغوي البصري فقط عند اكتشاف "مفاجأة"، مع توفير تفسيرات دلالية قابلة للقراءة من قبل البشر في الوقت نفسه.
4. النتائج التجريبية
قيم المؤلفون نظام VIBES على ثلاث مجموعات بيانات: TUMTraf، وTADS، ومجموعة بيانات CPED مخصصة (مجموعة بيانات الأحداث في المقاطعات الصينية)، وكلها تركز على شذوذ المدى البعيد.
دقة الكشف: حقق VIBES نسبة استدعاء (Recall) بلغت 100% في مجموعة بيانات TUMTraf و91.67% في مجموعة بيانات CPED، متفوقًا بشكل كبير على النماذج المرجعية الحديثة (بما في ذلك Qwen3-VL وDeepSCAN وVideoAgent).
الاستدلال الدلالي: حقق دقة حدث (Event Accuracy) عالية (92.86% في TUMTraf) ودقة تفاصيل (Detail Accuracy) (85.71%)، مما أظهر قدرته على تصنيف ووصف الأحداث المعقدة بشكل صحيح.
الكفاءة الحسابية:
معدل استعلام النموذج اللغوي البصري: قام VIBES باستدعاء النموذج اللغوي البصري لـ 4.6% فقط (في TUMTraf) و2.5% (في CPED) من الإطارات، مما قلل الحمل الحسابي بشكل هائل.
الأداء في الوقت الفعلي: عالج الفيديو بسرعة 10.65 إطار في الثانية (TUMTraf) و27.82 إطار في الثانية (CPED)، متجاوزًا متطلبات الـ 10 إطارات في الثانية القياسية لمراقبة حركة المرور.
دراسات الاستئصال (Ablation Studies): أدى إزالة الوحدة البايزية، أو نظام إحداثيات فرينيه، أو آلية التحديث عبر الإنترنت إلى انخفاض كبير في الأداء، مما أكد ضرورة كل مكون.
5. الأهمية
تقدم هذه الورقة تحولًا جذريًا في كشف الشذوذ في الفيديو لأغراض سلامة المرور. فمن خلال دمج الاستدلال البايزي مع النماذج اللغوية البصرية، يتغلب VIBES على مشكلة "تشتت الانتباه" المتأصلة في المعالجة العالمية للنماذج اللغوية البصرية. إنه يقدم حلاً قابلاً للتوسع ويعمل في الوقت الفعلي، ليس فقط بدقة عالية في اكتشاف حالات الشذوذ الدقيقة في المدى البعيد، بل يوفر أيضًا رؤى قابلة للتفسير (مثل "سيارة صفراء انحرفت فجأة..."). هذا النهج ذو قيمة خاصة لأنظمة النقل الذكية حيث تكون الموارد الحسابية محدودة، وتكون القدرة على اكتشاف الأحداث النادرة والبعيدة أمرًا بالغ الأهمية لمنع الحوادث.