Towards AI-Driven Policing: Interdisciplinary Knowledge Discovery from Police Body-Worn Camera Footage
تقترح هذه الورقة إطاراً جديداً متعدد التخصصات يسخر الذكاء الاصطناعي المتقدم، بما في ذلك التحليل متعدد الوسائط والنماذج اللغوية الكبيرة، للكشف التلقائي عن ديناميكيات السلوك وتصنيفها وتلخيصها، مثل التصعيد والاحترام، في لقطات كاميرات الشرطة المثبتة على الجسم لتعزيز المساءلة والتدريب في إنفاذ القانون.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في كل يوم، يرتدي ضباط الشرطة في المدن عبر الولايات المتحدة كاميرات تسجل تفاعلاتهم مع الجمهور. هذه الأجهزة، المعروفة باسم الكاميرات المثبتة على الجسم، تلتقط مكتبة واسعة ومتنامية من الفيديو والصوت، مما يوفر نظرة خام وغير منقحة للحظات التي يلتقي فيها إنفاذ القانون بالمجتمع. لعقود من الزمن، أمل الباحثون وقادة الشرطة في تمحيص هذا التسجيل لفهم ما يحدث أثناء توقف مروري أو نداء في حي ما، بحثاً عن أنماط من الاحترام أو التوتر أو تهدئة الموقف. ومع ذلك، فإن الحجم الهائل للبيانات جعل هذه المهمة مستحيلة تقريباً على العيون والآذان البشرية وحدها. فقد ينتج الضابط الواحد ساعات من التسجيلات في أسبوع واحد، وتراكم إدارة كاملة آلاف الساعات كل عام. ولتفسير هذا الطوفان، يتجه العلماء إلى الذكاء الاصطناعي، ليس لاستبدال الحكم البشري، بل للمساعدة في تنظيم وتسليط الضوء على الأجزاء الأكثر أهمية من هذه المواجهات المعقدة. ويكمن التحدي في تعليم الآلات كيفية السمع فوق ضجيج صفارات الإنذار والصراخ، والتمييز بين الأصوات المختلفة في مشهد فوضوي، وفهم المعنى وراء الكلمات المنطوقة في المواقف عالية الضغط.
قام فريق من الباحثين من معهد روتشستر للتكنولوجيا، بالعمل جنباً إلى جنب مع إدارة شرطة روتشستر، ببناء نظام جديد مصمم لمعالجة هذه المشكلة. أطلقوا على إطار عملهم اسم "OpenBWC"، وهو أداة مفتوحة المصدر تستخدم مزيجاً من معالجة الصوت، والتعرف على الكلام، وتحليل اللغة لتحويل ملفات الفيديو الخام إلى معلومات مهيكلة وقابلة للبحث. الهدف ليس مجرد نسخ ما قيل، بل تحديد ديناميكيات التفاعل: هل كان الضابط محترماً؟ هل تصاعد الموقف أم هدأ؟ وللقيام بذلك، قام الباحثون بتغذية النظام بـ 1,225 فيديو تم الحصول عليها من خلال طلبات السجلات العامة. هذه التسجيلات، التي تم تعديلها لحماية خصوصية الأشخاص المعنيين عن طريق طمس الوجت، تراوحت بين مقاطع قصيرة مدتها إحدى عشرة ثانية إلى ما يقرب من اثنتي عشرة ساعة متواصلة، بإجمالي يتجاوز 1,877 ساعة من الفيديو. قام الفريق بتقسيم هذه الملفات الطويلة إلى أجزاء يمكن إدارتها مدة كل منها ثلاثون ثانية للمساعدة في معالجة الكمبيوتر للصوت دون فقدان تدفق المحادثة.
تتضمن جوهر طريقتهم عملية متعددة الخطوات تحاكي كيفية استماع الإنسان لتسجيل صعب. أولاً، يقوم النظام بفصل الصوت المختلط إلى أصوات فردية، وهي تقنية تُعرف باسم فصل المتحدث. هذا أمر بالغ الأهمية لأن لقطات الكاميرا المثبتة على الجسم غالباً ما تحتوي على كلام متداخل، وضوضاء خلفية، وأشخاص متعددين يتحدثون في وقت واحد. استخدم الباحثون نموذجاً متخصصاً لعزل صوت الضابط عن صوت المدني، مما سمح للكمبيوتر بالتركيز على متحدث واحد في كل مرة. وبمجرد فصل الأصوات، قام النظام بنسخ الصوت إلى نص باستخدام تقنية متقدمة لتحويل الكلام إلى نص. ومع ذلك، وجد الباحثون أن ليست كل أدوات النسخ تعمل بنفس الكفاءة في هذه البيئات الواقعية الفوضوية. فقد اختبروا نسختين من نظام شائع للتعرف على الكلام واكتشفوا أن النسخة الأصغر والأسرع كثيراً ما تفوت الكلمات، أو تكرر العبارات، أو تفشل في التقاط المحادثة الكاملة. في المقابل، أنتجت النسخة الأكبر والأكثر تفصيلاً نصوصاً أكثر دقة بكثير، رغم أنها لا تزال تتطلب مراجعة بشرية لتدارك الأخطاء الدقيقة.
بعد توليد النص، طبق الباحثون نموذج لغة كبير لقراءة النصوص وتلخيص التفاعلات. سمحت هذه الخطوة للنظام بتحديد الموضوعات الرئيسية، مثل ما إذا كان الضابط قد استخدم تكتيكات تهدئة الموقف أو ما إذا كانت نبرة المحادثة قد تحولت من الهدوء إلى العدوانية. ثم تم تخزين النتائج في قاعدة بيانات يمكن البحث فيها حسب الموضوع، أو المتحدث، أو سلوك معين، مما يجعل من الممكن العثين على أنماط عبر آلاف الحوادث. ووجد الفريق أنه بينما يعمل النظام بشكل جيد في التفاعلات الروتينية مثل التوقفات المرورية، حيث يكون الصوت أوضح وأنماط الكلام متوقعة، إلا أنه يعاني بشكل كبير في السيناريوهات الفوضوية. في المواقف عالية التوتر التي تتضمن صراخاً، أو صفارات إنذار، أو أشخاصاً متعددين يتحدثون فوق بعضهم البعض، تنخفض دقة النسخ، وقد يخلط النظام أحياناً بين من يتحدث أو يفقد تفاصيل حاسمة.
كان الباحثون حذرين في الإشارة إلى أن نظامهم ليس حلاً مثالياً ولا ينبغي استخدامه كأساس وحيد للقرارات التأديبية أو الأحكام القانونية. لقد استبعدوا صراحة فكرة أن النسخ الآلي الكامل يمكن أن يحل حالياً محل المراجعة البشرية في الحوادث الحرجة. تشير الدراسة إلى أن النهج الأكثر فعالية هو نهج هجين، حيث يتولى الذكاء الاصطناعي المهام الشاقة المتمثلة في تنظيم وتلخيص البيانات، ولكن يقوم الخبراء البشريون بالتحقق من النتائج، خاصة في الحالات المعقدة أو عالية المخاطر. كما سلط الفريق الضوء على محدودية تقنية: فغالباً ما يتم التقاط صوت الضابط بوضوح أكبر بكثير من صوت المدني لأن الكاميرا تُرتدى على جسم الضابط، وتتجه نحوه. هذا الاختلال يعني أن النظام أفضل بطبيعته في فهم جانب الضابط من المحادثة، مما قد يؤدي إلى انحراف التحليل إذا لم يتم أخذ ذلك في الاعتبار.
على الرغم من هذه التحديات، يوضح المشروع مساراً عملياً لاستخدام الذكاء الاصطناعي في العمل الشرطي. فمن خلال الجمع بين الأدوات مفتوحة المصدر والاختبار الصارم، أنشأ الباحثون إطار عمل يمكنه مساعدة إدارات الشرطة على مراجعة ممارساتها، وتدريب الضباط على التواصل الأفضل، ومساءلة أنفسهم أمام الجمهور. لا يدعي هذا العمل أنه حل مشكلة تحليل لقطات الشرطة، ولكنه يقدم طريقة موثوقة لبدء الحوار. تشير النتائج إلى أنه بينما يمكن للآلات مساعدتنا في رؤية الأنماط وسط الضجيج، فإن أهم الرؤى لا تزال تأتي من الجمع بين القدرة الحسابية والفهم البشري. ومع تحسن التكنولوجيا ونمو مجموعات البيانات، يمكن لهذا النهج متعدد التخصصات أن يغير كيفية تعلم وكالات إنفاذ القانون من عملها اليومي، محولاً الأرشيفات الضخمة من الفيديو إلى معرفة قابلة للتطبيق تعمل على تحسين السلامة والثقة للجميع المعنيين.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.