Towards AI-Driven Policing: Interdisciplinary Knowledge Discovery from Police Body-Worn Camera Footage
本文提出了一种创新的跨学科框架,该框架利用包括多模态分析和大型语言模型在内的先进人工智能技术,对警察执法记录仪视频中的行为动态(如冲突升级和尊重行为)进行自动检测、分类和总结,以增强执法问责制和培训水平。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在美国各城市的警察每天都会佩戴记录其与公众互动过程的摄像机。这些被称为执法记录仪(body-worn cameras)的设备捕捉了海量且不断增长的视频和音频库,为人们提供了一个观察执法人员与社区接触瞬间的原始、未经滤镜处理的视角。几十年来,研究人员和警察领导层一直希望能够通过筛选这些录像,来理解在交通执法或社区巡逻中究竟发生了什么,寻找关于尊重、紧张或降级处置(de-escalation)的模式。然而,庞大的数据量使得仅凭人类的视听能力几乎无法完成这项任务。一名警员在一周内可能会产生数小时的录像,而整个部门每年积累的录像时长更是达数千小时。为了理清这些繁杂的数据,科学家们正转向人工智能,其目的并非取代人类的判断,而是帮助组织并突出这些复杂遭遇中最关键的部分。挑战在于如何教会机器在警笛声和叫喊声的嘈头中辨别声音,在混乱的场景中区分不同的说话者,并理解高压环境下言语背后的含义。
来自罗彻斯特理工学院的一个研究小组与罗彻斯特警察局合作,开发了一套旨在解决这一问题的全新系统。他们将其框架称为 OpenBWC,这是一个开源工具,结合了音频处理、语音识别和语言分析技术,将原始视频文件转化为结构化、可搜索的信息。其目标不仅仅是转录所说的话,更在于识别互动的动态特征:警员是否表现得彬彬有礼?情况是升级了还是平息了?为此,研究人员向该系统输入了通过公开记录请求获取的 1,225 段视频。这些录像经过了脱敏处理,通过模糊面部来保护相关人员的隐私,时长从短短的 11 秒到长达近 12 小时的连续录像不等,总计超过 1,877 小时的视频。团队将这些长文件分解成易于处理的 30 秒片段,以帮助计算机在不丢失对话连贯性的情况下处理音频。
其核心方法包含一个多步骤的过程,模拟了人类在聆听一段困难录音时的行为。首先,系统将混合音频分离为独立的个体声音,这种技术被称为说话者分离(speaker separation)。这至关重要,因为执法记录仪的画面通常包含重叠的言语、背景噪音以及多人同时说话的情况。研究人员使用了一种专门的模型,将警员的声音从平民的声音中分离出来,使计算机能够一次专注于一位说话者。一旦声音被分离,系统便利用先进的语音转文本技术将音频转录为文字。然而,研究人员发现,并非所有的转录工具在这些混乱的现实环境中表现都一样出色。他们测试了某流行语音识别系统的两个版本,发现较小、较快的版本经常漏掉单词、重复短语或无法完整捕捉对话;相比之下,较大、更详细的版本生成的转录文本准确度要高得多,尽管仍需要人工审核以纠正细微错误。
生成文本后,研究人员应用大型语言模型来阅读转录内容并总结互动过程。这一步骤使系统能够识别关键主题,例如警员是否使用了降级处置策略,或者对话的语气是否从冷静转向了攻击性。随后,结果被存储在一个可以按主题、说话者或特定行为进行搜索的数据库中,从而使跨越数千起事件寻找模式成为可能。团队发现,虽然该系统在处理如交通执法等常规互动时表现良好(此类场景音频较清晰且言语模式可预测),但在混乱场景中却面临显著困难。在涉及尖叫、警笛或多人同时说话的高压情境下,转录的准确度会下降,系统有时会混淆说话者身份或遗漏关键细节。
研究人员谨慎地指出,他们的系统并非完美的解决方案,不应作为纪律处分或法律判决的唯一依据。他们明确排除了目前利用全自动化转录来取代关键事件中人工审核的可能性。研究表明,最有效的方法是采用一种混合模式,即由人工智能承担整理和总结数据的繁重工作,但由人类专家对结果进行验证,尤其是在复杂或高风险的案例中。团队还强调了一个技术局限性:由于摄像机佩戴在警员身上并指向前方,警员的声音通常比平民的声音捕捉得更清晰。这种不平衡意味着系统在理解警员方面的表现自然优于平民,如果不加以考虑,可能会导致分析偏差。
尽管存在这些挑战,该项目仍展示了利用人工智能进行警务工作的切实路径。通过将开源工具与严格测试相结合,研究人员创建了一个框架,可以帮助警察部门审查自身实践、培训警员提升沟通技巧,并向公众履行问责。这项工作并不声称已经解决了分析警察录像的问题,但它提供了一个开启对话的可靠方法。研究结果表明,虽然机器可以帮助我们在噪音中发现模式,但最重要的洞察力仍然来自于计算能力与人类理解力的结合。随着技术的进步和数据集的扩大,这种跨学科的方法有望改变执法机构从日常工作中学习的方式,将庞大的视频档案转化为可操作的知识,从而提升安全感并建立公众信任。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。