VTO: Visual Tool Orchestration for Video Anomaly Detection
该论文提出了 VTO,这是一个过程监督的强化学习框架,它利用基础模型驱动的认知评估器和细粒度的逐步监督,使多模态智能体能够动态地编排专门的视觉工具以改进视频异常检测,并通过一个新的基准测试和工具集 VAD-Tool 进行了验证。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名试图在繁忙、混乱的城市中破解谜题的侦探。你带着笔记本和一支笔,但城市里到处是行驶的汽车、掉落的物体和正在打斗的人群。为了破案,你不能只是观察整个场景并进行猜测;你需要使用特定的工具。也许你需要一个放大镜来追踪特定的人,或者一个速度计来检查车辆是否超速,亦或是火灾探测器来发现烟雾。在计算机的世界里,这被称为视频异常检测(Video Anomaly Detection)。它的任务是教会机器从视频画面中识别出异常或危险的事物,比如一场斗殴的爆发或某人的摔倒。
长期以来,计算机尝试通过记忆模式来进行这项工作,就像一个为了考试而临时抱佛脚的学生。它们会观察一段视频并说:“这看起来像是一场打斗!”但如果这场打斗发生在新的地点,或者看起来略有不同,计算机就会感到困惑并失败。最近,科学家们尝试给计算机一个可以交谈和思考的“大脑”(大语言模型)。他们希望计算机能够弄清楚何时该使用哪种工具。但问题在于:这些聪明的计算机往往在看到一个微小的异常后,就会停止思考并直接给出答案。它们忽略了更宏大的全局,比如一场小规模的冲突是如何演变成一场踩踏事件的。它们需要一种学习如何持续调查、循序渐进的方法,而不是过早放弃。
这正是这篇新论文所要解决的问题。由北京邮电大学的王睿(Rui Wang)和齐孟实(Mengshi Qi)领导的研究团队构建了一个名为 VTO(视觉工具编排,Visual Tool Orchestration)的新系统。把 VTO 想象成一个针对侦探机器人的严厉而卓越的教练。它不再只是让机器人去猜测,而是观察机器人采取的每一个步骤。如果机器人选错了工具,或者在还没确定之前就停止了调查,教练会立即给它一个“差评”。如果机器人遵循了一套完美的逻辑链,一个接一个地检查线索,教练则会给它一个“好评”。
团队创建了一个特殊的训练场,名为 VAD-Tool,它就像一个拥有 12 种不同“魔法工具”的大型游乐场,供机器人学习。这些工具可以执行诸如统计人群、识别面部、发现武器或检测火灾等任务。研究人员使用一种称为“过程监督强化学习”的方法来训练他们的机器人。简单来说,这意味着他们不仅根据最终答案给机器人评分,还根据其过程进行评分。他们确保机器人明白,过早停止也是一种错误。他们甚至使用了一个超级智能的 AI(一个拥有 720 亿参数的模型)来充当裁判,检查机器人在每一步中的推理是否合理。
结果令人印象深刻。当他们测试这个新的 VTO 系统时,它在解决这些复杂的、多步骤的谜题方面比旧方法表现得更好。其他系统通常在发现一个线索后就会放弃,而 VTO 则会继续深入,将点与点连接起来,直到发现整个故事的全貌。在测试中,与之前的最优方法相比,新系统在选择正确工具和正确顺序方面的准确率提升了高达 10.2%。它甚至击败了一些最强大、最先进的 AI 模型,证明了教计算机如何进行“分步思考”比单纯扩大其规模更为重要。论文指出,通过迫使 AI 遵循严格的逻辑路径并奖励它不轻易放弃,我们可以构建出更安全、更智能的系统来守护我们的城市。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。