← 最新论文
🤖 AI

STORM: End-to-End Referring Multi-Object Tracking in Videos

本文提出了端到端多模态大语言模型 STORM,通过任务组合学习策略联合实现目标定位与跟踪,并发布了新基准 STORM-Bench,在图像定位、单目标跟踪及指代多目标跟踪任务上均取得了最先进的性能。

原作者: Zijia Lu, Jingru Yi, Jue Wang, Yuxiao Chen, Junwen Chen, Xinyu Li, Davide Modolo

发布于 2026-04-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Zijia Lu, Jingru Yi, Jue Wang, Yuxiao Chen, Junwen Chen, Xinyu Li, Davide Modolo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 STORM 的新人工智能系统,它的核心能力是:在视频里,听你一句话,就能把多个特定的物体找出来,并且一直盯着它们看,直到视频结束。

为了让你更容易理解,我们可以把这项技术想象成**“超级侦探”“全能管家”**的结合体。

1. 以前的“侦探”有什么问题?

在 STORM 出现之前,电脑看视频找东西通常分两步走,就像是一个笨拙的流水线

  • 第一步(找东西): 先让一个“眼睛”(检测器)在每一帧画面里把所有东西都框出来(比如:人、车、猫、狗)。
  • 第二步(听指令): 再让一个“大脑”(语言模型)根据你说的话(比如“找那个戴墨镜拿笔记本电脑的人”),从刚才框出来的东西里挑出对的。
  • 第三步(跟踪): 最后让一个“追踪器”去盯着这个被挑出来的人,看他在视频里怎么跑。

痛点在于:

  • 容易断片: 如果“眼睛”在第一帧没看清,后面就全错了。
  • 沟通不畅: “眼睛”、“大脑”和“追踪器”是三个不同的人,它们之间传递信息容易出错,导致找不到复杂的物体(比如“左边那个穿红衣服的人”和“右边那只狗”)。
  • 数据不够: 这种复杂的任务需要海量的标注数据,但人工标注太贵、太慢,导致以前的模型学艺不精。

2. STORM 是什么?(端到端的“超级侦探”)

STORM 把上述所有步骤合并成了一个**“全能大脑”**(端到端的多模态大语言模型)。

  • 比喻: 以前是三个工人分工合作,现在是一个超级侦探,他同时拥有敏锐的眼睛(看视频)、聪明的头脑(理解你的话)和极强的记忆力(记住物体在时间里的变化)。
  • 怎么做到的? 它不需要外部的“眼睛”或“追踪器”。它直接看着视频,听着你的话,然后像写日记一样,直接输出:“第 1 秒,那个戴墨镜的人在坐标 [120, 102];第 2 秒,他跑到了 [130, 110]……"
  • 优势: 因为它是一个整体,所以它能同时理解画面长什么样物体怎么动以及你说的话是什么意思,三者结合得非常完美。

3. 它是怎么学会的?(任务组合学习 TCL)

训练这种超级侦探通常需要海量的“视频 + 文字 + 坐标”数据,但这就像让一个学生直接去解“高数 + 物理 + 化学”的超级难题,太难了,而且没有那么多练习题。

STORM 的发明者想出了一个聪明的**“分步教学法”**(Task-Composition Learning, TCL):

  • 第一阶段(打基础): 先让模型在大量的静态图片上练习“看图说话”(比如:指认图片里的物体),再在大量的单物体视频上练习“盯住一个目标”(比如:盯着一个球看它怎么滚)。这就像先练好“识字”和“跑步”。
  • 第二阶段(融会贯通): 最后,只用少量专门设计的多物体视频数据,让模型把前面学到的技能组合起来,练习“同时盯住好几个目标并听指令”。
  • 比喻: 就像教孩子认字(图片定位)和数数(单物体跟踪),最后再让他做应用题(多物体跟踪)。这样既省去了海量昂贵数据的训练,又让模型学得又快又好。

4. 新的“题库”:STORM-Bench

为了让这个侦探更厉害,作者们还自己造了一本**“超级题库”**(STORM-Bench 数据集)。

  • 以前的题库: 题目太简单(比如“找那个穿红衣服的人”),或者题目有歧义(视频里有两个穿红衣服的人,没说清找哪个)。
  • STORM-Bench: 题目非常刁钻且清晰。比如:“找那个坐在左边椅子上、正在吃苹果、旁边还有一只猫的人。”
  • 怎么造的? 他们用了“自下而上”的方法:先让 AI 把视频里每个物体都描述一遍,再让 AI 把这些描述组合成复杂的句子,最后再让人工智能去验证这些句子是否准确。这保证了题目的质量和多样性。

5. 结果怎么样?

实验结果显示,STORM 在找物体跟踪单个物体跟踪多个物体这三个任务上,都拿到了**世界第一(State-of-the-Art)**的成绩。

  • 它有多强? 以前那些需要三个模块拼凑的模型,在复杂场景下(比如物体被挡住、画面很乱、指令很复杂)经常“翻车”。而 STORM 就像是一个经验丰富的老侦探,即使物体被遮挡了一部分,或者指令很绕,它也能稳稳地锁定目标,不会跟丢,也不会认错人。

总结

STORM 就像是一个全能型的视频管家。你不需要教它怎么“看”,怎么“记”,怎么“听”。你只需要对它说:“帮我盯着那个穿蓝衣服、拿着气球、正在和狗玩耍的小孩。”它就会自动在视频里把这个小孩(甚至包括那只狗)从开始到结束都找出来,并画出它们的轨迹。

这项技术让机器真正开始像人一样理解视频,不仅知道“有什么”,还能理解“谁在做什么”以及“它们之间的关系”,为未来的智能监控、视频搜索和机器人交互打下了坚实的基础。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →