← 最新论文
💻 computer science

How Should Video LLMs Output Time? An Analysis of Efficient Temporal Grounding Paradigms

该论文通过控制变量实验对比了三种视频时序定位输出范式,发现连续分布解码范式在独立于模型规模的情况下,能实现精度与效率的最佳平衡,为面向边缘部署的高效系统设计提供了实证依据。

原作者: Shengji Jin, Yuanhao Zou, Victor Zhu, Zhengping Ji, Chen Chen

发布于 2026-04-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Shengji Jin, Yuanhao Zou, Victor Zhu, Zhengping Ji, Chen Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给视频 AI 教练(Video LLMs)开一场“如何报时”的研讨会。

想象一下,你有一个超级聪明的 AI 教练,它看过无数视频。现在你问它:“视频里那个人扔球的动作是从第几秒开始,第几秒结束的?”

AI 必须回答一个时间范围(比如"5.2 秒到 10.8 秒”)。这篇论文的核心问题就是:AI 应该用什么样的“语言”或“方式”来回答这个时间,才能既准又快,还省资源

作者对比了三种不同的“报时”方式,并发现了一个惊人的结论。

🎬 三种“报时”方式大比拼

为了公平起见,作者给所有 AI 教练穿了同样的“衣服”(用了相同的底层模型、同样的训练数据),只改变它们“说话”的方式:

1. 文字数字法 (Text Numeral Generation)

  • 比喻:就像让 AI 像一个小学生写作文一样。
  • 做法:AI 必须一个字一个字地拼出数字。比如它要输出"5.2",它得先想"5",再想".",再想"2"。
  • 缺点:这就像让一个擅长算数的人,非要通过“拼写单词”来算数学题。它容易拼错(比如把 5.2 拼成 5.3),而且因为要一个字一个字地“吐”出来,速度很慢,还容易在长视频里“迷路”(上下文稀释)。

2. 时间令牌法 (Temporal Token Generation)

  • 比喻:就像给 AI 发了一套特制的“时间积木”
  • 做法:AI 的词汇表里专门增加了一些代表时间的积木块(比如 <T0>, <T1>)。它不需要拼数字,而是直接按顺序把这些积木块搭出来。
  • 缺点:虽然比写作文快一点,但它还是得一块一块地搭(顺序生成)。如果视频很长,它搭积木搭到一半可能就累了,或者搭歪了。而且,如果它想表达“模糊的时间”,积木法很难做到。

3. 连续时间解码法 (Continuous Temporal Decoding) —— 🏆 冠军

  • 比喻:就像让 AI 直接看温度计或者看仪表盘
  • 做法:AI 不需要拼字,也不需要搭积木。它直接观察视频里的关键帧,然后像指针一样,直接指向一个具体的时间点,或者画出一个“概率分布”(比如:90% 的概率在 5 秒,10% 的概率在 6 秒)。
  • 优点
    • :一步到位,不用一个字一个字说,也不用一块一块搭。
    • :它能理解时间的“模糊性”(比如动作是慢慢开始的,不是突然跳变的),所以定位更精准。
    • 省资源:虽然它多了一个小小的“指针模块”,但因为它不需要反复生成,整体效率最高。

🚀 核心发现:小模型也能跑赢大模型?

这篇论文最让人兴奋的地方在于它打破了“模型越大越好”的迷信。

  • 以前的观念:要想时间定位准,必须用那种有 70 亿参数(7B)甚至更大的超级大模型。
  • 这篇论文的发现:如果你选对了“报时方式”(连续解码法),一个只有 15 亿参数(1.5B)
    • 比喻:这就像是一个拿着精密仪表盘的小赛车手(小模型 + 连续解码),跑赢了拿着笨重算盘的大卡车司机(大模型 + 文字数字法)。
    • 作者把这种现象称为"范式红利"(Paradigm Dividend):只要方法对,小模型也能爆发出大能量。

⚖️ 效率与精度的平衡(帕累托前沿)

作者还画了一张图,展示了“速度”和“精度”的平衡:

  • 文字法:虽然没增加额外参数,但因为要慢慢“拼字”,速度最慢
  • 积木法:参数很少,但因为要“一块块搭”,速度也慢,而且容易出错。
  • 连续法:虽然多了一点点计算量,但速度最快,精度最高。它是真正的“性价比之王”。

💡 总结与启示

这篇论文告诉我们,在开发视频 AI 时,不要只盯着把模型做大(堆参数)。

  1. 怎么输出答案(Output Formulation):让 AI 直接“看”时间(连续解码),比让它“拼”时间(文字生成)要聪明得多。
  2. 小模型也能打:在资源受限的设备(如手机、边缘设备)上,用对方法的小模型,完全能胜任复杂的视频理解任务,不需要非得用那种耗电巨大的超级大模型。
  3. 未来的方向:虽然现在的连续解码法很完美,但它还不太擅长判断“哪个瞬间最精彩”(高光时刻检测)。未来的研究可能会把“指针”和“评分表”结合起来,让 AI 既知道时间,又知道哪个时刻最精彩。

一句话总结
给视频 AI 装上一个**“直接看表”的指针**(连续解码),比让它**“拼字报时”(文字生成)或“搭积木报时”**(令牌生成)要快得多、准得多,甚至能让小模型逆袭大模型!

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →