← 最新论文
💻 computer science

Enhancing Visual Token Representations for Video Large Language Models via Training-Free Spatial-Temporal Pooling and Gridding

本文提出了一种无需训练的ST-GridPool方法,通过集成金字塔时间网格化和基于范数的空间池化,在高效压缩视觉令牌的同时保留关键时空交互,从而增强视频大语言模型。

原作者: Bingjun Luo, Tony Wang, Hanqi Chen, Xinpeng Ding

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Bingjun Luo, Tony Wang, Hanqi Chen, Xinpeng Ding

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图向一位注意力极短、只能记住几个关键细节的朋友描述一部情节紧凑、动作场面的电影。如果你试图向他们讲述电影的每一帧,他们会感到不知所措并忘记重要部分。如果你只是过于仓促地概括,又可能会错过关键的剧情转折。

这正是视频 AI 模型所面临的问题。它们需要“观看”数千个视觉帧(token)来理解视频,但它们的“记忆”(计算能力)是有限的。目前的方法通常试图通过简单地平均所有内容来压缩视频,就像给整个人群拍一张模糊的照片。这会丢失重要的细节。

这篇论文介绍了一种新的、免费的升级方案,称为ST-GridPool。它就像一个智能的、无需训练的过滤器,帮助 AI 更有效地“观看”视频,而无需重新学习如何“看”。它通过两个巧妙的技巧来实现这一点:

1. “金字塔时间网格”(PTG)——延时摄影摄影师

想象你正在观看一场足球比赛的视频。

  • 问题所在: 标准 AI 以一种统一的方式审视比赛。它可能会错过一个快速的手势(微动作),或者无法同时看到整个比赛策略(长期趋势)。
  • 解决方案: PTG 就像一位同时以不同速度拍照的摄影师。
    • 它创建一个细粒度视图(观察 8 秒的小片段),以捕捉像球员踢球这样的快速动作。
    • 它创建一个粗粒度视图(观察 32 秒的大片段),以理解比赛的整体流向。
    • 随后,它将这些不同“尺度”的时间合并为一个丰富且单一的摘要。这就像拥有一个既能捕捉瞬间进球,又能涵盖 90 分钟完整策略的精彩集锦,全部打包成 AI 易于消化的格式。

2. “基于范数的空间池化”(NSP)——聚光灯管理员

想象一个视频帧,其中一个人正在一个嘈杂、拥挤的房间里说话。

  • 问题所在: 标准 AI 平等地对待图像的每个部分。它对说话者面孔的关注度与对身后无聊、空旷墙壁的关注度相同。这将“记忆”浪费在了背景上。
  • 解决方案: NSP 就像一个聚光灯管理员。它查看图像每个部分的“能量”(数学上称为“范数”)。
    • 它意识到说话者的面孔具有高“能量”(包含大量重要信息),而墙壁具有低“能量”(仅仅是背景噪音)。
    • 随后,它增强了对说话者的聚光灯,并调暗了墙壁的灯光。
    • 这确保 AI 将其有限的记忆集中在场景中最重要部分,保留了那些对回答问题真正至关重要的细节。

结果:更智能、更快速的 AI

该论文声称,通过结合这两种技巧,AI 在理解视频方面变得更为出色,而无需任何昂贵的重新训练或改变其内部结构。

  • 它是“即插即用”的: 你可以将现有的视频 AI(如 LLaVA-Video)直接“挂载”此方法。无需新训练。
  • 它节省金钱和时间: 因为它只关注重要部分,所以 AI 运行速度更快,使用的计算机内存(GPU)更少,尤其是在处理长视频时。
  • 它效果更好: 在测试中,这种方法帮助 AI 比以往更准确地回答关于长视频的问题,即使在被迫使用极少“记忆”(token 预算)的情况下,也击败了其他顶级方法。

简而言之,ST-GridPool 就像给视频 AI 提供了一副智能眼镜,能够自动将动作放大并加速时间线,使其能够在不感到疲惫或困惑的情况下理解视频中的复杂故事。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →