← 最新论文
💻 computer science

ViTexQA: A Multi-Frame Temporal Perception Dataset for Video Text Question Answering

为了解决当前多模态模型在理解视频帧中跨时间分布文本方面的局限性,本文引入了需要跨帧文本融合的大规模数据集 ViTexQA,以及结合了思维链(CoT)引导的有监督微调与时序定位强化学习的两阶段训练框架 FrameThinker,该框架实现了最先进的性能。

原作者: Zhentao Guo, Chen Duan, Tongkun Guan, Zining Wang, Kai Zhou, Pengfei Yan

发布于 2026-06-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhentao Guo, Chen Duan, Tongkun Guan, Zining Wang, Kai Zhou, Pengfei Yan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在看一部悬疑电影,解开谜题的线索并不是集中在同一个场景中。相反,凶手的名字出现在第一分钟的一辆巴士上,犯罪时间显示在中间的一个时钟上,而最后的地点则出现在最后一分钟的一个标牌上。为了破解这个谜题,你必须记住并连接这些散落在各处的信息。

大多数目前的 AI 模型就像是只看电影中单个静止帧的观众。如果你只给它们看巴士的照片,它们能读出名字。但如果问它们一个需要结合“巴士名字”、“时钟时间”和“标牌内容”才能回答的问题,它们就会卡住,因为它们无法在时间跨度上“连点成线”。

这篇名为 ViTexQA 的论文介绍了一种让 AI 成为更优秀“电影侦探”的新方法。以下是简单的拆解说明:

1. 问题所在:“快照”陷阱

目前的 AI 模型非常擅长阅读单张图片中的文本(比如墙上的标牌)。然而,现实世界的视频是动态的。文本经常会随着时间的推移出现、移动、改变或消失。

  • 问题: 研究人员发现,现有的视频测试存在“作弊”行为。它们提出的问题可以通过观察单个画面来回答。这就像是在问“这辆车是什么颜色?”,而答案在单张快照中就显而易见。
  • 现实情况: 理解视频更像是阅读一个情节随时间展开的故事。你需要记住 10 秒前看到了什么,才能理解现在正在发生什么。

2. 解决方案:一个新数据集 (ViTexQA)

团队创建了一个庞大的新视频问题库,名为 ViTexQA

  • 规则: 这个库中的每一个问题都无法通过只看单一帧来回答。
  • 类比: 想象一场“寻宝游戏”,线索隐藏在一段长视频的不同部分。想要获胜,AI 必须观看整个视频,记录下文本在何时出现,然后结合这些笔记来找到答案。
  • 内容: 他们收集了超过 5,000 个视频,涵盖了体育比分、新闻滚动条、驾驶标志和滚动文本等内容。他们甚至专门制作了 100 个模拟视频,旨在测试 AI 处理屏幕滚动文本的能力。
  • 人工参与: 与许多使用其他 AI 来编写问题的 AI 项目不同,这里的每一个问题和答案都是由人类编写的,以确保它们真正具有难度并需要真正的思考。

3. 方法:“FrameThinker”

为了教 AI 如何解决这些“寻宝游戏”式的谜题,他们构建了一种名为 FrameThinker 的训练方法。你可以把它看作是 AI 的两阶段训练营:

  • 第一步:“做笔记”课(监督微调)
    首先,他们教 AI 扮演一名细心的学生。AI 不仅仅是猜测答案,而是被迫写出“思维链”(Chain of Thought)。它必须这样表达:“在 12 秒时,我看到屏幕上显示‘开始’;在 30 秒时,我看到‘进度 50%’;在 90 秒时,我看到‘结束’。” 它学习在给出答案之前,先明确列出在不同时间点发现的证据。

  • 第二步:“教练反馈”课(强化学习)
    接下来,他们使用奖励机制。如果 AI 给出了正确答案但跳过了时间步骤,或者时间点弄错了,它会得到“差评”。如果它能正确地将视频开头与结尾的文本联系起来,它就会得到“金星”。这训练了 AI 将时序性关联性视为与答案本身同样重要的价值。

4. 结果

当他们用这种新方法与目前最智能的 AI 模型进行对比测试时:

  • 差距: 即便是最优秀的现有模型也表现挣扎,它们经常因为试图仅利用视频的单个“快照”来解决谜题而导致回答错误。
  • 胜利: 经过该新数据集训练的 FrameThinker 模型表现显著优于所有人。它证明了当你迫使 AI 观察整个时间轴并将点连接起来时,它对视频文本的理解能力会大幅提升。

总结

简而言之,这篇论文的核心观点是:“目前的 AI 难以理解视频中的故事,因为它们只看单张图片。我们构建了一个新的测试(ViTexQA),迫使 AI 阅读整个故事;同时构建了一种训练方法(FrameThinker),教导 AI 对‘何时发生’进行记录。其结果是,AI 终于可以像人类一样,通过连接过去、现在和未来来理解视频文本。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →