← 最新论文
🤖 AI

OVIBench: Benchmarking Online Video Question Answering under Interruption

本文介绍了 OVIBench,这是首个标准化的基准测试及相应的训练数据集,旨在评估并提升视觉语言模型在在线视频问答过程中处理现实用户中断(例如取消、误触发和纠错)的能力。

原作者: Naiming Liu, Zhiheng Wu, Shuning Wang, Tie Zhang, Bowen Liu, Tong Wang

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Naiming Liu, Zhiheng Wu, Shuning Wang, Tie Zhang, Bowen Liu, Tong Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下正在观看一段自然纪录片的直播。你正全神贯注地看着一只乌龟带着小鸭子穿过池塘,这时你突然意识到旁白描述的动物弄错了。在真实的对话中,你会进行干预,说:“等等,那是只猫,不是鸭子,”或者说:“停,我不想再听下去了。”几十年来,旨在观看视频并回答问题的人工智能系统一直以一种更为僵化的方式运行。它们被设计为必须等待整个视频播放完毕后才开始说话,输出一段完整且不间断的独白。这种方法在静态测试中表现良好,但却无法捕捉到人类与技术交互时那种混乱且动态的现实。我们不会等待机器说完它的想法后再去纠正它;我们会打断它、引导它,并在它说话的中途叫停。

现在,一组研究人员构建了一种新的方法,用以测试这些观看视频的计算机是否能够应对现实世界。他们创建了一个名为 OVIBench 的基准测试,模拟了用户在模型生成答案的过程中进行中断的体验。研究人员并没有让模型从头到尾看完视频后再说话,而是设置了一个场景:模型开始说话,然后在特定的时刻,一个用户信号切入其中。这个信号可能会告诉模型完全停止说话、忽略一个错误的指令,或者纠正它刚刚犯下的事实错误。研究人员将这些中断分为三种截然不同的类型:一种是“取消”,即用户希望结束对话;一种是“误触发”,即用户无意中说出了看起来像指令但实际并非指令的内容;另一种是“纠正”,即用户指出错误并要求提供新的答案。

为了进行这项测试,该团队从各种来源收集了数千个视频,涵盖了从烹饪教程到犯罪现场以及自然片段等内容。他们使用了一套复杂的系统来针对这些视频生成问题,并在模型回答的过程中随机插入中断。由于对数千个模型进行实时测试既混乱又缓慢,他们开发了一种巧妙的离线模拟方法。他们记录了模型说话的确切速度,计算出在中断发生时模型已经看到了视频中的哪些帧,然后将这一特定片段的视频连同部分答案和中断信号一起反馈给模型。这使得他们能够测试模型在受到中断时的反应,仿佛是在实时发生一样,从而确保每个模型面临的条件完全相同。

结果显示,这些模型在安静、受控的测试中表现出色,但在处理动态中断时却存在显著差距。虽然许多顶尖的视频模型在无人干扰时能正确回答问题,但当被要求适应用户的中途指令时,它们却表现得极其挣扎。它们经常无法识别何时应该停止说话,或者更关键的是,无法在被要求改变答案时做出调整。在许多情况下,模型会继续生成与用户新指令相矛盾的文本,或者会被一个虚假信号搞混,在应该继续说话时却停止了说话。研究表明,处理这些中断的能力不仅仅是一个次要的功能,而是当前技术的一个根本性弱点,尤其是在遵循纠正请求方面。

为了解决这个问题,研究人员创建了一个专门用于训练模型如何识别并应对这些中断的新训练数据集。他们采用了一个标准的视频模型,利用数千个模型必须在中断中选择正确反应的案例对其进行微调。训练结果令人瞩目。这个经过训练的新模型虽然规模相对较小,但其表现优于许多未接受此类特定训练的更大、更强大的模型。它学会了区分真正的停止指令和虚假信号,并且在被告知出错时,能够显著提升修正答案的能力。事实上,这个较小的专业化模型表现得比一些现有的最大模型还要好,这表明正确的训练数据比单纯扩大模型规模更为重要。

研究人员还开发了一套详细的准则,不仅用于判断模型是否得到了正确答案,还用于评估其处理交互的过程。他们测量了模型的响应在中断后是否流动自然、是否遵循了视频中的事实,以及是否保留了不需要修改的对话部分。这些测试证实,尽管目前的模型在理解视频内容方面正在进步,但它们在应对人类对话那种流畅且可中断的特性方面仍然很大程度上准备不足。这项工作表明,对于希望在直播或在线教育等现实场景中真正发挥作用的视频助手而言,它们不仅要学会观察和表达,还必须学会如何在说话的同时倾听并做出调整。这一新的基准测试提供了一条清晰的前进路径,表明通过正确的数据和评估方法,我们可以构建出既能理解屏幕图像,又能对人类声音做出响应的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →