LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling
LongVT 是一个端到端的智能体框架,它通过利用原生工具调用来执行从全局到局部的“多模态工具链思维”过程,从而增强长视频推理能力,该框架由新构建的大规模数据集(VideoSIAH)和一种三阶段训练策略所支持,其性能显著优于现有基线。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是《LongVT》论文的解释,已用通俗易懂的语言并辅以生动的类比进行翻译。
核心难题:视频中的“大海捞针”
想象一下,你被给了一部 2 小时的电影,并被问了一个非常具体的问题:“主角在第 43 分钟系鞋带时,穿的袜子是什么颜色的?”
如果你试图仅通过阅读摘要或瞥视几张随机截图来回答这个问题,你很可能会猜错。这就是当前人工智能模型在处理长视频时面临的问题。它们倾向于“幻觉”——即编造它们实际上并未看到的细节——因为它们试图一次性记住整个视频,而没有真正仔细查看特定的时刻。
解决方案:LongVT(“侦探”型 AI)
作者们创建了一个名为 LongVT 的新系统。LongVT 不像试图死记硬背整个视频,而是像一名侦探或人类研究员那样行动。
以下是它的工作原理,使用一个简单的类比:
1. “粗略扫描”(图书馆搜索)
想象你在一个巨大的图书馆里寻找一本特定的书。你不会阅读每一本书的每一页。首先,你会沿着过道走,扫视书脊,以找到该书可能所在的总体区域。
- 在论文中: LongVT 首先对视频进行“全局浏览”。它查看散布在整个视频中的少量帧,以大致了解正在发生什么。
2. “工具调用”(放大镜)
一旦侦探心想:“我敢打赌系袜子的场景在厨房”,他们不会只是猜测。他们会拿出放大镜,仅放大那个特定的厨房场景进行仔细观察。
- 在论文中: 这就是“原生工具调用”。LongVT 拥有一个名为
crop_video的内置工具。如果它认为答案在第 40 到 45 分钟之间,它会真的从视频中切出这 5 分钟的片段,并以高细节重新检查。
3. “自我修正”(“等等,让我再检查一下”的时刻)
有时,侦探可能会放大错误的地方。也许他们以为系鞋带发生在厨房,但实际上它发生在客厅。
- 在论文中: 论文表明,LongVT 能够意识到:“哎呀,我看错了时间窗口。我在那里没看到鞋子。”然后它会说:“让我再试一次”,并第二次调用工具来查看不同的时间(例如,查看第 43 分钟而不是第 41 分钟)。这被称为 iMCoTT(交错多模态工具思维链)。
训练过程:AI 如何学会思考
你不能只是告诉 AI“做个侦探”就指望它起作用。作者们必须通过一个三步训练过程来教导它:
- 冷启动(课堂): 首先,他们使用一个名为 VideoSIAH 的庞大数据集向 AI 教授基础知识。这个数据集充满了“大海捞针”式的问题。他们向 AI 展示了如何猜测时间、检查视频以及自我纠正的示例。这就像在让学生自由探索之前,先教他们如何使用图书馆目录。
- 强化学习(练习场): 接下来,他们让 AI 自行练习。每次它猜对了时间并得到了正确答案,它就会获得“奖励”。如果它猜错了或产生了幻觉,它就不会得到奖励。这教会了它要更加精确。
- 优化(大师班): 最后,他们从练习场中提取 AI 的最佳尝试,并将它们作为新课程再次用于训练它。这巩固了它的技能,使其更快、更可靠。
结果:一种新型的“思考”
该论文声称,这种方法改变了 AI 处理长视频的方式。
- 旧方式: AI 试图“记住”视频,往往因为不堪重负而编造内容(产生幻觉)。
- LongVT 方式: AI 承认自己不知道,然后去寻找证据(通过裁剪视频),检查证据,然后再给出答案。
核心结论:
LongVT 是一个不再试图从记忆中“猜测”答案的 AI。相反,它学会了去寻找答案。它将长视频视为干草堆,使用工具来寻找那根针,并在开口说话前双重检查自己的工作。这使其更加准确,并且不太可能就其所见内容撒谎。
论文还指出,尽管进行了所有这些额外的“查找”工作,但由于 AI 不会浪费时间编造关于未见之物的长篇故事,因此它实际上比其他模型更快。它只是找到真相并给出答案。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。