ViSAGE: Constructing Self-Correcting Memories for Long-Form Video Understanding
ViSAGE 是一个多模态智能体记忆框架,通过构建具有自我修正能力的、以实体为中心的记忆,利用跨模态绑定、双向细化以及多智能体交叉验证来防止身份混淆和幻觉,从而增强了长视频理解能力,并比现有最先进的基准模型实现了 5.9% 的准确率提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图解开一个贯穿整部电影的谜团,但你每次只能看一帧静止的画面,而且每隔几分钟,你的记忆就会被清空一次。这就是现代人工智能在尝试理解长视频时每天面临的挣扎。如今最聪明的 AI 模型就像是能完美读完一页书的优秀侦探,但如果你交给它们一部 40 分钟的电影,它们就会感到不知所措。它们试图将整个故事挤进一个微小的脑力空间里,或者将电影切成一个个细小、孤立的片段。问题在于,当你把一个故事切碎时,你会丢失其中的联系。你会忘记角色是谁,会混淆他们的名字,并且因为无法记住上一场戏中的线索,你会对第一场戏发生了什么开始进行疯狂的猜测。
这就是“长视频理解”领域发挥作用的地方。科学家们正试图教会计算机观看数小时的视频,记住细节,并回答关于发生了什么、谁做的以及为什么这么做的复杂问题。目标是构建一种不仅仅是看到像素,而是能理解故事的 AI,能够从开场到片尾始终追踪人物和物体。但目前的方法经常失败,因为它们的总结过于激进,丢弃了区分不同人的微小细节,或者它们陷入了一种循环:由于它们只关注“当下”,所以无法修正五分钟前犯下的错误。
于是有了 ViSAGE,这是由浙江大学和西安电子科技大学的研究人员设计的一种新系统,它就像是为 AI 智能体提供的一个超强力的、具有自我纠错能力的记忆系统。把标准 AI 的记忆想象成一本凌乱的笔记本,你在看电影时在上面涂鸦,但一旦翻页,你就无法回去修正错误的猜测。如果你在第一场戏中认为某个角色是“马里奥”,但后来发现其实是“艾玛”,普通系统会一直称呼他们为马里奥,从而导致混乱和错误的答案。然而,ViSAGE 就像一位保留着嫌疑人名单和事件时间线的侦探。当新的线索到来时——比如在第 30 分钟听到对话中提到一个名字——它不仅仅是将其存档,而是会回到开头重新改写笔记,以确保整个故事逻辑自洽。
研究人员发现,通过构建这种“自我纠错”系统,AI 终于能够处理长视频带来的困惑。他们创建了一个将“发生了什么”(事件)与“谁做的”(角色)相分离的框架。当 AI 看到一个人但还不知道其姓名时,会给他们一个临时标签。随后,当视频揭示其姓名时,ViSAGE 会利用“向后更新”机制立即修正之前所有的笔记,确保每一个动作都正确地链接到正确的人身上。它还使用了一个“智能体团队”来复核其工作。如果 AI 对某个答案不确定,它不会编造故事(这被称为“幻觉”),而是被程序设定为说“我不知道”,这要安全且可靠得多。
在测试中,这种新方法的效果显著优于以往最强的方法。在一套具有挑战性的长视频测试中,ViSAGE 比现有的最强系统提高了 5.9% 的准确率。具体而言,它在机器人相关视频任务上得分 45.5%,在基于网页的视频任务上得分 58.4%,并在 Video-MME-long 基准测试中取得了高达 79.1% 的惊人成绩。研究人员表明,通过修复记忆错误,AI 不仅能答对更多问题,还停止了犯下危险错误(例如混淆谁在做什么),并且变得更擅长承认自己缺乏信息。这表明,对于 AI 而言,要真正理解长篇故事,它需要一个能够生长、变化并能自我修正的记忆,而不仅仅是一个静态的事实列表。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。