← 最新论文
💻 computer science

OSEF: One-Step Evidence Fusion for Cross-Video Scene Procedure Planning

本文引入了跨视频场景程序规划(CVSPP),这是一项要求模型同时检索相关视频证据并规划动作的新任务,并提出了单步证据融合(OSEF),一种通过将所有候选证据融合进软晶格进行规划以避免硬选择的方法,该方法在新建的十一源基准测试上达到了最先进的性能。

原作者: Zhentong Ye, Lei Zhang, Sijia Zhou, Yingda Yu, Yuehan Shi, Jiaqi Xuan, Shuaiwu Dong, Guanchao Tong, Meimei Zhang, Bin Li

发布于 2026-08-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhentong Ye, Lei Zhang, Sijia Zhou, Yingda Yu, Yuehan Shi, Jiaqi Xuan, Shuaiwu Dong, Guanchao Tong, Meimei Zhang, Bin Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人如何冲泡一杯完美的咖啡。你不仅希望机器人知道步骤,还希望它能观看一段视频,弄清楚哪一段特定的视频展示了正确的做法,找到咖啡师倒水的精确时刻,然后亲自写下指令。这就是**视频场景程序规划(Video Scene Procedure Planning)**的世界。这是人工智能的一个分支,旨在让计算机尝试通过观察视频,将一个起始场景(如原始食材)转化为目标场景(如做好的美食)。

长期以来,研究人员会给计算机提供“正确”的视频以及精确的起止时间。这就像是把正确的一页食谱递给机器人并说:“读它。”但在现实世界中,如果你在搜索引擎中搜索“如何冲泡咖啡”,它不会只给你一个完美的视频,而是会给你一个包含十个不同视频的列表。有些很棒,有些很糟糕,有些虽然展示了相同的步骤,但拍摄于不同的厨房。巨大的挑战在于:你如何教计算机从这一堆混乱的选项中挑选出正确的视频,找到该视频中正确的片段,并在不被错误选项干扰的情况下制定计划?这篇论文探讨了这一复杂的现实世界问题。


问题所在:“错误配方”陷阱

作者引入了一个更具挑战性的新游戏,叫做跨视频场景程序规划(Cross-Video Scene Procedure Planning, CVSPP)。把它想象成一场烹饪节目挑战赛,主持人给你一个菜肴的描述(“从生土豆开始,以金黄色的薯条结束”)和一叠四个不同的烹饪视频。你的任务是:

  1. 挑选出那个真正展示了如何制作薯条的视频。
  2. 在该视频中找到发生油炸过程的具体片段。
  3. 写下分步食谱。

棘手之处在于,所有四个视频可能都是关于“制作食物”的,甚至看起来非常相似。如果你选错了视频(比如选了展示如何烤蛋糕的那个),或者选错了片段(比如选了洗土豆的部分而不是油炸的部分),你的食谱就会变得毫无意义。

以往的方法试图通过“猜测并检查”来解决这个问题。它们会先选定一个视频,说“好吧,就是这个!”然后尝试规划步骤。但如果它们在一开始就选错了视频,整个计划就会崩溃。这就像是拿着一张伦敦的地图试图前往巴黎;无论你如何认真阅读地图,你也永远无法到达埃菲尔铁塔。作者认为,过早做出这种“艰难抉择”是一个致命的错误。

解决方案:OSEF(单步证据融合)

为了解决这个问题,团队构建了一个名为 OSEF(One-Step Evidence Fusion,单步证据融合)的新系统。OSEF 不会选择单个视频并丢弃其余部分,而是会将所有视频都保留在过程中,直到最后一刻。

想象你是一名试图破解谜团的侦探。你不会在看到第一个嫌疑人时就将其逮捕,而是会让所有四名嫌疑人留在房间里。你观察线索(“起始”和“目标”描述)并询问:“嫌疑人 A 与故事的契合度如何?嫌疑人 B 呢?”你不仅仅是挑选一个,而是为每一个视频中的每一个时刻都创建一个“计分板”。

然后,OSEF 使用一个特殊的“翻译器”(称为标记-全局适配器/token-global adapter)将整个计分板输入到规划大脑中。这就像是给厨师一张巨大的透明薄片,上面显示了来自每个视频的每一个可能的步骤,并根据其正确的可能性进行了加权。这样,厨师就可以观察全局并决定:“啊,视频 1 中的油炸步骤看起来最好,但视频 2 中的切菜步骤更清晰。”

通过保持所有选项的“软性”和可用性,系统避免了过早锁定错误视频的陷阱。它允许规划过程进行自我修正,即使最初对哪个视频最好的判断略有偏差。

研究发现

作者利用他们构建的一个大规模基准测试(包含来自 11 个不同来源的教学视频,如烹饪、DIY 和清洁)来测试他们的新方法。他们建立了一个包含 14 个不同测试场景的“计分板”。

以下是数据结果:

  • 重大胜利: 在六个最可靠的测试场景(称为“原生单元/native cells”)中,OSEF 在每一个场景中都排名第一
  • 改进之处: 在四个视频非常相似(同任务/same-task)的特定测试中,OSEF 在获取精确视频和精确计划的成功率上,比之前的最优方法提高了 2.9 到 10.7 个百分点
  • 核心秘诀: 作者发现,最大的提升并非来自于用于挑选视频的高级数学算法,而是来自于让规划器能够看到所有视频选项的接口。正是这种“标记-全局(token-global)”的方法拉开了差距。
  • 局限性: 当视频非常短或标签很混乱时,系统仍然难以应对。在五个转换后的测试场景中,系统的表现并不比直接猜测最常见答案(“多数序列基准/majority-sequence floor”)更好,这表明对于某些类型的混乱数据,这个问题仍然非常困难。

为什么这很重要

这篇论文表明,当我们要求计算机从一堆混乱的现实世界视频中学习时,我们不能强迫它们立即做出单一且硬性的选择。相反,我们需要让它们同时保留所有的可能性,让最终的决策从整体图景中自然浮现。

作者谨慎地指出,虽然这是一个重要的进步,但它并不是万灵药。该系统仍然依赖于预处理的视频特征和确定性查询,并且如果视频过于相似或数据噪声过大,它仍然会感到困惑。然而,通过证明“保持选择余地”比“过早选出胜者”更有效,他们为 AI 研究人员提供了一种更稳健的新方法,教机器如何从人类教学视频那混乱而精彩的世界中学习。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →