← 最新论文
💻 computer science

SceneGraphVLM: Dynamic Scene Graph Generation from Video with Vision-Language Models

SceneGraphVLM 是一个紧凑的、经两阶段训练的视觉 - 语言模型,它利用高效的 TOON 序列化格式和幻觉感知强化学习,从图像和视频生成高精度场景图,延迟约为 1 秒。

原作者: Vladislav Makarov, Mark Gizetdinov, Dmitry Yudin

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Vladislav Makarov, Mark Gizetdinov, Dmitry Yudin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正看着一条繁忙的街道。传统的计算机视觉系统可能会尝试列出它看到的每一个物体:“汽车、汽车、汽车、树、树、人、人……",然后试图猜测它们是如何连接的。这往往会导致一个混乱、令人不知所措的列表,充满错误,比如仅仅因为云和汽车在图片中靠得很近,就声称云在“触碰”汽车。

SceneGraphVLM 是一种旨在清理这种混乱的新方法。它就像一个聪明、高效的叙述者,观察图像或视频,并立即写出一段简短、结构化的故事,只关注实际存在的内容。

以下是其工作原理,分解为简单的概念:

1. 问题:“过度热情”的讲故事者

之前试图做到这一点的 AI 模型,就像一位过度热情的导游。它们会告诉你一切,包括那些不存在的事物(幻觉),或者反复陈述相同的事实。它们也很慢,生成的文本冗长且混乱,难以被其他计算机读取。

2. 解决方案:“电报”风格(TOON 格式)

作者们意识到,AI 讲述故事的方式至关重要。与其使用像 JSON 那样笨重的格式(就像写一封包含大量多余词汇的信,例如“该物体是……"、“该关系是……"),他们发明了一种 TOON 格式

  • 类比:想象通过电报发送消息,按字付费。你不会写“猫正坐在垫子上”。你会写“猫,坐,垫子”。
  • 结果:SceneGraphVLM 采用这种“电报”风格。它去掉了所有多余的废话,使输出更短、生成更快,且更易于计算机理解。它节省了约 15–20% 描述同一场景所需的“空间”。

3. 训练:通过实践学习(并接受纠正)

该模型分两个截然不同的阶段进行训练,就像学生学习新技能一样:

  • 阶段 1:监督微调(SFT)——“模仿者”阶段
    AI 被展示数千张图片及其完美的描述。它学习模仿这种风格。它学习规则:“如果我看到一只狗,我必须写出‘狗’及其位置。”
  • 阶段 2:强化学习(RL)——“严格教练”阶段
    这是秘诀所在。在第一阶段,AI 为了保险起见,仍可能会编造不存在的事物(幻觉)。在第二阶段,一位“教练”(奖励系统)会观察 AI。
    • 规则:如果 AI 编造了一个不存在的关系(例如,说一个人正在“拿着”一朵云),教练就会给予惩罚
    • 目标:AI 学会,与其猜测一切,不如精确地只说出它看到的内容。它在全面性与准确性之间取得了平衡。

4. 视频超能力:无需追踪的“记忆”

在观看视频时,事物会逐帧变化。传统的视频 AI 需要一个复杂的“追踪器”来从一秒到下一秒跟踪一个人,就像保安跟踪嫌疑人一样。

SceneGraphVLM 的做法不同。它将视频视为一场对话

  • 类比:想象你正在向朋友描述一个电影场景。你不需要每一秒都从头开始。你会说:“好吧,那个人还在那里,但现在他正往左走。”
  • 工作原理:AI 查看当前帧,并短暂记住它刚刚讲述的关于前一帧的“故事”。它利用这段记忆来保持一致性,而无需笨重的追踪系统。这使得视频描述流畅且快速。

5. 结果:快速且准确

该论文在三个主要数据集(PSG、PVSG 和 Action Genome)上测试了这种方法。

  • 速度:它可以在约一秒内生成完整的场景描述。这足以满足近实时应用的需求。
  • 质量:与旧方法相比,它在不编造事物方面表现更好。虽然其他模型可能会生成一个包含 20 个连接(其中许多是错误的)的混乱网络,但 SceneGraphVLM 生成的是一个紧密、干净的包含 5–6 个真实连接的网络。
  • 效率:即使在使用较小的、更便宜的计算机芯片(使用名为 Qwen3.5-0.8B 的小模型)时,它也能很好地工作,证明如果你使用正确的“电报”格式和训练方法,就不需要庞大的超级计算机也能获得良好的结果。

总结

SceneGraphVLM 是一种轻量级、快速的 AI,可将图像和视频转化为干净、结构化的故事。它使用简写语言来节省时间,通过“严格教练”的学习来停止编造事物,并记住前一时刻以保持视频描述的一致性——所有这些都无需依赖笨重、复杂的追踪系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →