想象一下,你正看着一条繁忙的街道。传统的计算机视觉系统可能会尝试列出它看到的每一个物体:“汽车、汽车、汽车、树、树、人、人……",然后试图猜测它们是如何连接的。这往往会导致一个混乱、令人不知所措的列表,充满错误,比如仅仅因为云和汽车在图片中靠得很近,就声称云在“触碰”汽车。
SceneGraphVLM 是一种旨在清理这种混乱的新方法。它就像一个聪明、高效的叙述者,观察图像或视频,并立即写出一段简短、结构化的故事,只关注实际存在的内容。
以下是其工作原理,分解为简单的概念:
1. 问题:“过度热情”的讲故事者
之前试图做到这一点的 AI 模型,就像一位过度热情的导游。它们会告诉你一切,包括那些不存在的事物(幻觉),或者反复陈述相同的事实。它们也很慢,生成的文本冗长且混乱,难以被其他计算机读取。
2. 解决方案:“电报”风格(TOON 格式)
作者们意识到,AI 讲述故事的方式至关重要。与其使用像 JSON 那样笨重的格式(就像写一封包含大量多余词汇的信,例如“该物体是……"、“该关系是……"),他们发明了一种 TOON 格式。
- 类比:想象通过电报发送消息,按字付费。你不会写“猫正坐在垫子上”。你会写“猫,坐,垫子”。
- 结果:SceneGraphVLM 采用这种“电报”风格。它去掉了所有多余的废话,使输出更短、生成更快,且更易于计算机理解。它节省了约 15–20% 描述同一场景所需的“空间”。
3. 训练:通过实践学习(并接受纠正)
该模型分两个截然不同的阶段进行训练,就像学生学习新技能一样:
- 阶段 1:监督微调(SFT)——“模仿者”阶段:
AI 被展示数千张图片及其完美的描述。它学习模仿这种风格。它学习规则:“如果我看到一只狗,我必须写出‘狗’及其位置。”
- 阶段 2:强化学习(RL)——“严格教练”阶段:
这是秘诀所在。在第一阶段,AI 为了保险起见,仍可能会编造不存在的事物(幻觉)。在第二阶段,一位“教练”(奖励系统)会观察 AI。
- 规则:如果 AI 编造了一个不存在的关系(例如,说一个人正在“拿着”一朵云),教练就会给予惩罚。
- 目标:AI 学会,与其猜测一切,不如精确地只说出它看到的内容。它在全面性与准确性之间取得了平衡。
4. 视频超能力:无需追踪的“记忆”
在观看视频时,事物会逐帧变化。传统的视频 AI 需要一个复杂的“追踪器”来从一秒到下一秒跟踪一个人,就像保安跟踪嫌疑人一样。
SceneGraphVLM 的做法不同。它将视频视为一场对话。
- 类比:想象你正在向朋友描述一个电影场景。你不需要每一秒都从头开始。你会说:“好吧,那个人还在那里,但现在他正往左走。”
- 工作原理:AI 查看当前帧,并短暂记住它刚刚讲述的关于前一帧的“故事”。它利用这段记忆来保持一致性,而无需笨重的追踪系统。这使得视频描述流畅且快速。
5. 结果:快速且准确
该论文在三个主要数据集(PSG、PVSG 和 Action Genome)上测试了这种方法。
- 速度:它可以在约一秒内生成完整的场景描述。这足以满足近实时应用的需求。
- 质量:与旧方法相比,它在不编造事物方面表现更好。虽然其他模型可能会生成一个包含 20 个连接(其中许多是错误的)的混乱网络,但 SceneGraphVLM 生成的是一个紧密、干净的包含 5–6 个真实连接的网络。
- 效率:即使在使用较小的、更便宜的计算机芯片(使用名为 Qwen3.5-0.8B 的小模型)时,它也能很好地工作,证明如果你使用正确的“电报”格式和训练方法,就不需要庞大的超级计算机也能获得良好的结果。
总结
SceneGraphVLM 是一种轻量级、快速的 AI,可将图像和视频转化为干净、结构化的故事。它使用简写语言来节省时间,通过“严格教练”的学习来停止编造事物,并记住前一时刻以保持视频描述的一致性——所有这些都无需依赖笨重、复杂的追踪系统。
技术摘要:SceneGraphVLM
问题陈述
场景图生成(SGG)旨在将视觉场景表示为紧凑、结构化的图,其中节点表示物体,边编码关系。尽管这对于机器人技术和视频分析等下游任务至关重要,但生成准确、结构有效且紧凑的场景图仍然充满挑战。传统多阶段流水线存在误差传播和脆弱性问题。近期的视觉 - 语言模型(VLM)方法提供了端到端的生成方案,但往往产生冗长、令标记效率低下的输出,其中包含无关物体和幻觉关系。此外,现有的基于 VLM 的方法经常优先考虑召回率,导致生成的图过于完整,从而稀释了有用信息并降低了决策的可靠性。将这些挑战扩展到视频领域,在不依赖复杂跟踪或后处理的情况下保持时间一致性,仍是一个未解决的问题。
方法论
作者提出了SceneGraphVLM,这是一种利用小型视觉 - 语言模型进行图像和视频场景图生成的紧凑端到端方法。该方法论建立在三个核心支柱之上:
1. 标记高效的序列化(TOON 格式)
为了解决标准 JSON 表示法的高解码成本和长度问题,作者将场景图序列化为TOON 格式。该模式将对象存储为共享标题下的行,将关系存储在紧凑的块中,去除了重复的键和嵌套的样板代码。这在各个数据集(PSG、PVSG、Action Genome)上将标注长度减少了约 1.17 倍至 1.24 倍,同时保留了所有物体、边界框和关系信息,从而加速生成并降低延迟。
2. 两阶段训练流程
模型经历了一个两阶段的优化过程:
- 监督微调(SFT): 基础 VLM(具体为 Qwen3.5-0.8B)被训练以将视觉输入映射到目标 TOON 模式。此阶段教会模型遵循所需格式、使用特定数据集的词表,并生成可解析的结构化输出。
- 基于 GRPO 的强化学习(RL): 为了超越标记级监督来优化图级质量,作者采用了组相对策略优化(GRPO)。关键在于,他们引入了幻觉感知奖励,以平衡关系覆盖范围与精确度。总奖励函数(Rtotal)结合了:
- 基础图奖励: 格式有效性、物体分类和物体定位(通过匈牙利匹配和 IoU)。
- 关系平衡奖励: 基于精确率和 F1 的项,以防止模型为了最大化召回率而过量生成关系。
- 幻觉惩罚: 对未匹配(无支持)的物体和关系施加明确的惩罚,抑制无根据实体的生成。
3. 具有时间上下文的视频推理
对于视频序列,SceneGraphVLM 按顺序处理帧。它可以根据前一帧生成的图来条件化当前帧图的生成。这提供了轻量级的短期时间上下文,而无需单独的跟踪模块。作者评估了两种协议:
- GT-prompt(真值提示): 使用真值的前一帧图(Oracle 设置)。
- Generated-prompt(生成提示): 使用模型自身的前一帧预测(实际部署设置),以此测试对误差传播的鲁棒性。
主要贡献
- SceneGraphVLM 架构: 一种利用小型 VLM(如 Qwen3.5-0.8B)和标记高效的 TOON 表示法的紧凑端到端方法,实现了优异的质量 - 速度权衡。
- 幻觉感知训练: 引入了基于 GRPO 的训练,采用面向图的奖励,明确惩罚无支持的物体和关系,平衡召回率与精确度,从而生成有根据且紧凑的图。
- 高效的视频 SGG: 一种轻量级的视频场景图生成方法,利用前一帧图获取时间上下文,无需复杂后处理,实现了近实时推理。
实验结果
该方法在PSG(全景场景图)、PVSG(全景视频场景图)和Action Genome上进行了评估。
- 性能与基线对比: 在 PSG 上,SceneGraphVLM 实现了0.442(严格)和0.460(宽松)的 SGG 分数,优于零样本商业 VLM(例如 Gemini-3-flash 为 0.318)和更大的开源模型。与像 R1-SGG 这样侧重召回率的基线相比,它在面向精确度的指标上显著改进。
- 视频性能: 在 PVSG 上,模型在Generated-prompt设置中表现出鲁棒性。RL 阶段将严格 SGG 分数从仅 SFT 检查点的 0.306 提高了19%(至 0.365),优于所有商业和开源基线。
- 效率: 利用 TOON 格式和 vLLM 加速解码,SceneGraphVLM 在单张 A100 GPU 上生成完整场景图的时间约为图像0.64 秒,视频1.07 秒。
- Action Genome: 该模型实现了38.74的 Precision@50 和30.75的 F1@50,在精确度上大幅优于 OED 基线(P@50=8.02, F1@50=13.37),证明了其避免幻觉关系的能力。
意义与主张
论文声称,SceneGraphVLM 为生成式场景图生成确立了新的质量 - 速度权衡。通过将标记高效的表示与精确度感知的强化学习相结合,该方法使小型 VLM 能够生成可靠、紧凑且视觉有根据的场景图,适用于近实时应用。作者强调,他们的方法通过在训练期间明确惩罚无支持的内容,解决了基于 VLM 的 SGG 的常见失败模式——过度生成和幻觉。仅利用前一帧生成的图而无需外部跟踪即可在视频中保持时间一致性的能力,被强调为迈向机器人技术和视频分析实际部署的重要一步。
作者指出了局限性,包括对封闭词汇数据集的依赖、视频序列中潜在的误差累积,以及实时推理对特定 GPU 资源的需求,但断言该方法为下游任务中基于 VLM 的 SGG 提供了实践基础。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。