AVSD-Scenes: A Dataset for Audio-Visual Description of Urban Scenes
本文介绍了 AVSD-Scenes,这是一个包含 12,291 对用于城市环境的视听描述的新型数据集,该数据集是通过结合先进 AI 模型的模态特定输出生成的,其在语义对齐、跨模态检索和场景分类方面的表现优于单模态方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
城市从未静止,也从未沉默。它们是声音与视觉不断变化的织锦,公交车的轰鸣、人群的嘈杂以及公园长椅的视觉掠影,都在同一时刻交织发生。几十年来,科学家们一直试图教会计算机理解这些环境,但它们往往依赖于简单的标签,比如仅仅将一段录音标记为“公园”或“街道”。这些标签虽然有用,却很单薄;它们告诉了我们位置,却遗失了故事。它们无法捕捉叶片的沙沙声、路人外套的颜色,或是声音在建筑间回荡的方式。要真正理解一座城市,计算机需要的不仅仅是一个名称,它需要一段将所见与所听编织在一起的连贯叙述。
这正是印度理工学院马德拉斯分校(IIT Madras)与伦敦国王学院的研究人员通过一个名为 AVSD-Scenes 的新项目所应对的挑战。团队致力于创建一个大规模的城市场景集,每个场景都配有一段丰富的自然语言描述,用以解释音频和视频中发生的具体情况。他们从现有的包含来自十个欧洲城市的 12,291 段同步音视频录像的库开始。然而,原始库仅提供基础的类别标签。研究人员希望填补这些空白,将那些简单的标签转化为详细的段落,用以描述每个场景中发生的特定事件、物体和动作。
为了实现这一目标,他们构建了一个自动化的流水线,其作用如同一个由专业观察员组成的团队。首先,他们利用强大的人工智能模型分别观察声音和视频。一个模型负责倾听音频,识别诸如鸟鸣或交通噪音等特定声音,并写下听到的简短摘要;另一个模型则负责观看视频,捕捉人物、车辆和动作,并写下看到的简短摘要。随后,这两个独立的叙述被输入到第三个更先进的语言模型中。这个最终的模型充当了编辑的角色,将音频笔记和视觉笔记合并成一个统一的故事。它被指示要确保故事逻辑通顺、避免凭空捏造,并确保描述始终基于所提供的声音和图像的实际证据。其结果是一个数据集,其中每个城市场景都伴随着一段读起来如同人类观察般的段落,捕捉到了那一刻完整的语境。
研究人员随后测试了这些计算机生成的描述是否真的有用。他们提出了一系列问题,以观察这些描述能否帮助计算机更好地理解世界。其中一项测试涉及观察计算机是否能利用文本描述从大型库中找到正确的视频或音频片段。结果显示,与仅基于声音或仅基于视觉的描述相比,这种多模态描述在执行该任务时表现显著优异。当计算机使用组合描述时,它能更频繁地找到匹配的音频片段,这表明文本已成功学习并捕捉到了声音的本质。
他们还测试了这些描述是否能帮助计算机识别其正在观察的城市场景类型,例如区分繁忙的地铁站与安静的公共广场。仅使用文本描述时,系统识别正确场景的准确率达到了 94.5%。当研究人员将文本与原始音视频数据结合使用时,准确率略微提升至 95.4%。这比仅使用音频或视频的表现有了明显进步,因为后者在达到同等精确度方面表现得较为吃力。研究结果表明,书面描述捕捉到了原始数据本身可能忽略的关于环境的深层且有意义的细节。
这项研究中最具启发性的部分是一项旨在测试计算机是在仅仅记忆场景名称,还是在真正理解内容。研究人员在创建描述的过程中,从给 AI 的指令中移除了场景标签,迫使它完全依赖音频和视觉内容来生成描述。即使在没有被告知地点名称的情况下,这些描述在区分不同类型的场景方面依然非常有效。这表明 AI 并不是因为被告知了“公园”这个标签而简单重复它,而是真实地在描述草坪、木栅栏以及环境中的特定声音。这些描述捕捉的是场景的现实,而非仅仅是类别。
团队还评估了写作本身的质量。他们使用自动化工具和人类评判员,从流畅度、语法以及文本与音视频匹配程度等方面进行了评分。人类评判员发现,这些描述通常准确且信息丰富,在描述所见内容以及文字流畅度方面得分很高。尽管偶尔会出现可以改进的地方,但整体质量足以胜任复杂的任务。
这项工作代表了机器感知世界方式的一次重大飞跃。通过从简单的标签转向丰富的描述性叙述,研究人员展示了计算机可以学习理解日常生活中声音与视觉之间复杂的相互作用。该数据集现已向公众开放使用,它为构建能够像我们一样真正“看见”和“听见”世界的系统提供了新的基础。它表明,人工智能在城市环境中的未来不在于更好的标签,而在于更好的故事。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。