Reading Between the Frames: Interpreting Implicit and Non-literal Meaning in Social Media Videos
本文介绍了 DrivelHub+,这是一个包含 1,000 个已标注社交媒体视频的基准测试,旨在评估视频语言模型推断超越表面视觉描述的隐性、非字面及文化语境含义的能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正走在一座巨大且嘈杂的图书馆里,这里的书实际上都是短视频。在这座图书馆里,一段视频可能只是展示一个人在撕纸。一个基础的机器人图书管理员可以轻松地描述这个场景:“一个人正在撕纸。”但人类读者在看到同一段视频时可能会笑出来,因为他们意识到那张纸被撕成的特定图案,实际上是在暗中嘲讽某位著名的历史人物。这种“你所看到的”与“你所表达的”之间的差距,正是被称为**多模态人工智能(Multimodal AI)**这一领域的内核。“多模态”仅仅是指计算机正试图同时理解多种感官——视觉、听觉和文本——而不仅仅是单独阅读文字或观察图片。研究人员提出的核心问题是:这些聪明的计算机能否超越简单的描述者,成为真正的解释者?它们能否听懂笑话、识别讽刺或理解隐藏的文化引用,还是仅仅困于对表象的描述?
这正是名为《读懂帧间隙》(Reading Between the Frames)的一篇新论文所解决的谜题。作者引入了一个新的挑战,叫做 DrivelHub+,它就像是一场针对视频人工智能的高风险测试。他们从 TikTok 和 Instagram 等社交媒体平台上收集了 1,000 段真实的短视频。这些并非随机片段,而是“胡言乱语学”(drivelological)视频。把“胡言乱语”(drivel)想象成一种看似荒诞、实则蕴含着秘密且巧妙含义的无意义内容。一段视频乍看之下可能显得滑稽或令人困惑,但它实际上是一个具有层次感的笑话、一段讽刺,或者是一个依赖于视觉线索、节奏和文化知识来构建意义的尖锐社会评论。
研究人员设计了一个分为两部分的比赛,以测试目前的 AI 模型是否能通过测试。首先,他们要求 AI 用平实的英语解释视频。计算机能否说出:“噢,这不仅仅是一个人在撕纸;这是关于古代刑罚的一个黑色幽默”?其次,他们玩了一个检索游戏。他们给 AI 一段视频,并要求它从一系列选项中找到正确的隐藏含义,或者反之亦然。他们想看看 AI 的内部“大脑”是否真的理解了那个荒诞视频与其深层含义之间的联系,还是仅仅基于表面的相似性在进行猜测。
结果却让人清醒。论文发现,虽然当今最先进的视频 AI 模型在描述屏幕上发生的事情方面做得越来越好,但在处理“为什么”这个问题时仍然表现得很吃力。它们经常错过笑点。例如,当看到一段艺术家将画布从纵向改为横向,以此来开一个关于模特太宽的玩笑时,顶尖的 AI 可能会正确描述艺术家的愤怒,却完全忽略了关于画布形状的视觉双关语。这项研究表明,这些模型擅长识别物体和动作,但在“读懂帧间隙”以理解隐含的、非字面意义方面仍然非常糟糕。即使是那些在回答前会进行“思考”的模型,有时也无法将特定的视觉线索与文化笑话联系起来。
简而言之,这篇论文认为,我们距离拥有真正“理解”社交媒体幽默和讽刺能力的 AI 还很遥远。这些模型可以告诉你展示了什么,但它们经常无法推断出意味着什么。作者总结道,弥合这一差距不仅需要更好的视觉能力,更需要对不同线索(如语调、视频中的特定剪辑或文化引用)如何共同创造出未明示的意义有更深刻的理解。在那之前,AI 或许能描述出这个笑话,但它大概不会是那个发笑的人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。