Toward Uncertainty Quantification in Modern Art
本文引入了一种新颖的协议以及首个用于量化现代艺术动画中生成不确定性的专用语料库,证明了源盲、多维估计器可以有效地区分不同类型的语义变化并识别忠实渲染,其表现显著优于传统的基于标量的确定性度量。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位导演,正要求一支神奇且隐形的摄影团队,根据一个单一且模糊的指令来拍摄一个场景:“让画作动起来。”在人工智能的世界里,这些“摄影机”就是文本生成视频模型,而这些“画作”则是现代艺术。现代艺术很特别,因为它旨在开放式解读;一个抽象的形状对一个人来说可能是一场风暴,对另一个人来说则可能是一场舞蹈。当你要求 AI 拍摄这幅画时,它不仅仅是制作一部电影,它会制作许多部,这取决于它在开始时选取的那个被称为“种子”的微小的随机数。有时,不同的种子会产生看起来截然不同的电影。
长期以来,试图衡量 AI 有多“困惑”或“不确定”的科学家们一直使用一把简单的尺子:他们只是测量电影之间的距离有多远,并给出一个单一的数字,比如“10 分中的 5 分”。但这就像是在说一群人很“吵”,却没告诉你他们是在齐声呐喊,还是其中一个人在尖叫而其他人都在低语,亦或是他们在用两种不同的语言争论。这篇论文解决的核心问题是:我们能否通过观察一组 AI 生成的视频,来弄清楚它们究竟在哪些方面不同,而不仅仅是它们有多么不同?这很重要,因为如果 AI 正在创作艺术,我们希望知道它是在为我们提供丰富多样的创意,还是仅仅在出错并无法捕捉到原始艺术品的精髓。
研究人员决定不再使用那把单一的“音量”尺子,而是构建了一套精密的侦探工具包,来分析 AI 困惑的“形状”。他们创造了一种新的方法来观察由同一段现代艺术描述所生成的视频组。他们的这种方法不再仅仅说“这些视频是不同的”,而是提出具体的问题:这些视频是紧密聚集在一个小簇中吗?是否有一个奇怪的视频像眼中钉一样显得格格不入(离群值)?是否存在两个截然不同的视频组,就像两种不同的解读在争夺注意力?还是说视频散落在各处,没有任何清晰的模式?
为了测试这一点,他们建立了一个包含 1,000 个视频的海量库。他们提取了 250 段描述现代艺术的提示词,并要求强大的 AI 模型 Wan2.1 使用四个不同的随机种子,为每个提示词生成四段不同的视频。至关重要的是,AI 从未见过原始艺术品,它只看到了文本描述。随后,研究人员在这组视频上运行了他们的新型“侦探工具包”。
结果令人着迷。首先,他们发现这个新工具包可以成功识别出这一组视频的“形状”。它可以近乎完美地(准确率达 98%)分辨出是一组相似的视频,还是带有一个奇怪离群值的视频,而旧的单一数字方法根本无法察觉这种区别。他们还发现,高不确定性并不总是意味着 AI 在失败。有时,AI 会产生许多不同的版本,但这些版本仍然都捕捉到了原始艺术的精神(参考覆盖)。另一些时候,AI 虽然产生了许多版本,但其中没有任何一个真正符合原始艺术的样子(参考缺失)。他们的新协议可以识别出这种差异,而旧的方法则做不到。
然而,这篇论文也给出了重要的“禁区”提示。尽管新工具包在描述不确定性的“形状”方面表现出色,但它并没有在预测 AI 具体会对什么产生分歧(例如,AI 认为这幅画表达的是悲伤还是愤怒)方面表现得更好。旧的、简单的“距离有多远”的数字在预测这类分歧时同样有效。此外,研究人员证实,在不看原始艺术品的情况下观察视频(来源盲测),可以告诉你 AI 是如何解读提示词的,但它无法告诉你 AI 是否忠实地复制了原始艺术。
简而言之,这篇论文证明了我们可以超越简单的数字,去理解 AI 创意选择的“结构”。我们现在可以分辨出 AI 是在提供多样化的有效解读,还是仅仅在原地打转。虽然这并不会神奇地让 AI 更好地预测未来,但它为我们提供了一个更锐利的工具,去理解这些创意机器是如何思考的,从而帮助我们决定何时接受它们的输出,以及何时要求重新制作。研究人员已经分享了他们的代码和包含 1,000 个视频的库,供他人使用这种看待 AI 不确定性的新方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。