← 最新论文
🤖 AI

When Cultures Move: Measuring and Improving Multicultural Text-to-Video Generation

本文介绍了 MAVEN,这是一个通过专门的提示词优化来增强文本生成视频过程中文化忠实度的多智能体框架,并通过一个包含 243 个具有文化根基的提示词和 972 个视频(涵盖中国、美国和罗马尼亚背景)的新基准测试进行了验证。

原作者: Shuowei Li, Yuming Zhao, Parth Bhalerao, Oana Ignat

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Shuowei Li, Yuming Zhao, Parth Bhalerao, Oana Ignat

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在看一部电影,导演对电脑说:“给我展示一个在著名城市跳舞的人。”在人工智能的世界里,这被称为“文本生成视频”(text-to-video)。长期以来,主要目标只是让视频看起来真实——比如那个人确实存在,且光影效果看起来正确。但这里隐藏着一个问题:计算机通常非常不擅长理解“文化”。它们可能知道什么是“舞蹈”,但它们并不知道中国传统扇舞、美国嘻哈舞或罗马尼亚民俗舞蹈之间的区别。它们可能会把它们混淆,或者更糟的是,创造出一个奇怪的、通用的版本,感觉既不像其中任何一种。随着 AI 开始用于制作故事、教育和广告,这一点至关重要,因为我们不希望它在无意中抹杀传统或制造虚假的刻板印象。我们希望它能掌握细节,尤其是当场景涉及来自世界不同地区的人、动作和地点时。

这篇论文通过引入一种新的方式来教导 AI 如何处理“多元文化”场景,从而解决了这个精确的问题。研究人员构建了一个特殊的测试集(基准测试),包含 243 个不同的提示词和 972 个视频,以观察当前的 AI 模型在处理文化混合方面的表现。他们发现,标准的 AI 模型在被要求组合,例如“一个美国人在罗马尼亚城堡里吃中国食物”时会表现挣扎。为了解决这个问题,他们尝试了一个巧妙的技巧,叫做 MAVEN(用于文化叙事的多元智能体增强)。他们没有让一个庞大、通用的 AI 大脑去做所有事情,而是将任务分解为三个较小的、专业化的“智能体”:一个负责人物(外观)的专家,一个负责动作(如何做某事)的专家,以及一个负责地点(地标)的专家。

研究表明,让这三个专家并行(同时)工作,比让一个全才去做一切或让他们一个接一个地工作效果要好得多。当研究人员测试时,这个并行专家团队显著提高了视频的文化准确性,尤其是在地标方面,且没有破坏视频质量或导致角色出现抖动。他们还发现,虽然标准的计算机测试(使用数学方法比较图像)可以判断视频看起来是否“还可以”,但它们往往会错过由更高级的 AI “评委”所能察觉到的微妙、深刻的文化细节。论文得出结论,为了让 AI 视频真正具有尊重感和准确性,我们需要停止将文化视为一个单一、模糊的整体,而应该将其拆解为具体的、由专家驱动的部分。

核心理念:为什么一个大脑是不够的

把目前的 AI 视频生成器想象成一个单一的、非常有才华但过度劳累的厨师。如果你要求这位厨师做一道结合了意大利面、日本寿司和墨西哥卷饼的菜肴,他们可能会试图把它们全部揉捏成一个巨大的、令人困惑的“卷饼-面条-寿司”大卷。它看起来可能像食物,但它尝起来并不像任何一种真正的菜肴。这位厨师知道什么是“食物”,但他们并没有关于如何制作每种食物正宗做法的特定、深层的知识。

本文作者认为,文化是“组合式”的。这意味着一个场景是由不同的部分构成的:人物(他们的样子)、动作(他们在做什么)和地点(他们在哪里)。来自一种文化的人可能会在第三种文化的地点从事第二种文化的动作。论文指出,试图让一个 AI 同时理解这三者太难了。相反,你需要一个团队。

解决方案:MAVEN 团队

研究人员创建了一个名为 MAVEN 的系统。他们没有雇佣一个厨师,而是雇佣了一个由三位专业副厨组成的团队:

  1. 人物智能体: 一个精确了解特定文化背景下人们长什么样(头发、衣服、特征)的专家。
  2. 动作智能体: 一个了解特定文化动作是如何完成的细节专家(如何握乐器、如何跳舞)。
  3. 地点智能体: 一个了解著名地标视觉细节的专家(特定的建筑风格、灯光、环境)。

他们测试了运行这个团队的四种不同方式:

  • 单打独斗的厨师(基础版): 完全没有帮助。只有原始的提示词。
  • 全能经理(单智能体): 一个智能体试图同时修复人物、动作和地点。
  • 流水线(顺序执行): 智能体一个接一个地工作。人物智能体修改提示词,然后交给动作智能体,动作智能体再交给地点智能体。
  • 并行团队(MAP): 三个智能体同时工作,各自负责修复自己的部分,然后由一个“融合智能体”将他们的工作合并为一个完美的提示词。

他们的发现:协作的力量

结果很明确:并行团队(MAP)胜出了。

当他们在 972 个生成的视频(涵盖中国、美国和罗马尼亚文化)上测试这些方法时,并行团队制作出的视频在文化准确性方面最高。

  • 得分: 与不做任何处理相比,并行团队将“文化相关性得分”提高了 4.6%;与单智能体方法相比,提高了 1.6%
  • 重大突破: 最大的进步在于地点。并行团队在处理地标准确性方面比基准模型提高了超过 12%。这很好理解,因为单个智能体可能会被人物或动作分散注意力,而专门的地点智能体会纯粹专注于把城堡或纪念碑做得正确。
  • 跨文化魔力: 当提示词是文化混合时(例如,一个美国人在罗马尼亚城堡里吃中国饺子),该系统表现得更加有效。这些“跨文化”场景通常是 AI 最难处理的部分,但并行团队显著缩小了差距,这表明将问题拆解有助于 AI 处理复杂的混合场景。

有趣的是,研究人员发现,虽然并行团队让视频在文化上变得更好,但它并没有破坏视频质量。视频依然看起来平滑且连贯,这证明了你可以在不让 AI “产生幻觉”或破坏视频的情况下,增加深度的文化细节。

测量问题:计算机 vs. 评委

论文中最有趣的发现之一是关于我们如何衡量成功。

  • 数学测试 (CLIP): 研究人员使用了一段标准的程序(CLIP)来检查视频是否符合文本。这个程序擅长识别宏观事物,但经常会错过细微的文化细节。
  • AI 评委 (VLM): 他们还使用了一个更先进的 AI(Gemini 2.5 Pro)来充当人类般的评委,通过观察视频并进行推理,来判断其是否具有文化正确性。

他们发现,数学测试经常低估了并行团队所带来的改进。而 AI 评委则给并行团队的视频打了更高的分数,因为它能注意到那些微妙的细节,比如一个人握持乐器的特定方式,或是建筑物的精确风格。这表明,我们目前的 AI 测试工具可能过于简单,无法捕捉到文化精炼的真实价值。

这意味着什么(以及并不意味着什么)

论文指出,为了让 AI 视频能够尊重并准确地呈现世界的多样性,我们需要停止将文化视为一个单一、统一的东西。相反,我们应该将其分解为特定的部分(人、动作、地点),并让专门的专家负责精炼每个部分。

然而,作者也谨慎地指出了他们工作的局限性。他们只测试了三种文化(中国、美国、罗马尼亚)和三种类型的动作(饮食、音乐、舞蹈)。他们并不声称这解决了世界上所有文化的问题。他们也承认,他们的 AI 模型有时难以清晰地展示面部(经常显示人物的背影),这使得判断外观的文化细节变得困难。

但其核心信息是充满希望的:通过将 AI 组织成专业人士团队而非单一的全才,我们可以朝着生成不仅看起来真实、而且在文化上感到真实的视频迈出重要的一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →