MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation
本文介绍了 MultiRef-Compass,这是一个由 350 个精选样本和包含 14 个子指标的四维评估协议组成的统一基准,旨在全面评估新兴的多参考音频-视频生成系统在将多个参考内容进行保留、绑定并组合成连贯同步内容方面的能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一位试图拍摄电影场景的导演。在 AI 视频的旧时代,你只能给计算机一个简单的剧本:“制作一段猫的视频。”AI 会自行猜测那只猫长什么样、在哪里以及发出什么声音。但现在,创作者想要更多的控制权。他们想说:“用这张我爱犬的特定照片作为脸部,用另一张照片作为他的侧面轮廓,再用第三张照片作为他最喜欢的玩具,同时让他对着特定的声音吠叫。”这就是**多参考音频视频生成(Multi-Reference-to-Audio-Video, MR2AV)**的世界。这就像是要求一个 AI 成为一名顶级大厨,他不仅要烹饪出一道菜,还必须使用来自三个不同罐子的特定食材,按照图片中的样子精确地摆放盘中,并确保滋滋作响的声音与烹饪动作完美匹配。问题在于,我们之前没有一种好的方法来评估 AI 在这种复杂的舞蹈中表现得如何。我们曾有针对简单食谱的测试,但对于这种多食材、多感官的挑战,却没有任何测试手段。
于是,MultiRef-Compass 应运而生——这是一个由研究人员设计的全新“成绩单”,旨在测试这项特定的技能。你可以把它看作是对 AI 视频制作者进行的一次严格的“味觉测试”。团队构建了一个包含 350 个精心设计的场景的特殊数据集——就像一场烹饪节目挑战赛,每个参赛者都会得到完全相同的三张照片(一个人、一只鞋和一个食客),再加上一段剧本,例如:“那个人试穿鞋子并询问是否合脚。”然后,他们要求八个不同的 AI 模型(包括 Kling、Seedance 和 Gemini 等知名模型)生成视频。
研究人员并不仅仅观察视频看起来是否“好看”。他们将评分细化为四个特定的类别,就像一份详细的评分标准:
- 基础质量: 视频看起来是否清晰,声音是否好听,还是模糊且带有杂音?
- 参考一致性: AI 是否真的使用了你提供的照片?它是否保持了同一个人的长相,还是不小心把它换成了陌生人?它是把鞋子正确地穿在了脚上,还是只是在屏幕上贴了一张鞋子的贴纸?
- 视听一致性: 当视频中的人说话时,他们的嘴唇是否在运动?当人踩在地上时,是否能听到脚步声?
- 指令遵循: AI 是否完全按照剧本的要求去做,还是忽略了关于鞋子的部分,只展示了人在走路?
为了进行评分,他们结合使用了计算机工具和一个“超级智能 AI 评委”(即大型多模态模型),这个评委扮演着电影评论家的角色。他们甚至增加了一个特殊的“重审”步骤,以确保 AI 评论家不会过于严苛或过于宽松,从而保证评分的公平性。
结果是一次现实的检验。虽然有些模型在制作精美画面方面做得越来越好,但在处理难题方面仍然显得力不从心。论文指出,目前的模型经常在“绑定(binding)”方面失败——它们可能识别出了照片中的脸,却忘了把它连接到身体上,或者它们可能会搞混谁才是正在说话的那个人。其中一个模型 Seedance 2.0 在综合表现上排名第一,因为它最为均衡,在四个类别中都表现出色。然而,即使是最好的模型也显示出“巨大的进步空间”。他们发现,当你要求一个 AI 同时处理多个参考对象和复杂指令时,它往往会掉链子,生成的视频中角色看起来像剪纸贴图,声音与说话者不匹配,或者故事逻辑变得混乱。
简而言之,MultiRef-Compass 向我们展示了,尽管 AI 视频已经令人印象深刻,但它尚未准备好成为复杂、多参考叙事的可靠导演。它是一个需要更多训练的工具,以便学会如何将多个线索编织成一个单一、连贯且自然的场景。该基准测试现在已向所有人开放,作为帮助未来 AI 模型学习如何更好地完成这种特定且棘手的创意工作的基石。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。