← 最新论文
💻 computer science

Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections

为了解决视频到音乐生成中的复现性与版权挑战,本文引入了包含公有领域电影的可复现的开源屏幕配乐库第2版(OSSL-v2)数据集,并提出了一种通过利用屏幕语音调制视频交叉注意力来增强音乐生成的对话感知模型。

原作者: Haven Kim, Zachary Novack, Julian McAuley, Hao-Wen Dong

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Haven Kim, Zachary Novack, Julian McAuley, Hao-Wen Dong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在看电影。你看到一位英雄在风暴中奔跑,突然,雷声轰鸣,伴随着戏剧性的管弦乐响起。这段音乐不仅仅是背景噪音;它是将场景紧密结合在一起的情感纽带,在告诉你要如何感受。长期以来,科学家们一直试图教会计算机成为视频的“作曲家”,自动创作出与屏幕上发生的事情相匹配的音乐。这个领域被称为“视频到音乐生成”(video-to-music generation)。但这里有一个巨大的问题:要教会计算机这项技能,你需要成千上万个电影及其完美配乐的范例。大多数研究人员一直使用互联网上的视频链接列表来寻找这些范例。麻烦在于,互联网链接就像沙堡;潮水一涨,视频就会被删除或锁定。这意味着计算机学习的“教科书”不断消失,导致无法判断一个计算机是否真的比另一个更聪明。为了解决这个问题,我们需要一个不会消失的电影库,以及一种不仅能教计算机识别角色长相,还能教它理解角色在说什么的方法。

于是,来自加州大学圣地亚哥分校和密歇根大学的研究人员构建了一个全新的、不可撼动的库——OSSL-v2。把这想象成一个巨大的、自给自足的电影院,没有人可以关闭它。他们没有指向可能失效的互联网链接,而是下载了 1,886 部属于公有领域的电影,并将它们切割成 34,343 个小片段。这总计约 246.4 小时的视频和音乐,都安全地存储在一个地方。因为它是一个自托管的系统,所以不会消失,并且它为每一位研究人员提供了一套公平且完全相同的训练数据。

但该团队不仅仅是建立了一个库;他们意识到计算机缺少了一个关键的线索。在电影中,音乐通常会在角色开始说话的那一刻发生变化。如果有人在喊叫,音乐可能会变小或停止,以让声音被听见。研究人员注意到,在他们的新库中,对话音量的大小与音乐音量的大小之间存在着一种细微但真实的联系。为了利用这一点,他们发明了一个“对话感知型”(dialogue-aware)系统。想象一下,计算机是一位指挥家。以前,指挥家只通过观察演员的面部表情和动作来决定何时加快或减慢管弦乐的速度。现在,这位指挥家戴上了一副新的眼镜,让他们能够实时听到演员的声音。该系统获取对话的声音,并利用它在每一帧中轻微地引导音乐生成,确保音乐能像角色一样呼吸和停顿。

当他们在这一庞大的库上测试这种新方法时,结果令人振奋。他们将这种“对话感知型”模型与现有的最佳系统进行了对比。新方法并不一定是在通用意义上让音乐听起来“更好”(比如让它更复杂或更多样化),但它确实让音乐与视频的契合度更加紧密。具体来说,生成的原声带变得更加忠实于原始电影场景,尤其是在计算机需要处理对话与音乐重叠的棘手时刻时。研究人员发现,即使他们在从未见过的商业电影上测试这些模型,这种改进依然成立,这表明倾听对话有助于 AI 比仅仅观看视频更好地理解场景的节奏。

该论文还仔细排除了几种潜在的“小花招”。他们担心计算机是否只是在“依赖”泄露到对话轨道中的残留音乐(因为分离音频并不完美)。为了检查这一点,他们运行了一个特殊的过滤器,寻找那些对话几乎完全没有音乐噪音的片段。即使使用这些“干净”的片段,对话感知系统依然表现得更好。这表明,这种进步确实源于对语言的理解,而不是由于意外听到了音乐。虽然该系统目前还不能完美替代人类作曲家,但这项研究表明,加入角色的声音是帮助计算机创作出真正与故事紧密相连的音乐的一种强大方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →