ITGPT: A Transformer Based Architecture for the Generation of Dance Dance Revolution and In the Groove Charts
该论文介绍了 ITGPT,这是一种基于 Transformer 的架构,旨在实现 Dance Dance Revolution 和 In the Groove 谱面生成的自动化,与以往的方法相比,在准确性和计算效率方面均取得了显著提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位正在为一款视频游戏混音的 DJ,这款游戏玩家需要在带有四个发光箭头的巨大地板上跳舞。这款游戏——《劲舞团》(Dance Dance Revolution)或其亲戚《In the Groove》——不仅仅是播放音乐,它还需要一个“谱面”(chart)。这个谱面就像是一个音乐路线图,告诉玩家何时踩下上、下、左、右箭头以匹配节奏。手动制作这些谱面就像是在一边写复杂的诗,一边玩杂耍;这需要耗费数小时,需要极深的节奏感,而且极其枯燥乏味。这正是计算机科学介入的地方,特别是机器学习领域,即我们教计算机从数据中学习模式。近年来,一种被称为“Transformer”的 AI 类型因其擅长理解句子的宏观结构而在编写故事和翻译语言方面声名大噪。但是,计算机能学会编排舞蹈吗?这正是这篇论文要解决的大问题:我们能否构建一个 AI,让它听一首歌,然后瞬间发明一段有趣、可玩性高的舞蹈流程,且感觉像是出自人类专家之手?
由此诞生了 ITGPT,一种专门为解决这个舞池谜题而设计的全新 AI 架构。由 Miguel O'Malley 领导的研究人员提出,过去教计算机做这件事的方法——使用简单的模式检测器和记忆循环——就像是试图用一张只显示你当前所站街道的地图来导航城市。这种方法在走几步时有效,但你会很快在宏观全局中迷失方向。相反,ITGPT 使用了 Transformer 架构,这就像是给了计算机一个俯瞰整首歌的鸟瞰视角。这使得 AI 不仅能理解下一个节拍,还能理解整首歌是如何流动的、它的速度如何(以 BPM,即每分钟节拍数衡量),以及舞蹈应该有多难。
该论文介绍了一个用于生成这些谱面的两部分系统。首先,**步点放置(Step Placement)*模型充当指挥家,倾听音乐并决定箭头应该在何时*出现。它观察音频并询问:“这是一个沉重的鼓点吗?这是一个安静的旋律吗?”并据此放置一个步点。第二部分,**步点选择(Step Selection)**模型充当编舞师,决定玩家应该踩哪个箭头(上、下、左或右)。它观察已经放置的步点以及周围的音乐,以挑选出最佳动作,确保舞蹈感觉自然而非随机。
研究结果非常令人振奋。作者发现 ITGPT 在创建准确谱面方面明显优于以往的方法。事实上,与它的前身 DDC 和 DDCL 相比,它提高了步点放置和选择的准确性。最令人兴奋的发现之一是速度。由于旧模型必须以缓慢的、逐步循环的方式处理音乐和舞蹈动作,因此生成谱面需要很长时间,而 ITGPT 则极其迅速。论文指出,ITGPT 生成一个谱面大约只需 0.06 秒,这大约是之前最佳模型 (DDCL) 的 7 倍,也几乎是另一个基于 Transformer 的模型 GOCT 的 50 倍。这种速度提升是因为 ITGPT 在开始时就处理了整个音频文件,而不是为每一个步点都重新聆听一遍。
然而,论文谨慎地表示并未声称完美。研究人员承认,虽然 ITGPT 是一个巨大的飞跃,但在处理“长音”(即玩家需要将脚保持在某个箭头上的步点)时仍略显吃力,在这一任务上,旧模型 DDCL 的表现实际上稍好一些。他们认为这可能是因为旧模型更擅长捕捉音乐中长时持续的声音。作者还指出,尽管他们的训练数据已扩大到包含 253 首歌曲和 952 个谱面,但与用于语言模型的庞大数据集相比,规模仍然相对较小。他们怀疑,如果给 AI 喂入更多的舞蹈数据,会让它变得更加聪明,但就目前而言,ITGPT 已是一个强大、快速且高度准确的自动化舞蹈游戏创作工具。
简而言之,这篇论文表明,通过转向基于 Transformer 的方法并赋予 AI 对音乐的“全局视野”,我们可以生成不仅更准确,而且能在眨眼之间完成的舞蹈谱面。这是迈向未来的一步:届时任何人都可以上传一首歌,并立即获得定制的舞蹈游戏,将枯燥的谱面制作工作转变为一种无缝的、自动化的体验。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。