← 最新论文
🤖 machine learning

Audio-Visual Continual Test-Time Adaptation without Forgetting

本文提出了 AVReCAP,一种用于音视频持续测试时自适应的新颖方法,该方法通过仅利用测试数据从缓冲区中动态检索并自适应最优模态融合层参数,从而在无法获取源数据的情况下,显著提升了在非平稳领域上的性能,并缓解了灾难性遗忘问题。

原作者: Sarthak Kumar Maharana, Akshay Mehra, Bhavya Ramakrishna, Yunhui Guo, Guan-Ming Su

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Sarthak Kumar Maharana, Akshay Mehra, Bhavya Ramakrishna, Yunhui Guo, Guan-Ming Su

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明的机器人助手,它能看见也能听见这个世界,被设计用来识别从狗吠到警笛的一切事物。你在一个安静、阳光明媚的工作室里训练了它,它表现得完美无缺。但现实世界是混乱的。突然间,你的机器人被部署到了雨中的街道,然后是雾气缭้ม的山峦,接着是一个拥挤的音乐会。光照发生了变化,声音发生了扭曲,机器人开始变得困惑。这就是“分布偏移”(distribution shift)的问题:世界在变,但机器人的大脑却停留在过去。

为了解决这个问题,科学家们使用了一种叫做“测试时自适应”(Test-Time Adaptation, TTA)的技术。把这想象成在机器人工作时给它进行一次快速的大脑升级。与其停下来重新训练整个系统,不如让机器人实时微调自己的设置,以应对新的降雨或噪音。但问题在于,如果机器人过度微调自己,它可能会忘记以前掌握的基础知识。这被称为“灾难性遗忘”(catastrophic forgetting)。这就像一个学生为了准备一场新的数学考试而学习得太刻苦,以至于连基础的加法都忘了。对于音视频(audio-visual)机器人来说,巨大的挑战在于它们必须同时从两种感官(视觉和听觉)中学习,而当这两种感官同时受到干扰时,机器人会变得非常迷失。

这篇论文介绍了一种名为 AVReCAP 的新方法,旨在帮助这些机器人在不遗忘的情况下进行自适应。研究人员发现了一个聪明的技巧:机器人不应该试图记住遇到的每一种新情况,而应该只微调大脑中一个非常特定的部分——即结合视觉和听觉的“融合层”(fusion layer)。他们发现,一旦这个层学会了处理一种类型的混乱(比如雪天),它实际上就能很好地处理其他类似的混乱(比如雾天),而无需从头开始重新训练。

因此,AVReCAP 的工作方式就像一位聪明的图书管理员。当机器人遇到新环境时,它会为那个时刻表现最好的大脑设置拍一张快速的“快照”,并将其存储在一个特殊的记忆缓冲区中。当机器人面临新挑战时,它不再只是盲目猜测;它会检查自己的图书馆。如果新的情况在统计学上与过去的情况相似(比如“下雨”看起来像“有雾”),它就会提取出旧的、经过验证的设置并将其作为起点。如果情况完全陌生,它会进行少量的学习并保存一个新的快照。通过这种方式,机器人可以即时适应新环境,而不会覆盖旧知识,也不会因冲突的指令而感到困惑。

研究人员在一些人工对数据进行损坏(如加入雪、风、静电噪声和人群嘈杂声)的数据集上对该方法进行了测试。他们发现,AVReCAP 的表现显著优于现有方法。虽然其他方法在尝试适应一系列连续的新环境时,其准确率往往会大幅下降(有时甚至远低于原始机器人的性能),但 AVReCAP 依然保持稳健。事实上,在一次包含 15 种不同类型音视频干扰的困难测试中,新方法相比原始性能仅损失了约 2.9%,而其他方法则损失了近 28%。这表明,通过从记忆库中选择性地检索正确的“大脑设置”,而不是不断重写它们,我们可以让我们的音视频机器人保持聪明、具备适应力,并随时应对现实世界抛给它们的任何挑战。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →