← 最新论文
🤖 AI

TTSD-FAR: Test-Time Self-Distillation with Fisher-Anchored Restoration for Missing-Modality Emotion Recognition in LVLMs

本文提出了 TTSD-FAR,这是一个结合了测试时自蒸馏(Test-Time Self-Distillation)与费舍尔锚定恢复(Fisher-Anchored Restoration)的参数高效框架,旨在使大型视频语言模型能够在情感识别过程中鲁棒地适应缺失或噪声模态,同时通过稳定性监测与漂移校正来防止性能退化。

原作者: Muhammad Haseeb Aslam, Alessandro Koerich, Marco Pedersoli, Ali Etemad, Eric Granger

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Muhammad Haseeb Aslam, Alessandro Koerich, Marco Pedersoli, Ali Etemad, Eric Granger

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能繁忙的世界中,出现了一类新一代系统,它们能够同时观看视频并聆听语音,理解视觉与言语之间复杂的相互作用。这些大型视频-语言模型是在大量的电影、访谈和对话库上训练出来的,通过将面部表情、声音语调和口语内容交织在一起,学习识别微妙的人类情感。为了使这些系统达到预期效果,它们依赖于一个完整的图景:面部、声音和文本必须全部存在。然而,现实世界很少如此配合。在嘈ole的环境中,麦克风可能会失灵;在注重隐私的场景中,音频可能会被静音;或者传感器可能会发生故障,导致系统只能获得故事的一个片段。当关键信息缺失时,这些强大的模型往往会踉跄跌倒,由于无法自行填补空白,它们的理解能力也会随之崩溃。

这正是研究人员致力于解决的具体挑战:如何让这些复杂的表情识别系统在部分输入缺失的情况下仍能正常工作,且无需从头开始重新训练整个庞大的模型。重新训练此类系统成本极高,需要数周的计算能力和专门的硬件,这使得针对每种新情况或数据缺失场景进行更新变得不再可能。研究人员提出了一种巧妙且轻量级的解决方案,允许模型在被使用时进行即时自适应,学习如何补偿缺失的信息,而不是等待未来的更新。

他们方法的核心在于两个相同版本的模型之间的协作。其中一个版本是“教师”,它保持冻结且不变,是在所有模态都存在的完整数据上经过完美训练的。另一个版本是“学生”,它是一个较小的、具有适应性的组件,负责处理实时到达的不完整数据。当系统遇到音频或文本缺失的视频时,学生会尝试推测情感状态。为了更好地完成这项工作,它不断将自己的内部理解与教师对“完整图景”应有的理解进行对比。这一过程被称为“自蒸馏”(self-distillation),它引导学生将其推理过程与教师对齐,从而有效地教会学生如何根据残余的线索来重建缺失的语义信息。

然而,研究人员发现,仅仅让学生无止境地学习会导致问题。如果学生持续更新其参数,它最终会开始遗忘已经学到的知识,或者在追逐数据中的噪声时陷入随机错误的泥潭。为了防止这种情况,他们引入了一个像警觉监控器一样的安全机制。该系统会观察学生学习过程的稳定性。当学生找到了一个稳固的解法且其内部理解趋于稳定时,系统会将学生锁定在原地,冻结其知识以保存已学到的内容。只有当输入的数据发生显著变化,表明环境确实发生了转变、需要重新调整时,系统才会再次解锁学生。这种学习、冻结和重新评估的循环,确保了模型在长期使用过程中的准确性。

团队在涉及人类情感的三个不同数据集上测试了这种方法,模拟了高达一半输入数据缺失的情景。他们将自己的方法与现有的其他方法进行了对比,这些方法试图通过基于置信度进行猜测或搜索相似的历史案例来解决问题。结果显示,那些方法往往表现不佳,当关键信息(如文本转录缺失)不可用时,性能会下降到接近随机水平。相比之下,新方法保持了较高的准确率,其表现接近于拥有完整数据的模型。即使有一半的信息缺失,该系统也能成功实现自适应,证明了它可以在不需要重新训练的情况下恢复丢失的含义。

至关重要的是,这项研究表明,这种自适应带来的计算成本非常低。系统仅更新模型总参数中极小的一部分,使庞大的底层结构保持不动。这使得该方法在追求速度和效率的实际应用场景中具有可行性。研究人员发现,通过仔细监测学习过程的稳定性,他们可以防止模型随时间推移而退化,这是试图进行持续学习的系统常遇到的问题。他们的工作表明,对于大型复杂的人工智能系统而言,要在混乱且不可预测的现实世界中可靠运行,它们需要一种在不丢失核心理解的前提下,从不完整信息中学习的能力——而这种平衡是通过利用稳定的参考点进行引导,并精准掌握何时停止与何时开始学习来实现的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →