← 最新论文
💬 NLP

READ: Recurrent Adapter with Partial Video-Language Alignment for Parameter-Efficient Transfer Learning in Low-Resource Video-Language Modeling

本文介绍了 READ,这是一个参数高效的迁移学习框架,它结合了一种用于时序建模的新型循环适配器与部分视频 - 语言对齐目标,从而在低资源视频 - 语言任务上显著超越现有的微调策略。

原作者: Thong Nguyen, Xiaobao Wu, Xinshuai Dong, Khoi Le, Zhiyuan Hu, Cong-Duy Nguyen, See-Kiong Ng, Luu Anh Tuan

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Thong Nguyen, Xiaobao Wu, Xinshuai Dong, Khoi Le, Zhiyuan Hu, Cong-Duy Nguyen, See-Kiong Ng, Luu Anh Tuan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你拥有一个巨大且极其聪明的图书库(即预训练 AI 模型),它几乎知晓世间万物。然而,这个图书库规模如此庞大,以至于占据了整个仓库;而且,每当你想教它一项新的特定技能——例如总结烹饪视频或找出视频中求婚发生的精确时刻——你通常不得不重写整个图书库。这既昂贵又缓慢,且需要大量的存储空间。

本文介绍了一种巧妙且轻量级的解决方案,称为READ(循环适配器),并结合了一种名为PVLA的新型工作检查方法。以下是其工作原理的简化概念分解:

1. 问题:“沉重”的图书库

当前的方法试图通过重新训练整个庞大的图书库来教会 AI 新技能。

  • 问题所在: 如果你只有少量数据(即“低资源”场景),试图重写整个图书库往往会让 AI 感到困惑或不稳定。此外,你最终需要为每一个新技能单独建立一个庞大的仓库。

2. 解决方案:“便利贴”系统(适配器)

作者建议不要重写整个图书库,而是在现有的书籍上添加微小的“便利贴”(称为适配器)。

  • 工作原理: 你冻结原始图书库(使其保持完美),仅训练这些微小的便利贴。这节省了巨大的空间和资金。
  • 旧便利贴的缺陷: 之前的“便利贴”过于简单。它们将视频帧和单词视为孤立的项目,就像只看一张女孩的照片和一个单词“求婚”,却不理解连接它们的故事。它们忽略了时间线。

3. 创新:“穿越时间”的便利贴(READ)

作者创造了一种新型便利贴,称为READ(循环适配器)。

  • 类比: 想象普通的便利贴是一张快照,而READ便利贴则像一本翻页动画书
  • 它的作用: 它不仅查看单帧或单个单词,而是查看序列。它理解女孩在求婚之后的表情与之前的表情是不同的。它捕捉了时间的流动,使 AI 能够在无需重新训练整个图书库的情况下理解故事的时间线。

4. 质量检查:“部分匹配”游戏(PVLA)

在用有限数据训练 AI 时,存在“便利贴”被噪声或不相关信息搞混的风险。

  • 问题: 视频可能展示整个场景(厨房、自行车、一个人),但文本可能只谈论其中一个特定部分(拧紧螺栓)。旧方法试图强制每个单词与每个视频帧进行完美的 1 对 1 匹配,这既不可能又令人困惑。
  • 解决方案(PVLA): 作者引入了部分视频 - 语言对齐(PVLA)
  • 类比: 把它想象成数据的约会应用。算法不是说“强迫人群中的每个人都找到完美匹配”,而是说“让我们只为那些真正互相关心的人找到最佳匹配”。
  • 工作原理: 它利用一种名为“部分最优传输”的数学技巧,仅将视频中重要的部分与文本中相关的部分进行对齐。它忽略噪声,专注于关键连接,确保即使在学习数据很少的情况下,“便利贴”也能学到正确的内容。

5. 结果:小体积,大胜利

作者在两项主要任务上测试了该系统:

  1. 寻找时刻(时间语言定位): 就像在视频中找出“女孩在求婚之后微笑”的确切秒数。
  2. 总结故事(视频 - 语言摘要): 就像观看视频并写出事件发生的简短摘要。

结果:

  • 效率: 与整个图书库相比,他们的方法仅需训练约**1.2%**的参数(即“便利贴”)。
  • 性能: 尽管训练量如此之小,他们的方法表现实际上优于那些庞大的、完全重新训练的图书库以及其他现有的“轻量级”方法。
  • 通用性: 它在不同类型的视频模型和数据集上都能很好地工作。

总结

本文提出了一种在不耗尽资金或存储空间的情况下,教会巨型 AI 模型新视频技能的方法。他们通过添加微小的、感知时间的“便利贴”(READ)来实现这一点,这些便利贴理解故事的流动,并使用一种智能的“匹配游戏”(PVLA),该游戏仅关注所见与所闻之间的重要连接。其结果是一个运行成本低廉、易于存储且精度惊人的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →