← 最新论文
🤖 machine learning

Multimodal Data Curation Through Ranked Retrieval

本文提出了一种包含对称核子采样和专家嵌入引擎的框架,用于优化训练对并融合嵌入专家,从而有效弥合模态鸿沟,提升在异构数据集上的跨模态检索及下游模型性能。

原作者: Pratyush Muthukumar, Harshil Kotamreddy, Sarah Amiraslani, Tomo Kanazawa, Ramani Akkati, Shaan Jain, Andrew Mathau

发布于 2026-05-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Pratyush Muthukumar, Harshil Kotamreddy, Sarah Amiraslani, Tomo Kanazawa, Ramani Akkati, Shaan Jain, Andrew Mathau

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一家庞大而混乱的图书馆的馆长,馆内混杂着书籍、电影、音乐录音和手写笔记。你的目标是建立一个系统,让用户可以提出诸如“给我展示一段狗在公园里玩耍的内容”这样的问题,而系统能立即找到完美的视频、正确的照片、匹配的音频片段或相应的文字描述,无论其格式如何。

该论文指出,当前系统主要面临两大难题:

  1. “格式”陷阱:系统往往根据物品的“类型”(将所有视频归在一起,将所有文本归在一起)而非“含义”进行分组。这就像一位图书管理员把所有书籍放在顶层书架,把所有电影放在底层书架,即使某本书和某部电影讲述的是完全相同的故事。
  2. “噪声标签”问题:附加在这些物品上的描述(标签)往往杂乱无章。一段关于狗的视频,其字幕可能只写着“一只狗”,但视频中还出现了猫、树和汽车。或者,字幕可能提到“阳光明媚的一天”,而视频实际上是在夜间拍摄的。系统试图从这些不匹配的配对中学习,从而陷入困惑。

作者提出了一种两部分解决方案来解决这些问题,他们将其称为对称核子采样(Symmetric Nucleus Subsampling, SNS)专家嵌入引擎(Expert Embedding Engine, EEE)

第一部分:“剪刀与胶水”(对称核子采样)

将训练数据想象成一双不匹配的袜子:一只袜子是原始视频,另一只是文字描述。有时它们匹配得并不好。

  • 问题:视频可能长达 10 分钟,但文字只描述了前 30 秒。或者文字提到了一辆“蓝色汽车”,但视频却是黑白的。
  • 解决方案(SNS):作者使用了一种智能的“剪刀”技术。
    • 前向裁剪:他们审视文字,问道:“这段视频的哪些部分实际上解释了这段文字?”于是,他们剪掉了视频中无关的 9 分钟。
    • 后向裁剪:他们审视视频,问道:“这段文字的哪些部分实际上描述了我们要看到的内容?”于是,如果视频中并没有那辆车,他们就剪掉了关于“蓝色汽车”的句子。
    • 结果:他们留下了一个“核子”——视频的核心高质量部分和文字的核心部分,这两者完美匹配。他们剪除了噪声,让计算机从干净、紧密的配对中学习。

第二部分:“专家团队”(专家嵌入引擎)

即使有了干净的配对,计算机仍然难以理解视频和文字是关于同一件事的。这就像有三个讲不同方言的翻译;他们可能翻译同一个故事,但他们使用的词汇差异如此之大,以至于故事看起来毫不相关。

  • 问题:不同类型的数据(视频、音频、文本)在计算机内存中自然聚集在不同的区域,形成了“模态鸿沟”。
  • 解决方案(EEE):作者没有依赖单一的“翻译”,而是聘请了一个由三位专家组成的团队:
    1. 端到端专家:擅长一次性观察所有内容。
    2. 融合专家:擅长结合不同类型的数据。
    3. 文本专家:擅长先将所有内容转化为文字。
  • 投影器:他们添加了一个特殊的“翻译”(一个投影网络),它倾听所有三位专家的意见。它将它们不同的观点融合成一种单一、统一的语言。关键在于,这个翻译被训练为忽略数据的格式,只关注含义。它迫使计算机认识到,一段关于狗的视频和一句关于狗的句子属于同一个社区,而不是分属不同的村庄。

结果:一个更好的图书馆

作者通过利用他们的方法创建了一个新的“训练混合体”(一个精选的图书馆),并用该混合体训练了一个新的 AI 模型,以此测试了该系统。

  • 对比:他们将他们的方法与以下方法进行了比较:
    • 随机采样:盲目地从书架上挑选书籍。
    • 分层采样:挑选数量相等的书籍、电影和歌曲。
    • 传统策展:使用老式规则过滤掉不良数据。
  • 结果:他们的方法产生了最佳效果。在他们精选的数据上训练的 AI 模型学习速度更快,错误更少(更低的“困惑度”,这类似于一种衡量困惑程度的指标)。
  • 几何修复:最重要的是,他们表明他们的方法将“模态鸿沟”缩小了超过90%。在计算机的脑海中,关于同一事物的视频和文本之间的距离几乎变为零,而在此之前,仅仅因为格式不同,它们之间就相隔数英里。

总结

简而言之,这篇论文指出:“要构建一个针对混合媒体的智能搜索引擎,不要只是把所有东西都扔给计算机。首先,使用剪刀剪除数据中杂乱、不匹配的部分。其次,使用一个专家团队将所有内容翻译成一种单一、统一的语言,这种语言忽略格式,专注于含义。这就创造了一个更干净、更智能的训练集,帮助 AI 更好地理解世界。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →