← 最新论文
🤖 machine learning

20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone

本文证明,仅通过严格的数据整理,无需更改架构或训练方案,即可在多样化的基准测试和能力方面显著提升视觉 - 语言模型的性能,在训练计算量减少高达 150 倍的情况下实现接近前沿的准确率,同时提升可靠性、泛化能力和推理效率。

原作者: Siddharth Joshi, Haoli Yin, Rishabh Adiga, Haakon Mongstad, Alvin Deng, Aldo Carranza, Alex Fang, Amro Abbas, Anshuman Suri, Brett Larsen, Daniel Zayas, Darren Teh, David Schwab, Diego Kiner, Fan Pan
发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Siddharth Joshi, Haoli Yin, Rishabh Adiga, Haakon Mongstad, Alvin Deng, Aldo Carranza, Alex Fang, Amro Abbas, Anshuman Suri, Brett Larsen, Daniel Zayas, Darren Teh, David Schwab, Diego Kiner, Fan Pan, Jack Urbanek, Jason Lee, Jason Telanoff, Josh Wills, Kaleigh Mentzer, Luke Merrick, Maximilian Böther, Parth Doshi, Paul Burstein, Pratyush Maini, Ties Robroek, Tony Jiang, Vidhi Jain, Vineeth Dorna, Zhengping Wang, Bogdan Gaza, Ari Morcos, Matthew Leavitt

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个孩子认识周围的世界。你有两个选择:

  1. “越多越好”的方法:你把一大堆杂乱无章的书籍、杂志和随机照片堆在孩子面前。你告诉他们:“把什么都读一遍,把什么都看一遍,然后自己弄明白。”这需要耗费巨大的时间和能量(计算力)。
  2. “精心策划”的方法:你精心挑选最好的书籍,剔除模糊的照片,修正拼写错误,并将图片整理成逻辑清晰的类别。你交给他们一堆更小、更干净的资料。

这篇题为**《20/20 视觉语言模型》**的论文认为,选项 2 才是秘诀

来自 DatologyAI 的研究人员发现,如果你有一个标准的视觉语言模型(VLM)——一种既能“看”图像又能“读”文本的人工智能——并且提升其学习数据的质量,人工智能就会变得显著更聪明。他们没有改变人工智能的“大脑”规模、架构,也没有延长训练时间。他们只是清理了它学习的“教科书”。

以下是他们研究发现的简要说明,使用了简单的类比:

1. “洁净室”效应(数据策划)

将训练数据想象成一个健身房。

  • 基线(未策划):健身房里满是损坏的设备、泥泞的地板和令人困惑的标识。人工智能试图在那里学习,但它会感到困惑并浪费能量。
  • 策划后的模型:研究人员清扫了地板,修复了设备,并将杠铃整理有序。
  • 结果:尽管人工智能的规模相同,工作时间也相同,但它变得强壮得多。平均而言,他们的策划模型在 20 项不同的测试(如识别物体、阅读图像中的文本或解决数学问题)中,得分比“杂乱健身房”版本高出11.7 分

2. “小而强大”的惊喜

通常,要获得更聪明的人工智能,你需要更大的“大脑”(更多参数)或更多的训练时间(更多计算力)。

  • 论文主张:他们策划的20 亿参数模型(中等规模的“大脑”)以巨大优势击败了一个更大、经过重度训练的竞争对手(InternVL3.5),使用的计算力却少了 17 倍
  • 类比:这就像一名训练有素的高中生,击败了一位拥有超级计算机但没有学习指南的懒惰天才。策划后的模型达到了接近顶尖水平的性能,而其训练能量消耗比那些依赖大规模后训练调整的“前沿”模型少了高达 150 倍

3. 超越课堂的泛化能力(分布外泛化)

人工智能的一个常见问题是,它死记硬背了考题,但当被问及略有不同的问题时却会失败。

  • 论文主张:尽管该人工智能在单张图像上进行了训练,但它却意外地擅长同时观察多张图像(这是一项它在训练期间从未见过的任务)。
  • 类比:想象一个只学习过单张动物照片的学生。当你给他们看一张狗的照片和一张猫的照片并排摆放,并问“哪一只更大?”时,他们仍然能给出正确答案。数据清洗帮助人工智能理解了世界的概念,而不仅仅是死记硬背特定的图片。

4. “可靠的学生”(稳定性)

在训练人工智能时,有时它会走运,有时则会倒霉,这取决于随机的起始点(称为“种子”)。

  • 论文主张:策划后的模型要一致得多。如果你训练它们三次,它们都会得到几乎完全相同的分数。而未策划的模型则表现参差不齐。
  • 类比:未策划的人工智能就像一名学生,今天得 A,明天得 D,全看心情。策划后的人工智能则是一名全优生,无论哪一天,每次表现都完美无缺。

5. 更好的礼仪和更少的废话(现实世界行为)

研究人员不仅查看了测试分数,还向人工智能提出了开放式问题,以观察它在现实世界中的行为。

  • 论文主张:策划后的人工智能:
    • 更诚实:如果它看不见某样东西,它会承认。而未策划的人工智能经常“产生幻觉”(编造事实)。
    • 更具体:它不会说“这是一辆车”,而是说“这是一个蓝色的托马斯小火车蛋糕”。
    • 更简洁:它给出简短、直接的答案,而不是长篇大论的段落。
    • 更少拒绝:它愿意回答其他模型会礼貌拒绝的无害问题。
  • 类比:未策划的人工智能就像一名紧张的导游,编造事实并喋喋不休。策划后的人工智能则是一位自信的专家,告诉你确切需要的信息,不多也不少。

6. “高效的跑者”(推理成本)

最后,该论文考察了人工智能训练完成后使用它的成本。

  • 论文主张:策划后的模型不仅变得更聪明,而且变得更高效。它们生成的答案更短,这意味着在服务器上运行的成本更低。
  • 类比:未策划的人工智能就像一辆每加仑汽油只能跑 5 英里的跑车。策划后的人工智能则像一辆混合动力车,每加仑汽油能跑 15 英里,但驾驶速度同样快。

结论

该论文得出结论,数据策划是我们目前拥有的最强大的工具。你不必非要构建更大的“大脑”或在超级计算机上花费数百万美元。如果你花时间策划数据——去除噪音、修正错误并整理信息——你就能构建出一个比当前最先进的巨头更聪明、更可靠且运行成本更低的视觉语言模型。

简而言之:关键不在于你喂给人工智能多少东西,而在于你喂给它什么

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →