← 最新论文
💻 computer science

FineVision: Open Data Is All You Need

FineVision 推出了一个包含 2400 万个精心筛选的视觉 - 语言样本的最大规模开放语料库,该语料库通过一个严格的半自动化流程构建,该流程在人工监督下整合了超过 200 个来源以消除污染和重复,最终使得基于该数据集训练的模型性能显著超越现有的开源替代方案。

原作者: Luis Wiedmann, Orr Zohar, Amir Mahla, Xiaohan Wang, Rui Li, Thibaud Frere, Leandro von Werra, Aritra Roy Gosthipaty, Andrés Marafioti

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Luis Wiedmann, Orr Zohar, Amir Mahla, Xiaohan Wang, Rui Li, Thibaud Frere, Leandro von Werra, Aritra Roy Gosthipaty, Andrés Marafioti

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何像人类一样看见并理解世界。为此,你需要向它展示数百万张图片,并教会它如何描述这些图片。这正是“视觉 - 语言模型”(VLMs)所做的事情。

然而,直到目前为止,公众可用的“教科书”(数据集)杂乱无章。它们就像一座图书馆,其中一些书用不同语言写成,有些书页被撕掉,有些存在拼写错误,甚至还有一些是机器人日后将被考核的试题副本。这使得开源机器人难以达到由大型科技公司构建的昂贵、保密机器人那样的学习水平。

FineVision 是由 Hugging Face、慕尼黑工业大学和斯坦福大学的研究人员共同创建的一个全新、庞大且经过精心清理的图书馆。以下是他们如何构建它以及它为何重要的简明解释:

1. 大清理(数据策展)

研究人员收集了来自200 多个不同来源的数据——从学术论文到云存储文件夹。但仅仅将它们堆砌在一起是行不通的。

  • 翻译器:他们构建了一个“半自动化”系统(利用 AI 助手),将所有这些不同格式转换为一种标准语言。想象一下,将 200 种不同类型的食谱(有些用法语写,有些用日语写,有些写在餐巾纸上)全部转换成单一、易于遵循的食谱书格式。
  • 人类编辑:AI 并非完美无缺。因此,人类审查员充当了编辑角色。他们检查 AI 的工作,修正错误,并确保这些“食谱”安全且准确。如果 AI 在转换过程中出错,人类会进行修正,并让 AI 重新尝试。
  • 去重:他们使用了一种特殊的“复制检测器”来查找并移除重复的图片。如果图书馆中同一张猫的图片出现了 50 次,他们只保留一张(或将其合并为一次更丰富的对话),以免机器人只是反复死记硬背同一只猫。
  • 防作弊安全区:他们用 66 种用于考核这些机器人的标准测试来检查图书馆。如果在图书馆中发现与未来测试中完全相同的图片,他们就会将其移除。这确保了机器人实际上是在学习,而不是通过死记硬背答案来作弊。

2. 图书馆里有什么?

最终成果是 FineVision,这是一个包含 2400 万个样本(约 1700 万张图片)的集合。它不仅仅是一堆图片,而是被组织成了对话形式。

  • 多样性:它涵盖了从简单的“这是什么?”问题到复杂任务,如阅读图表、解决数学问题或理解文档。
  • “操作”部分:图书馆的一个特殊部分教导机器人如何使用计算机界面(如点击鼠标或在手机屏幕上打字)。他们对此进行了标准化,使机器人能够学习一种通用的“操作语言”,适用于桌面、手机和浏览器。
  • 质量控制:图书馆中的每一段对话都由 AI 裁判(并经过人工复核)根据以下四个方面进行评分:
    1. 格式:文本是否整洁且可读?
    2. 相关性:答案是否真的与问题匹配?
    3. 视觉依赖性:答案是否需要查看图片才能正确?
    4. 对应性:图片是否确实展示了问题所询问的内容?

3. 结果:它有效吗?

研究人员利用这个新图书馆训练了一个小型机器人模型,并将其与在其他流行但杂乱无章的图书馆上训练的模型进行了比较。

  • 记分牌:在 FineVision 上训练的机器人在 11 项不同的测试中得分显著更高。它以前所未有的优势击败了之前最好的开源图书馆(根据竞争对手的不同,性能提升约 11% 至 38%)。
  • “作弊”测试:当他们从训练数据中移除少数剩余的“作弊”图片(可能从测试中泄露的数据)时,FineVision 机器人的性能几乎没有下降。相比之下,其他机器人的性能则显著下降。这证明 FineVision 教会了机器人去理解,而不仅仅是死记硬背。
  • GUI 魔法:在 FineVision 上训练的机器人在导航计算机屏幕(点击按钮、输入文字)方面也远优于其他小型模型,其表现与体积大四倍的模型相当。

核心结论

该论文声称,干净、多样且组织良好的数据是秘诀。你并不一定需要更大的模型或秘密数据集;你只需要一个更好的图书馆。FineVision 证明,通过清理数据并仔细组织它,开源模型最终可以赶上那些大型闭源模型。

研究人员已发布了该图书馆以及他们用于清理它的工具,希望帮助整个社区构建更智能、更可靠的 AI 视觉系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →