想象一下,你正在教一个机器人如何像人类一样看见并理解世界。为此,你需要向它展示数百万张图片,并教会它如何描述这些图片。这正是“视觉 - 语言模型”(VLMs)所做的事情。
然而,直到目前为止,公众可用的“教科书”(数据集)杂乱无章。它们就像一座图书馆,其中一些书用不同语言写成,有些书页被撕掉,有些存在拼写错误,甚至还有一些是机器人日后将被考核的试题副本。这使得开源机器人难以达到由大型科技公司构建的昂贵、保密机器人那样的学习水平。
FineVision 是由 Hugging Face、慕尼黑工业大学和斯坦福大学的研究人员共同创建的一个全新、庞大且经过精心清理的图书馆。以下是他们如何构建它以及它为何重要的简明解释:
1. 大清理(数据策展)
研究人员收集了来自200 多个不同来源的数据——从学术论文到云存储文件夹。但仅仅将它们堆砌在一起是行不通的。
- 翻译器:他们构建了一个“半自动化”系统(利用 AI 助手),将所有这些不同格式转换为一种标准语言。想象一下,将 200 种不同类型的食谱(有些用法语写,有些用日语写,有些写在餐巾纸上)全部转换成单一、易于遵循的食谱书格式。
- 人类编辑:AI 并非完美无缺。因此,人类审查员充当了编辑角色。他们检查 AI 的工作,修正错误,并确保这些“食谱”安全且准确。如果 AI 在转换过程中出错,人类会进行修正,并让 AI 重新尝试。
- 去重:他们使用了一种特殊的“复制检测器”来查找并移除重复的图片。如果图书馆中同一张猫的图片出现了 50 次,他们只保留一张(或将其合并为一次更丰富的对话),以免机器人只是反复死记硬背同一只猫。
- 防作弊安全区:他们用 66 种用于考核这些机器人的标准测试来检查图书馆。如果在图书馆中发现与未来测试中完全相同的图片,他们就会将其移除。这确保了机器人实际上是在学习,而不是通过死记硬背答案来作弊。
2. 图书馆里有什么?
最终成果是 FineVision,这是一个包含 2400 万个样本(约 1700 万张图片)的集合。它不仅仅是一堆图片,而是被组织成了对话形式。
- 多样性:它涵盖了从简单的“这是什么?”问题到复杂任务,如阅读图表、解决数学问题或理解文档。
- “操作”部分:图书馆的一个特殊部分教导机器人如何使用计算机界面(如点击鼠标或在手机屏幕上打字)。他们对此进行了标准化,使机器人能够学习一种通用的“操作语言”,适用于桌面、手机和浏览器。
- 质量控制:图书馆中的每一段对话都由 AI 裁判(并经过人工复核)根据以下四个方面进行评分:
- 格式:文本是否整洁且可读?
- 相关性:答案是否真的与问题匹配?
- 视觉依赖性:答案是否需要查看图片才能正确?
- 对应性:图片是否确实展示了问题所询问的内容?
3. 结果:它有效吗?
研究人员利用这个新图书馆训练了一个小型机器人模型,并将其与在其他流行但杂乱无章的图书馆上训练的模型进行了比较。
- 记分牌:在 FineVision 上训练的机器人在 11 项不同的测试中得分显著更高。它以前所未有的优势击败了之前最好的开源图书馆(根据竞争对手的不同,性能提升约 11% 至 38%)。
- “作弊”测试:当他们从训练数据中移除少数剩余的“作弊”图片(可能从测试中泄露的数据)时,FineVision 机器人的性能几乎没有下降。相比之下,其他机器人的性能则显著下降。这证明 FineVision 教会了机器人去理解,而不仅仅是死记硬背。
- GUI 魔法:在 FineVision 上训练的机器人在导航计算机屏幕(点击按钮、输入文字)方面也远优于其他小型模型,其表现与体积大四倍的模型相当。
核心结论
该论文声称,干净、多样且组织良好的数据是秘诀。你并不一定需要更大的模型或秘密数据集;你只需要一个更好的图书馆。FineVision 证明,通过清理数据并仔细组织它,开源模型最终可以赶上那些大型闭源模型。
研究人员已发布了该图书馆以及他们用于清理它的工具,希望帮助整个社区构建更智能、更可靠的 AI 视觉系统。
技术摘要:FineVision:开放数据即一切所需
问题陈述
视觉 - 语言模型(VLM)的进步目前受到公共数据集碎片化格局的阻碍。虽然专有模型利用大规模、经过精心策划的语料库,但开源替代方案被迫将众多小型、专业化的数据集拼凑在一起。这种方法导致标注模式、格式和数据质量存在不一致性。此外,现有开放数据集常受污染问题困扰,即训练数据与评估基准重叠,人为地虚高性能指标,阻碍了以数据为中心的稳健研究。该领域已从简单的聚合转向对原则性、可扩展策划的需求,以解决多样性、数据卫生以及代理 GUI 交互等新兴任务。
方法论
作者介绍了FineVision,这是一个源自 200 多个公共来源、精心策划的包含 2400 万样本的语料库。策划过程采用了一种半自动化、人机回环(human-in-the-loop)的流水线,旨在将异构数据统一为标准的对话模式。
1. 数据策划流水线
- 来源聚合:数据收集自 Hugging Face、机构云存储、GitHub 仓库以及直接网络下载。
- 半自动化转换:采用混合方法,结合大型语言模型(LLM)代理(具体为 Claude)进行批量摄入和策略设计,辅以人工审核。该流水线将转换过程分解为标注分析、策略设计、脚本实现和质量验证。
- 人机回环监督:审核人员审计映射关系,抽查输出以确保忠实于标注的消耗,并验证格式和多样性。对于代理/GUI 数据,审核人员验证统一的操作模式,并检查轨迹的可执行保真度。
- 统一模式:所有数据集均转换为标准聊天格式(
sample = {images, texts, source, metadata})。非对话数据(例如分类)被转换为自然问答对。单轮问答数据集通常被组合成多轮对话,以创造更丰富的训练信号。
2. 特定任务策略
该流水线应用六种核心转换策略以保留语义丰富性:
- 视觉问答:将每张图片的问题分组为具有多样化措辞的多轮对话。
- 描述与说明:用随机化的指令提示包裹真实标注(ground-truth)的说明文本。
- 定位与空间关系:将空间标注转换为带有解释性答案的是/否问题;坐标被归一化为元数据。
- 文档理解:将多页文档作为图像列表处理,并附带丰富的答案(推导步骤、事实)。
- OCR 与转录:生成精确的转录回合,同时附带可选的理解回合。
- 分类与检测:将标签转换为带有解释性答案的决策问题。
- GUI/代理统一:一个特定的流水线将 GUI 数据集中异构的函数签名和操作分类法归一化为统一的、带类型的操作空间,其中坐标与分辨率无关。
3. 数据卫生与去污染
- 清洗:自动化验证移除了损坏的图像、无法解码的文件和格式错误的文本。文本被归一化为 UTF-8,控制字符被剥离,回合长度被限制在 8192 个 token 以内。
- 去重:使用自监督复制检测(SSCD)嵌入和余弦相似度来识别并合并来源内部及跨来源的近似重复图像。
- 测试集去污染:该流水线识别出与 66 个公共 VLM 基准测试中相似的训练图像。应用了一个保守阈值(τ=0.95)来标记潜在的污染,尽管数据集以原始形式发布,但提供了污染统计数据。
主要贡献
- FineVision 语料库:发布了同类中最大的开放资源,包含 1700 万张图像、8900 万个回合以及分布在 185 个子集中的 95 亿个答案 token。
- 策划工作流:一个可复现的、半自动化的、人机回环的流水线,在统一 200 多个来源的同时,保持了任务结构和对话多样性。
- 统一操作空间:针对代理任务的一项新颖贡献,为桌面、移动和浏览器环境中的 GUI 交互提供了标准化的模式。
- 严格的卫生措施:使用 SSCD 嵌入进行了全面的去重和去污染协议,并公开发布了相关工具及预计算的嵌入。
- 质量分析:利用“LLM 作为裁判”的评分,沿四个维度(格式、相关性、视觉依赖性、图像 - 问题对应性)对数据集进行了详细刻画。
实验结果
作者在 FineVision 上训练了一个 4.6 亿参数的 SmolVLM,并将其与在The Cauldron、LLaVA-OneVision和Cambrian-7M上训练的模型进行了比较。
- 性能提升:在 FineVision 上训练的模型在开放数据 VLM 中取得了最先进(SOTA)的结果,显示出显著的相对改进:
- 比The Cauldron高出 27.7%
- 比Cambrian-7M高出 11.4%
- 比LLaVA-OneVision高出 38.4%
- (在 11 个基准测试中,相对于基线的平均提升为 10.8 个百分点)。
- 训练动态:虽然由于包含新颖任务,初始性能略有滞后,但 FineVision 训练的模型在大约一个 epoch 后超越了所有基线,表现出卓越的泛化能力。
- 对污染的鲁棒性:当在去污染版本的数据集上重新训练时,基线模型的性能下降了 2.7–3.7 个百分点,而 FineVision 模型仅下降了 1.6 个百分点,证实了其增益并非由数据泄露驱动。
- GUI 能力:在具有挑战性的 GUI 基准测试(ScreenSpot-V2 和 ScreenSpot-Pro)上,FineVision 训练的 0.5B 模型取得了与架构等效的 2B 模型相当的性能,优于那些未经微调就无法解决任务的基础小模型。
- 多样性指标:FineVision 表现出较高的概念广度(有效秩),并且关键的是,与其他大型数据集相比,其参与率(Participation Ratio)更优,表明视觉概念的分布更加均匀。
意义与主张
该论文主张数据卫生和深思熟虑的整合与规模同样关键。FineVision 证明,一种原则性的策划方法——将大规模与严格的清洗、去重和人工监督相结合——可以缩小开源与专有 VLM 之间的性能差距。
作者强调,该数据集不仅仅是一个更大的聚合体,而是一个为新兴任务(特别是通过统一操作空间在代理/GUI 设置中)设计的“基础”。通过发布语料库、转换食谱和去重工具,这项工作旨在 democratize 对高质量训练数据的访问,并催化开放 VLM 开发的下一波创新。作者谦逊地承认了局限性,例如残留的重叠以及缺乏针对 GUI 控制的集成社区基准测试,将 FineVision 定位为未来扩展到视频、多语言覆盖和更长上下文推理的起点。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。