← 最新论文
💬 NLP

Vero: An Open RL Recipe for General Visual Reasoning

本文提出了完全开源的 Vero 视觉语言模型系列,通过构建包含 60 万样本的多样化强化学习数据集(Vero-600K)并设计任务路由奖励机制,在无需专有思维数据的情况下实现了跨图表、科学及空间理解等广泛视觉推理任务的最先进性能,证明了广泛的数据覆盖是强化学习扩展的关键驱动力。

原作者: Gabriel Sarch, Linrong Cai, Qunzhong Wang, Haoyang Wu, Danqi Chen, Zhuang Liu

发布于 2026-04-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Gabriel Sarch, Linrong Cai, Qunzhong Wang, Haoyang Wu, Danqi Chen, Zhuang Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 Vero 的新项目,它的核心目标是训练出一种**“全能型”的视觉推理模型**。简单来说,就是让 AI 不仅能“看”图,还能像人类专家一样,针对不同类型的图片进行深度思考、分析和解答。

为了让你更容易理解,我们可以把这篇论文的核心内容想象成**“培养一名超级多面手侦探”**的故事。

1. 背景:现在的 AI 侦探有什么缺点?

目前的顶尖 AI(比如某些大公司的私有模型)虽然很聪明,但它们像是**“黑箱”**。我们知道它们能解题,但不知道它们是怎么练出来的。

  • 秘密配方:它们使用了私有的、不公开的“特训数据”和“奖励机制”。
  • 偏科严重:有些开源的 AI 只擅长做数学题(像只懂算术的会计),有些只擅长找物体(像只懂数数的保安)。如果让一个只懂算术的 AI 去修图或写文案,它就会表现得很糟糕。

Vero 的突破:作者团队决定把“黑箱”打开,用完全公开的方法,训练出一个既懂数学、又懂找东西、还能写文案的“全能侦探”。

2. 核心配方:Vero-600K 数据大杂烩

要培养一个全能侦探,不能只让他练一种技能。作者收集了 60 万个 训练样本,来自 59 个 不同的数据集。

我们可以把这 60 万样本想象成六类不同的“特训营”,每个训练营专门锻炼一种能力:

  1. STEM 营(科学数学):像解几何题、看科学图表,锻炼逻辑推理。
  2. 图表与 OCR 营:像读复杂的财务报表、识别文档里的文字,锻炼信息提取。
  3. 空间与行动营:像玩 3D 拼图、操作机器人、看 UI 界面,锻炼空间感和操作能力。
  4. 知识与识别营:像认鸟、认植物、结合常识回答问题,锻炼常识推理。
  5. 定位与计数营:像数图里有几只猫、指出某个物体在哪里,锻炼精准定位。
  6. 描述与指令营:像给图片写朋友圈文案、听从复杂指令,锻炼语言生成和对话能力。

关键发现:作者发现,如果只让 AI 在一个训练营里死磕(比如只练数学),它到了其他领域就会“水土不服”,甚至把原本会的东西忘掉。只有让它在六个营里“雨露均沾”地混合训练,它才能成为真正的多面手。

3. 训练方法:聪明的“奖励机制”

在训练过程中,AI 会尝试回答问题,然后需要知道“答得对不对”。

  • 以前的做法:就像老师只给数学题打分,不管语文题。
  • Vero 的做法(任务路由奖励):这就像一位**“全能裁判”**。
    • 如果 AI 在解数学题,裁判就用“数学公式”来核对答案。
    • 如果 AI 在找物体,裁判就用“坐标框”来核对位置。
    • 如果 AI 在写文案,裁判就用“大语言模型”来评判文笔通不通顺。
    • 关键点:裁判会根据题目类型,自动切换打分规则。这保证了 AI 在每种技能上都能得到正确的反馈,不会“张冠李戴”。

4. 训练成果:青出于蓝

经过这种“混合特训”和“智能打分”后,Vero 模型的表现令人震惊:

  • 全面超越:在 30 个不同的测试题中,Vero 的表现超过了目前大多数同体量的开源模型,甚至在很多项目上超过了那些使用了私有数据的商业模型(比如 Qwen3-VL-Thinking)。
  • 以小博大:作者甚至用了一个较小的基础模型(8B 参数),通过 Vero 的食谱训练后,打败了原本参数更大、但训练方法较旧的模型。
  • 没有副作用:最重要的是,它没有因为练了数学就忘了怎么聊天。相反,它在保持“聊天能力”的同时,大幅提升了“解题能力”。

5. 为什么这很重要?(简单总结)

这就好比以前我们想培养一个全能的运动员,只能偷偷摸摸地用一些不知名的“神秘补剂”(私有数据),而且不知道具体怎么练的。

Vero 做了什么?
它公开了完整的训练食谱(60 万数据 + 混合策略 + 智能打分规则),证明只要**“吃得杂”(数据多样)“练得对”(奖励机制精准)**,不需要黑箱操作,也能训练出世界级的全能 AI。

一句话总结:
Vero 就像一份公开的“全能侦探养成指南”,它告诉我们:想要 AI 既聪明又全面,不能只盯着数学题练,而要给它看遍世间万物,并用最聪明的方式告诉它哪里做得好。现在,这份指南和所有的训练材料都免费公开了,任何人都可以照着练。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →