← 最新论文
🤖 AI

VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct

VeriEvol 是一个迭代框架,它通过类型感知演化算子实现提示词难度的扩展,并结合多源假设检验证伪来强化答案可靠性,从而将多模态数学推理进行解耦,进而生成高质量的验证数据,显著提升模型在视觉数学基准测试上的性能。

原作者: Haoling Li, Kai Zheng, Jie Wu, Can Xu, Qingfeng Sun, Han Hu, Yujiu Yang

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Haoling Li, Kai Zheng, Jie Wu, Can Xu, Qingfeng Sun, Han Hu, Yujiu Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一名非常聪明但有些天真的学生,如何利用图片(如图表、图示和图形)来解决复杂的数学问题。

在过去,研究人员试图通过仅仅给这个学生布置更多作业的方式来让他变得更聪明。他们会生成成千上上万个新问题。但有一个陷阱:他们往往只是让问题变得更长或稍微更难,而没有实际检查答案是否正确。这就像是一个老师发了一份卷子,但答案解析里却全是错误。如果学生学习了错误的答案,他们不仅不会进步,反而会退步。

VeriEvol 是一个改变了我们创建作业方式的新系统。它关注的不是“更多”的问题,而是“更好”的问题和“经过验证”的答案。作者称之为“可验证的进化指令”(Verifiable Evol-Instruct)框架。

它是如何运作的,我们可以将其分解为以下简单的步骤:

1. “进化”健身房(让问题变得更难)

想象一下你有一个简单的练习:“观察这张三角形的图片,告诉我它有多少条边。”这对一个聪明的学生来说太简单了。

VeriEvol 有一个特别的教练(进化模块),它会观察图片和问题,然后将作业改写得难得多,但仍然需要观察图片才能完成。

  • 隐喻: 教练不再只是问“有多少条边?”,而是将其改写为:“如果你把这个三角形切成两半并旋转它,它的面积与一个周长相同的正方形相比会如何变化?”
  • 诀窍: 教练足够聪明,知道这是“哪种类型”的图片。如果是一张图表,它就会制作一个基于图表的问题;如果是一个几何图形,它就会制作一个几何问题。它不会只是向学生抛出随机的词汇;它会构建一个特定的挑战,迫使学生必须通过观察图像来解决问题。

2. “怀疑论者”侦探(检查答案)

这是最重要的一部分。通常,当计算机生成一个答案时,我们就假设它是正确的。VeriEvol 说:“没门。让我们试着先证明它是错的。”

他们建立了一个名为 HTV-Agent 的侦探系统。

  • 隐喻: 想象一个法庭。计算机生成一个答案(“假设”)。HTV-Agent 是一组怀疑论律师组成的团队,他们的唯一职责就是寻找证据证明该答案是错误的。
  • 他们如何对抗:
    • 他们使用不同的“证人”(不同的 AI 解题器)来查看它们是否达成一致。
    • 他们使用“计算器”(代码执行)来检查数学运算。
    • 他们使用“眼睛”(视觉工具)来检查答案中的数字是否与图像中的像素相匹配。
  • 判决: 如果侦探们能找到任何证明答案错误的证据,这份作业就会被扔进垃圾桶。只有当侦探们竭尽全力试图拆穿它却失败了,这个答案才会被接受。只有到那时,它才成为一个“经过验证”的答案。

3. 结果:一本超可靠的教科书

该系统将这两个步骤循环进行:

  1. 获取一个简单的问题。
  2. 将其进化为一个基于图像的困难挑战。
  3. 生成一个答案。
  4. 将其发送给“怀疑论侦探”。
  5. 如果侦探们无法拆穿它,就保留它;如果拆穿了,就扔掉并重新尝试。

其结果是一个拥有超过 25 万个数学问题的庞大库,其中每一个答案都经过了压力测试和验证。

当他们使用它时发生了什么?

研究人员在一名“学生”AI(一个 70 亿参数的模型)身上测试了它。

  • 没有使用 VeriEvol 时: 这个学生表现尚可,但经常会被图片搞混,或者根据文本模式进行猜测。
  • 使用 VeriEvol 时: 学生变得明显更聪明了。
    • 当他们仅仅使用“进化后的”问题(没有使用严格的验证器)时,学生有所进步。
    • 当他们加入“怀疑论侦探”以确保答案完美无误时,学生的进步幅度更大。
    • 规模效应: 他们展示了随着他们添加更多这些经过验证的问题(从 1 万个到 25 万个),这个学生会持续变得更聪明,这证明了数据的质量比数量更重要。

为什么这很重要(用简单的语言来说)

大多数 AI 研究都在试图让“老师”(AI 优化器)变得更聪明。VeriEvol 则说:“让我们先修好教科书。”

通过将“让问题变难”的过程与“检查答案是否正确”的过程分开,他们创建了一个数据本身是值得信赖的系统。他们不仅仅是培养了一个更好的学生,而是创建了一个更好的课程体系。他们甚至发布了所有的“侦探报告”(他们如何验证每个答案的痕迹),以便其他研究人员可以审计他们的工作,确保没有人在这份作业上作弊。

简而言之: VeriEvol 是一个能够自动编写基于图片的更难数学题,并使用一支数字侦探团队来确保在 AI 学习之前,每个答案都 100% 正确的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →