← 最新论文
💻 computer science

EvoLMM: Self-Evolving Large Multimodal Models with Continuous Rewards

本文提出了名为 EvoLMM 的自进化框架,通过从单一基座模型实例化生成器与求解器两个协作智能体,利用内部一致性进行连续自奖励学习,从而在无需任何标注数据或外部奖励模型的情况下,显著提升了大型多模态模型在数学推理任务上的表现。

原作者: Omkar Thawakar, Shravan Venkatraman, Ritesh Thawkar, Abdelrahman Shaker, Hisham Cholakkal, Rao Muhammad Anwer, Salman Khan, Fahad Khan

发布于 2026-03-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Omkar Thawakar, Shravan Venkatraman, Ritesh Thawkar, Abdelrahman Shaker, Hisham Cholakkal, Rao Muhammad Anwer, Salman Khan, Fahad Khan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 EvoLMM 的新方法,它的核心目标是让大型多模态模型(既能看图又能读文的 AI)在没有人类老师、没有标准答案、也没有外部打分系统的情况下,自己教自己变强

为了让你更容易理解,我们可以把整个过程想象成**“一个 AI 同时扮演两个角色:出题老师和解题学生”,并且它们是在一个没有标准答案的迷宫**里进行自我进化。

1. 以前的困境:依赖“老师”和“参考答案”

以前的 AI 训练就像学生备考:

  • 需要题库:人类老师必须准备好成千上万张图,并配上完美的题目和答案(比如“这张图里有 3 个苹果”)。
  • 需要红笔批改:每次做题后,需要人类或另一个专门的系统来打分,告诉 AI“做对了”还是“做错了”。
  • 缺点:这非常耗时、昂贵,而且一旦遇到没有标准答案的新领域(比如复杂的数学推理),AI 就学不动了。

2. EvoLMM 的创意:AI 的“自我博弈”

EvoLMM 抛弃了人类老师,它让同一个 AI 模型分裂成两个“人格”(虽然底层代码是一样的,但在训练时扮演不同角色):

  • 角色 A:出题人 (Proposer)
    • 任务:看着一张随机图片(比如一张复杂的图表或几何图),自己编一个数学或逻辑问题。
    • 挑战:它不能编太简单的(比如“图里有几个圆?”),也不能编太难的(比如“请证明这个定理”),否则“学生”就学不到东西。它需要找到**“有点挑战但能解决”**的甜蜜点。
  • 角色 B:解题人 (Solver)
    • 任务:根据出题人编的问题,尝试给出答案。
    • 关键技巧:它不只答一次,而是连续答 5 次
    • 自我打分:如果这 5 次答案里,有 4 次都说了“答案是 42",只有 1 次说“答案是 100",那么 AI 就会认为“答案 42"大概率是对的。这种**“大家意见一致”的程度,就是它的“自我奖励”**。

3. 核心魔法:连续奖励 (Continuous Rewards)

这是这篇论文最厉害的地方。

  • 以前的做法(离散奖励):就像考试只有“及格”和“不及格”。如果 5 次答案里有 3 次对、2 次错,以前的系统可能会直接判“不及格”,给 0 分。这会让 AI 很沮丧,不知道该怎么改进。
  • EvoLMM 的做法(连续奖励):就像**“评分制”**。
    • 如果 5 次答案有 5 次一致,给 100 分。
    • 如果有 3 次一致,给 60 分。
    • 即使只有 2 次一致,也给 30 分。
    • 比喻:这就像学骑自行车。以前如果摔倒了就完全没奖励;现在只要你能多保持平衡一秒,系统就给你一点“鼓励分”。这种平滑的反馈让 AI 能一步步微调,而不是在“全对”和“全错”之间跳来跳去。

4. 进化过程:从“乱猜”到“专家”

整个训练过程就像是一个自动生成的课程表

  1. 初期(乱猜阶段)
    • 出题人随便编题,解题人答得乱七八糟,大家意见很不统一。
    • 但因为有了“连续奖励”,即使只有一点点共识,AI 也能收到微弱的信号,开始慢慢调整。
  2. 中期(磨合阶段)
    • 出题人发现编太简单的题,解题人答得太快且一致,奖励反而不高(因为太简单没学到东西)。
    • 出题人开始尝试编稍微难一点的题,逼迫解题人深入思考。
    • 解题人为了拿高分,开始整理思路,答案变得越来越一致。
  3. 后期(专家阶段)
    • 出题人专门挑那些**“需要多步推理”**的难题(比如看图里的趋势变化,再结合几何知识)。
    • 解题人已经学会了严密的逻辑链条,能稳定地给出正确答案。
    • 结果:模型在没有人类干预的情况下,自己学会了如何看图、如何推理,甚至在数学图表理解上超过了原本的基础模型。

5. 为什么这很重要?

  • 无限扩展:以前学东西需要人类准备数据,现在只要有图片(哪怕是互联网上随便抓的图),AI 就能自己生成题目、自己练习、自己变强。
  • 更聪明:实验证明,用这种方法训练的 AI,在数学图表、科学推理等需要逻辑的任务上,准确率提升了 2%~3%。在 AI 领域,这已经是巨大的进步。
  • 未来潜力:这标志着 AI 开始走向**“自主进化”**。就像人类通过不断试错和反思来学习一样,AI 不再只是被动地接受人类灌输的知识,而是开始主动探索未知。

总结一句话:
EvoLMM 就像给 AI 安排了一场**“没有裁判的辩论赛”**,让它在不断的自我提问、自我回答、自我反思中,通过“大家意见越一致,分数越高”的机制,自己把自己训练成了逻辑推理大师。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →