← 最新论文
💻 computer science

Vision-EKIPL: External Knowledge-Infused Policy Learning for Visual Reasoning

本文提出了 Vision-EKIPL,这是一种新颖的强化学习框架,通过在训练过程中注入来自外部辅助模型的高质量动作,增强多模态大语言模型的视觉推理能力,从而扩大探索空间、加速收敛,并实现比最先进方法高达 5% 的性能提升。

原作者: Chaoyang Wang, Zeyu Zhang, Meng Meng, Xu Zhou, Haiyun Jiang

发布于 2026-05-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Chaoyang Wang, Zeyu Zhang, Meng Meng, Xu Zhou, Haiyun Jiang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教导一位非常聪明的学生(即策略模型)如何解决复杂的视觉谜题,例如在三维场景中数物体,或推断形状如何移动。

问题:“回声室”陷阱

传统上,当我们使用一种称为**强化学习(RL)**的方法来训练这些学生时,我们会让他们自行生成大量答案。随后,我们奖励最好的答案,惩罚糟糕的答案。

该论文指出,这就像让学生仅通过阅读自己的笔记来备考。他们可能会更擅长重复已知内容,但会遭遇“天花板”。由于被困在回声室中,仅从自己有限的头脑中采样想法,他们无法发现新颖、巧妙的解题方法。这使得训练变得缓慢,并限制了他们最终能达到的智能水平。

解决方案:Vision-EKIPL(“专家小组”方法)

作者提出了一种名为Vision-EKIPL的新框架。这相当于聘请一组外部专家(如 GPT-4 或 Gemini)来帮助学生备考。

其运作步骤如下:

  1. 小组学习环节:系统不再仅让学生生成答案,而是从两个来源收集一组潜在答案:
    • 学生自己的尝试。
    • 由“外部专家”(辅助模型)生成的高质量答案
  2. 评分:一位老师(奖励函数)对所有这些答案进行评分。学生是否数对了球体的数量?他们是否使用了正确的格式?
  3. 筛选:系统从这个混合群体中挑选表现最佳的答案。关键在于,如果专家模型发现了一个学生遗漏的巧妙解法,该解法将被纳入“精选”之中。
  4. 课程:学生从这个“优中选优”的群体中学习。他们不仅仅从自己的错误中学习,而是被注入了专家的知识和推理策略

类比:棋手

想象一位试图提升棋艺的棋手。

  • 旧方法(标准强化学习):棋手与自己对战 100 局,赢下几局,然后试图分析自己哪里做得对。由于从未见过可能获胜的 brilliant(精彩)且冒险的走法,他们可能会陷入重复相同安全却乏味的招式的困境。
  • Vision-EKIPL:棋手与自己对战 10 局,但同时还能观看特级大师下的 10 局棋。系统从棋手和特级大师的棋局中挑选最佳招法。棋手随后研究这些顶级招法。他们不仅学习自己的风格,还汲取专家精彩、复杂的策略,从而将自己的技能上限推向更高。

论文发现

作者在视觉推理任务(如数物体、理解几何和追踪移动形状)上测试了这种方法。他们发现:

  • 更智能的结果:使用 Vision-EKIPL 训练的模型在解决谜题方面优于使用标准方法训练的模型,比之前的“最先进”水平高出约 5%。
  • 更快的学习:由于模型能立即“看到”来自专家的优秀答案,它无需浪费时间猜测。它学习得更快,收敛(完成训练)也更高效。
  • 突破天花板:最重要的发现是,这种方法实际上扩展了模型的推理边界。虽然标准强化学习方法有时会让模型变得更不具创造性(仅固守安全、已知的路径),但 Vision-EKIPL 帮助模型发现了它独自无法找到的、解决复杂问题的新途径。

一言以蔽之

Vision-EKIPL 是一种训练方法,它阻止 AI 模型在真空中学习。通过将模型自己的想法与来自“专家”AI 模型的高质量想法相结合,它教导模型进行更深层次的思考,解决更难的视觉谜题,并以快得多的速度学习。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →