想象一下,你正在试图教导一位非常聪明的学生(即策略模型)如何解决复杂的视觉谜题,例如在三维场景中数物体,或推断形状如何移动。
问题:“回声室”陷阱
传统上,当我们使用一种称为**强化学习(RL)**的方法来训练这些学生时,我们会让他们自行生成大量答案。随后,我们奖励最好的答案,惩罚糟糕的答案。
该论文指出,这就像让学生仅通过阅读自己的笔记来备考。他们可能会更擅长重复已知内容,但会遭遇“天花板”。由于被困在回声室中,仅从自己有限的头脑中采样想法,他们无法发现新颖、巧妙的解题方法。这使得训练变得缓慢,并限制了他们最终能达到的智能水平。
解决方案:Vision-EKIPL(“专家小组”方法)
作者提出了一种名为Vision-EKIPL的新框架。这相当于聘请一组外部专家(如 GPT-4 或 Gemini)来帮助学生备考。
其运作步骤如下:
- 小组学习环节:系统不再仅让学生生成答案,而是从两个来源收集一组潜在答案:
- 学生自己的尝试。
- 由“外部专家”(辅助模型)生成的高质量答案。
- 评分:一位老师(奖励函数)对所有这些答案进行评分。学生是否数对了球体的数量?他们是否使用了正确的格式?
- 筛选:系统从这个混合群体中挑选表现最佳的答案。关键在于,如果专家模型发现了一个学生遗漏的巧妙解法,该解法将被纳入“精选”之中。
- 课程:学生从这个“优中选优”的群体中学习。他们不仅仅从自己的错误中学习,而是被注入了专家的知识和推理策略。
类比:棋手
想象一位试图提升棋艺的棋手。
- 旧方法(标准强化学习):棋手与自己对战 100 局,赢下几局,然后试图分析自己哪里做得对。由于从未见过可能获胜的 brilliant(精彩)且冒险的走法,他们可能会陷入重复相同安全却乏味的招式的困境。
- Vision-EKIPL:棋手与自己对战 10 局,但同时还能观看特级大师下的 10 局棋。系统从棋手和特级大师的棋局中挑选最佳招法。棋手随后研究这些顶级招法。他们不仅学习自己的风格,还汲取专家精彩、复杂的策略,从而将自己的技能上限推向更高。
论文发现
作者在视觉推理任务(如数物体、理解几何和追踪移动形状)上测试了这种方法。他们发现:
- 更智能的结果:使用 Vision-EKIPL 训练的模型在解决谜题方面优于使用标准方法训练的模型,比之前的“最先进”水平高出约 5%。
- 更快的学习:由于模型能立即“看到”来自专家的优秀答案,它无需浪费时间猜测。它学习得更快,收敛(完成训练)也更高效。
- 突破天花板:最重要的发现是,这种方法实际上扩展了模型的推理边界。虽然标准强化学习方法有时会让模型变得更不具创造性(仅固守安全、已知的路径),但 Vision-EKIPL 帮助模型发现了它独自无法找到的、解决复杂问题的新途径。
一言以蔽之
Vision-EKIPL 是一种训练方法,它阻止 AI 模型在真空中学习。通过将模型自己的想法与来自“专家”AI 模型的高质量想法相结合,它教导模型进行更深层次的思考,解决更难的视觉谜题,并以快得多的速度学习。
技术摘要:Vision-EKIPL
问题陈述
视觉推理是通用人工智能(AGI)的一项关键认知能力,对于从自主导航到场景理解等应用至关重要。尽管多模态大语言模型(MLLMs)已通过监督微调(SFT)和强化学习(RL)取得了进展,但当前基于 RL 的方法(例如群相对策略优化 GRPO)面临显著局限。具体而言,这些方法仅从策略模型本身采样动作组。这种自指采样将模型的探索空间限制在其自身固有能力范围内,可能导致无法超越预训练基础模型的“推理边界”。此外,现有的 RL 方法往往收敛速度慢、训练效率低,因为它们依赖模型在没有外部指导的情况下发现复杂的推理路径。
方法论:Vision-EKIPL
为解决这些局限,作者提出了Vision-EKIPL(外部知识注入策略学习),这是一种新颖的 RL 框架,将来自外部辅助模型的高质量动作整合到策略优化过程中。
核心框架
该框架基于在 RL 训练循环中注入外部知识以指导策略模型(πθ)的原则运行。该过程包含以下步骤:
多源动作采样:
与仅从当前策略采样的传统 GRPO 不同,Vision-EKIPL 从以下来源采样组合动作组 O:
- 当前策略模型 πθ。
- M 个外部辅助模型(例如 GPT-4o、Gemini-1.5-Pro),记为 πϕj。
对于给定的状态 s=(x,q)(视觉编码和问题),系统从策略模型采样 N 个动作,并从 M 个辅助模型中的每一个采样 N 个动作。
奖励计算:
所有采样的动作均使用包含两个组件的奖励函数 R(oi) 进行评估:
- 格式奖励(Rformat): 确保输出符合结构化格式(例如,在
<thought> 标签内进行推理,在 <answer> 标签内给出答案)。
- 准确性奖励(Racc): 如果最终答案正确,则给予正奖励,否则为零。
高质量动作选择:
根据奖励值对组合动作池进行排序。选择前 G 个动作以形成高质量动作组 T。该组作为当前训练步骤的“专家”知识库。
策略优化(GRPO):
使用群相对策略优化(GRPO)算法更新策略模型。所选组中每个动作的优势分数 Ai 是相对于该组奖励的均值和标准差计算的。策略参数 θ 被更新以最大化预期优势,同时保持 KL 散度惩罚以使其保持在参考分布附近。
动态演化
论文指出,在训练过程中,动作来源发生了动态转变。最初,策略模型严重依赖来自外部模型的动作,因为其自身的推理能力较弱。随着训练的进行和策略模型的改进,从策略模型自身选择的动作比例增加,使其能够利用自身学到的策略,同时仍能受益于初始的外部指导。
主要贡献
- 新颖的 RL 框架: 提出了 Vision-EKIPL,这是第一种利用来自外部辅助模型的高质量动作来指导视觉推理中策略模型优化的方法。
- 扩展的推理边界: 证明了整合外部动作有效地拓宽了策略模型的动作探索空间,使其能够发现单一策略模型可能忽略的推理路径,从而扩展了推理边界。
- 增强的效率与性能: 通过大量实验验证,该框架与最先进(SOTA)基线相比,显著加速了训练收敛并提高了整体推理性能。
实验结果
作者在Reason-RFT-CoT 基准上评估了 Vision-EKIPL,该基准涵盖三个任务类别:视觉计数、结构感知和空间变换。
- 性能提升: Vision-EKIPL 在基准测试中实现了比最先进(SOTA)方法高达**5%**的性能提升。
- 域内(ID)结果:
- 在视觉计数任务上,基于 RL 的方法(包括 Vision-EKIPL)在 2B 和 7B 参数规模上始终优于基于 SFT 的方法和基线模型。
- 在空间变换任务上,Vision-EKIPL 取得了最高性能,超越了所有基线模型,包括在特定的域外泛化指标上超越了 GPT-4o 和 Gemini-1.5-Pro 等专有模型。
- 域外(OOD)泛化:
- Vision-EKIPL 表现出优于 SFT 方法的泛化能力。例如,在 7B 模型上,其在视觉计数任务上比 ANS-SFT 高出 19%。
- 在空间变换任务中,2B 规模的 Vision-EKIPL 模型在 OOD 任务上比 GPT-4o 高出 34%,比 Gemini-1.5-Pro 高出 47%。
- 训练效率:
- Vision-EKIPL 展示了高数据效率,仅使用基线所需训练数据的**12% 至 25%**即达到了 Reason-RFT 的性能。
- 推理边界分析:
- Pass@K 分析显示,虽然传统 RL(Reason-RFT)随着 K 的增加最终落后于基础模型(表明过度利用已知路径),但 Vision-EKIPL 在所有 K 值下均保持了优越的性能,证实了其推动推理前沿的能力。
意义与主张
论文声称,Vision-EKIPL 通过克服传统 RL 方法的固有局限,为视觉推理研究提供了一种新的有效范式。通过将外部模型视为提供蒸馏监督目标的“专家”,该框架使策略模型能够学习到仅靠自采样无法获得的多样化和新颖的推理策略。
作者将这种方法定位为一种混合范式,结合了监督微调(通过来自外部动作的知识蒸馏)和强化学习的元素。他们断言,该方法不仅显著增强了 MLLMs 的视觉推理性能,而且大幅加速了训练收敛。虽然主要验证是在视觉推理任务上进行的,但作者认为该框架具有通用性,理论上可应用于语言及其他多模态任务。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。