AIR: Adaptive Interleaved Reasoning with Code in MLLMs
本文介绍了 AIR,这是一个通过包含冷启动数据构建、数据集策展以及由组约束强化学习引导的自适应工具调用策略的三组件解决方案,旨在增强多模态大语言模型通过代码进行自适应交织推理以处理复杂数值计算的能力,并最终在评估基准测试上实现了显著的性能提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个非常聪明的助手,它擅长观察图片和阅读文本,但有时在处理需要大量计算的数学问题时会卡壳。如果你要求这个助手解决一个涉及体积的复杂几何问题,它可能会尝试在“脑海中”(神经网络)进行计算,并因此出错,就像人类在没有计算器的情况下尝试进行大数乘法一样。
这篇论文介绍了一种名为 AIR(基于代码的自适应交织推理,Adaptive Interleaved Reasoning with Code)的新系统,它教会了这个助手一项新超能力:知道何时停止思考并开始使用工具。
以下是 AIR 的工作原理,通过简单的概念进行拆解:
1. 核心理念:“人类计算器”类比
把 AI 想象成一个正在参加考试的学生。
- 旧方法: 学生尝试仅凭大脑解决所有问题。如果数学题太难,他们就会靠猜或者出错。
- AIR 方法: 学生学会了当问题变得过于棘手时,可以举手向老师要一个计算器。他们写下数字,按下按钮,得到结果,然后写下最终答案。
- 转折点: AI 并不会对每一个问题都使用计算器。它学会了变得具有自适应性。它知道:“这个问题很简单,我可以在脑子里完成,”以及“这个问题很难,我需要写一段代码来解决它。”
2. 训练过程:两步走的旅程
论文解释说,你不能仅仅告诉一个模型“去使用计算器”,并期望它立即奏效。它需要一个特定的训练计划:
第一步:“冷启动”(学习基础知识)
在 AI 能够自主学习使用工具之前,它需要看到一些如何操作的示例。研究人员构建了一个特殊的数据库,他们提取了难题,并手动向 AI 展示了如何在“思考”(文本)与“计算”(编写 Python 代码)之间进行切换。
- 类比: 想象一位老师向学生展示了一些已解出的例题,其中学生在处理难题部分时使用了计算器。这给了学生一个可以遵循的基本模板。
第二步:强化学习(“试错”阶段)
一旦 AI 掌握了基础知识,它就开始独立练习。这就是见证奇迹的时刻。研究人员使用了一种特殊的评分系统(奖励函数)来教 AI 何时使用工具。
- 问题: 如果 AI 使用计算器过度,它会产生混乱,导致训练崩溃(就像一个拒绝独立思考的学生)。如果它从不使用,它就会不断犯数学错误。
- 解决方案: 研究人员创建了一个**“组约束奖励”(Group-Constrained Reward)**。想象一位教练在观察整个球队。教练不仅奖励得分的球员,还奖励那些球员使用计算器的比例是否正确。
- 如果 AI 使用工具过于频繁,它会得到较低的分数。
- 如果 AI 恰到好处地使用工具以获得正确答案,它会得到高分。
- 这保持了 AI 的稳定性,并防止它在工具使用上变得失控。
3. 结果:更聪明、更稳定
论文声称,经过此类训练后:
- 准确度: AI 在数学问题上的表现显著提升,尤其是那些需要复杂计算的问题。平均而言,其得分提高了约 6 分;而在使用工具解决的具体问题上,得分提高了近 10 分。
- 可靠性: 当 AI 决定使用工具时,它的成功率超过了 95%。
- 稳定性: “组约束”方法防止了 AI 在训练期间崩溃或变得不稳定,而这正是教 AI 使用工具时常见的问题。
总结
简而言之,AIR 是一种训练多模态大语言模型(能够观察和阅读的 AI)像人类解决问题者一样行动的方法:它思考问题,意识到数学难度过大,编写一段快速的计算机脚本来解决计算,然后完成答案。其核心创新在于教会 AI 自动且在正确的时间执行此操作,而无需人类告诉它何时拿起计算器。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。