← 最新论文
🤖 AI

MAVEN: Improving Generalization in Agentic Tool Calling

本文介绍了 MAVEN,这是一种轻量级的符号推理支架,通过实现结构化分解、自适应编排和中间验证,显著提升了智能体工具调用中的泛化能力和端到端任务成功率,其通过在新的压力测试基准上提升开源模型的性能,同时保持与专有系统相比具有成本竞争力的能力,证明了其有效性。

原作者: Omkar Ghugarkar, Vishvesh Bhat, Muhammad Ahmed Mohsin, Asad Aali

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Omkar Ghugarkar, Vishvesh Bhat, Muhammad Ahmed Mohsin, Asad Aali

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是对论文《MAVEN: Improving Generalization in Agentic Tool Calling》的解释,采用了简单的语言和富有创意的类比。

核心问题:那个“聪明但健忘”的助手

想象一下,你雇佣了一位才华横溢但有点丢三落四的助手来解决一个复杂的谜题,比如修理一个坏掉的汽车引擎或解决一个困难的物理问题。你给了他一堆工具(扳手、计算器、诊断扫描仪)。

目前的 AI 模型(即这些“助手”)非常聪明。如果你问他们一个简单的问题,他们能答对。但当你要求他们完成一项长期的、多步骤的任务时——比如“诊断引擎、更换零件,然后测试速度”——他们经常会跌倒。他们可能会:

  • 忘记三步之前做了什么。
  • 选错了适合当前任务的工具。
  • 在计算中犯了一个微小的错误,并在此基础上不断累积错误,直到整个答案都错了。
  • 没检查工作就急于冲向终点。

论文作者将这种现象称为缺乏泛化能力(Generalization)。AI 可以处理一种特定类型的谜题,但如果规则稍有变化或任务变长,它就会崩溃。

解决方案:MAVEN(“项目经理”式脚手架)

为了解决这个问题,研究人员构建了 MAVEN(模块化智能体验证与执行网络)。

请不要把 MAVEN 仅仅看作一个新的大脑,而要把它看作一个坐在 AI 与工具之间的组织极其严密的项目经理。它本身并不进行思考,而是强制 AI 遵循一套严格且安全的流程。

MAVEN 通过三个简单的阶段运作,就像工厂的流水线一样:

  1. 剪贴板(上下文缓冲 - Context Buffering): 在 AI 动手之前,MAVEN 会将混乱的对话整理好,并将关键事实记录在剪贴板上。它确保 AI 记住目标以及问题的当前状态。
  2. 蓝图(动作合成 - Action Synthesis): MAVEN 不会让 AI 盲目猜测下一步该做什么,而是强制它将大问题拆解成微小的单步任务。它会询问:“我们现在需要做的唯一一件具体事情是什么?”并确保 AI 在推进之前已经准备好了所有必要的工具。
  3. 安全检查员(调用与验证 - Invocation & Verification): 这是最重要的部分。在 AI 使用工具(如计算器)之前,MAVEN 会让它停下来并确认:“等等,我检查过我的计算了吗?这是正确的工具吗?”如果 AI 犯了错,MAVEN 会立即捕捉并说:“重试一下”,而不是任由错误不断累积。

测试:MAVEN-Bench(“压力测试”考试)

为了证明其理念的有效性,团队创建了一个新的考试,名为 MAVEN-Bench

你可以把标准的 AI 基准测试看作是一场选择题考试,AI 只需要选出正确的字母即可。而 MAVEN-Bench 更像是一场实战障碍赛

  • 赛道: 它使用了需要多个步骤的困难数学和物理问题。
  • 转折点: 这些问题经过特殊设计,旨在“坑”掉 AI。它们包含“对抗性”元素,例如接近于零的数字(这可能会让计算器出错)或令人困惑的指令。
  • 规则: AI 不仅仅根据最终答案评分。它还会根据其过程进行评分。它是否检查了自己的工作?它是否使用了正确的工具?它是否记录了每一步?

结果:小脑容量,大提升

研究人员使用标准的开源 AI 模型(GPT-OSS-120b)对 MAVEN 进行了测试。

  • 没有 MAVEN 时: AI 只有约 48% 的时间能得到正确答案。它经常在问题的中间环节迷失方向。
  • 有了 MAVEN 后: 准确率跃升至 71%

类比: 想象一名学生正在参加一场很难的数学考试。没有导师指导时,他得分为 48%;而有了导师(MAVEN)强制要求他写下每一个步骤、检查算术并使用正确的公式,他的得分跳到了 71%。

成本: 研究人员指出,这种提升并不需要一个超级昂贵、庞大的 AI 模型。他们使用了一个较小的开源模型,就达到了与大型商业模型相媲美的结果,但成本仅为后者的 1/10 左右。

为什么这很重要

论文的结论是,我们目前测试 AI 的方式存在缺陷。我们往往只看最终答案。如果 AI 靠运气或靠猜得到了正确答案,我们就认为它很聪明。

MAVEN 表明,如果我们迫使 AI 具备过程感知能力(Process-aware)——即检查自己的工作、记住自己的步骤并验证自己的工具——它就会变得更加可靠。这不在于提升 AI 的原始知识量(让它更“聪明”),而在于给它一套更好的系统,让它在不崩溃的情况下更好地使用已有的知识。

简而言之: MAVEN 是一个“安全绳”,防止 AI 助手在尝试攀登漫长而复杂的险峰时,从悬崖上跌落。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →