HyperAgent: Planning and Acting over Tool-Schema Hypergraphs for Tool-Use LLM Agents
本文介绍了 HyperAgent,这是一个利用有向工具-模式超图(Tool-Schema Hypergraph)来引导动态规划和面向缺陷执行(deficit-oriented execution)的新型框架,从而在复杂的工具使用场景中,相比现有基准模型提升了大型语言模型智能体的任务完成率和效率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一位飞船舰长,但你不是通过单一的操纵杆来驾驶,而是必须指挥成千上万个不同的机器人,每个机器人说着不同的语言,并持有独特的工具集。这就是“AI智能体”(AI Agents)的世界——基于大语言模型(LLM)构建的智能计算机程序,旨在为我们完成现实世界的任务,比如预订机票、订购杂货或管理你的银行账户。这些智能体就像是聪明但有点丢三落四的助手;它们能完美理解你的请求,但在思考“如何去做”时,往往会迷失方向。它们可能会在还没准备好必要原料的情况下就尝试使用某种工具,或者可能忘记了某个机器人必须先完成它的工作,下一个机器人才能开始。科学家们面临的一个重大问题是:我们该如何阻止这些AI助手撞墙,并帮助它们在复杂的数字工具迷宫中导航而不至于崩溃?
于是有了 HyperAgent,一种像为这些AI智能体提供超级智能GPS的新方法。HyperAgent 不再让 AI 通过试错法来猜测路径,而是在智能体开始移动之前,就构建一张关于所有工具如何相互连接的庞大且详细的地图。这就像一位大师级厨师,他们不仅仅是在看食谱;他们首先会检查储藏室、冰箱和花园,看看自己到底有哪些食材,需要哪些工具来切割,以及一切必须按什么顺序进行。通过使用这张“地图”,HyperAgent 帮助 AI 精准地规划步骤,避开死胡同,并节省大量的时间和精力。
问题所在:“猜谜游戏”式的 AI
目前,大多数 AI 智能体的工作方式有点像是一个试图通过随机用锤子敲击零件来修理汽车引擎的人。它们看着一堆工具列表(比如“发送电子邮件”或“检查银行余额”),然后尝试猜测该使用哪些工具以及使用的顺序。问题在于,这些工具通常是相互依赖的。如果你没有先“登录”,你就无法“发送电子邮件”;如果你没有密码,你也无法“登录”。
现有的方法依赖于 AI 的大脑,仅通过阅读描述来理解这些连接。但当工具达到数百个时,AI 就会感到困惑。它可能会尝试使用一个需要特定输入(而它目前尚未拥有)的工具,从而导致尝试失败。这就像是在没检查是否还有鸡蛋的情况下就开始烤蛋糕,直到做了一半才发现需要去买鸡蛋,结果发现商店已经关门了。这种“猜谜游戏”浪费了时间,消耗了资金(计算处理能力),并且经常导致任务彻底失败。
解决方案:“工具模式超图”(Tool-Schema Hypergraph)
开发 HyperAgent 的研究人员决定停止猜测,转而开始绘图。他们创建了一个被称为 工具模式超图(Tool-Schema Hypergraph) 的东西。要理解这一点,请想象一个巨大的、3D 的蜘蛛网,每一根丝线都代表着工具之间的连接。
在普通的地图中,你可能会画一条从“工具 A”到“工具 B”的线。但在这种新的“超图”中,连接更加精确。它不仅说“工具 A 有助于工具 B”,它还会说“工具 A 产生了这个特定的成分(比如一个密码),而这恰好是工具 B 启动所需的”。它描绘了数据的流动,就像水流通过管道一样,确保每一个工具的输出都能完美匹配下一个工具所需的输入。
他们利用一个包含 250 个不同场景的真实世界数据集构建了这张地图,涉及电子邮件、购物和音乐服务等应用。他们甚至在地图中加入了“前提条件”——比如知道“发送消息”工具只有在已经“登录”的情况下才能工作。这创造了一个关于数字世界运作方式的动态、活生生的蓝图。
HyperAgent 如何运作:三步舞曲
一旦构建好这张地图,HyperAgent 就会通过一个巧妙的三步流程来完成任务:
- 侦察员(上下文提取): 当你给 AI 一个任务时(例如,“把最近一次订单的收据发邮件给我的室友”),HyperAgent 不会去看整个混乱的网络。相反,它利用地图进行缩放,只提取出与该任务相关的特定工具和连接。它创建了一个“任务 DAG”(一个术语,指有向无环图,即流程图),展示了操作的精确顺序,就像一张列出了每一步骤和所需原料的食谱卡片。
- 构建者(面向缺失目标的扩展): 这是 HyperAgent 变得真正聪明的地方。当 AI 开始工作时,它会检查自己的“状态”——它现在拥有哪些信息?如果它需要一个“收据文件”但目前还没有,HyperAgent 会查看地图,找到能产生该文件的确切工具。它会为这个缺失的部分构建一个微型的工具子网络,确保 AI 永远不会尝试做它目前还做不到的事情。这就像一支建筑队,只为当前的墙壁订购所需的砖块,而不是试图一次性盖好整栋房子。
- 导航员(动态执行): 随着 AI 完成步骤并收集新信息(比如找到了收据),它会更新自己的内部状态。如果发生错误或情况发生变化,HyperAgent 不会惊慌。它会重新检查地图,调整计划,并寻找新的路径。这就像一个 GPS,当它看到交通拥堵时会立即重新规划路线,而不是让你在原地绕圈,希望交通能自动疏通。
结果:更快、更聪明、更便宜
研究人员在 AppWorld 基准测试上测试了 HyperAgent,这是一个包含 750 个不同任务(从简单到非常复杂)的严苛测试套件。他们将 HyperAgent 与其他 AI 方法进行了对比,包括那些仅仅靠猜测的方法(如 ReAct)以及那些基于过往案例进行训练的方法。
结果令人印象深刻。HyperAgent 不仅完成了更多的任务,而且效率更高。
- 成功率: 在标准测试集上,HyperAgent 成功完成了 63.1% 的任务,而排名第二的方法仅为 48.8%。在难度更高的“挑战”集上,它完成了 35.7%,而后者为 30.2%。
- 效率: 或许更重要的一点是,HyperAgent 节省了大量的资源。它在每个任务中使用了 46,000 个 Token(AI 处理的数字“单词”),而标准方法则需要 140,000 个。它也减少了 API 调用次数(向外部工具发送请求),从平均 75.1 次降至 48.0 次。
简单来说,HyperAgent 不仅更有可能成功,而且在达成目标的过程中浪费的时间和计算能力也更少。它避免了那种“试错循环”——即其他智能体会尝试一个工具,失败,再尝试另一个,再次失败,最后最终放弃。
为什么这很重要
论文指出,通过显式地建模工具之间的依赖关系——而不是仅仅依靠 AI 从文本中猜测这些连接——我们可以让 AI 智能体变得更加可靠。研究人员发现,当他们移除“地图”(图上下文)或“构建者”(支持图)时,性能会显著下降。这证明了地图的结构是必不可少的,而不仅仅是一个锦上添花的附加项。
虽然这项研究是在模拟环境(AppWorld 数据集)中进行的,但其结果指明了一个清晰的前进方向:AI 智能体不仅需要更擅长阅读,还需要更好地理解它们所使用的工具的结构。通过给它们一张地图,我们不再让它们在黑暗中徘徊,而是帮助它们充满信心地在复杂的数字世界中航行。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。