← 最新论文
💬 NLP

MyAG: A Graph-Based Framework for Designing and Analyzing Composable LLM Agent Systems

本文介绍了 MyAG,这是一个开源的、基于图的框架,它将可组合的 LLM 智能体系统分解为组件、工作流和搜索图,以实现灵活的设计、层级化组合和性能分析。

原作者: Zhisong Zhang

发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhisong Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机不仅仅是回答问题,而是能够真正“做事”的世界。它们可以浏览网页、预订机票,或者通过像数字助手一样行动来解决复杂的谜题。这就是 AI Agent(人工智能智能体) 的领域。不要把它们仅仅看作简单的聊天机器人,而要将其视为拥有大脑(大语言模型)和一套手(与世界交互的工具)的小型机器人。但棘手之处在于:构建这些机器人是一件杂乱无章的事情。你必须决定它们拥有哪些工具、它们如何一步步思考,以及当它们陷入困境时该怎么办。这就像是在尝试制造一辆汽车,而引擎、方向盘和 GPS 全都被胶水粘在一起,导致无法拆卸更换。如果你想改变汽车的驾驶方式,可能不得不重建整个引擎。研究人员正试图弄清楚如何构建这些智能体,使其具备灵活性、高效性且易于修复,因为目前很难判断一个机器人的失败是因为它太“笨”,还是因为指令写得不好。

于是有了 MyAG,这是由香港城市大学的张志松(Zhisong Zhang)创建的一个新工具包。该论文将 MyAG 呈现为一个“基于图的框架”,这是一种高级说法,意指它将智能体设计组织成三个独立的、清晰的蓝图,而不是一个巨大的、纠缠不清的乱团。作者建议,通过将“谁”(组件)、“如何做”(工作流)和“如果……怎么办”(搜索策略)分开,开发者可以像玩乐高积木一样进行组合。他们发现,这种分离使得在不重写整个系统的情况下测试不同策略变得更加容易。在实验中,他们展示了这种方法如何能够详细观察智能体在完成任务的表现与执行任务所需的时间或成本之间的权衡。他们并未声称解决了所有的 AI 问题,但确实证明了他们的方法能帮助研究人员准确看到智能体在哪里花费了时间,以及在哪里浪费了资源。

数字大脑的三大蓝图

要理解 MyAG,请想象你正在导演一部电影。你有三项截然不同的工作,而 MyAG 要求你必须将它们分开,以便你在不破坏其他部分的情况下修复其中之一。

1. 组件图(Component Graph):演员与剧组
这是你的电影演员表。在 AI 世界中,这些是智能体(做出决策的演员)、环境(他们表演的场景,如网页浏览器)和工具(他们使用的道具)。在 MyAG 中,这被绘制成一张显示“谁能与谁对话”的地图。例如,“动作智能体”可能会连接到“浏览器环境”,这意味着智能体可以点击网页上的按钮。这里很酷的一点是,你可以为不同的场景重复使用同一个演员。你不需要因为场景变了就去造一个新演员;你只需要告诉现有的演员下一步该做什么。

2. 工作流图(Workflow Graph):剧本
这是告诉演员何时说话以及下一步该做什么的剧本。它是故事的流程。智能体是先检查天气,然后再订票吗?或者如果失败了,它会循环回去重试吗?MyAG 允许你将这个剧本绘制成流程图。你可以拥有循环、分支(如果发生 A,则走左边;如果发生 B,则走右边)以及停止条件。最棒的部分是?你可以保持相同的演员(组件图),但更换剧本(工作流图),来看看不同的故事结构是否效果更好。

3. 搜索图(Search Graph):“如果……怎么办”的排练
这才是真正有趣的地方。有时,机器人需要在决定最佳路径之前探索不同的路径。也许它尝试推开一扇门,发现锁住了,然后尝试打开一扇窗户。搜索图记录了所有这些“如果……怎么办”的情景。它追踪智能体采取的每一个分支、每一个死胡同以及每一条成功的路径。这使得系统可以使用诸如“最佳优先搜索”(始终选择最有希望的路径)或“回溯”(如果出错,则回到之前的步骤)等策略。这就像有一个导演可以喊道:“卡!让我们再试一次那个场景,但这次让角色跑着过去而不是走过去”,而无需重建整个电影场景。

用乐高积木搭建高塔

论文的一个核心思想是层级组合(Hierarchical Composition)。想象你正在建造一个巨大的机器人。与其试图同时设计每一个微小的螺丝和电线,不如先造一只手,再造一条腿,最后是一个头,最后把它们组装在一起。MyAG 让你可以对 AI 智能体进行这样的操作。你可以构建一个非常擅长在互联网上寻找论文的小型“网页浏览系统”。然后,你可以将整个系统封装起来,将其作为更大规模的“研究助手”系统中的一个单一工具。

论文解释说,这些“子系统”可以是无状态的(每次使用时都会重置,就像计算器一样)或有状态的(会记住之前发生的事情,就像记得你偏好的真人助手一样)。这种模块化意味着你可以通过拼接更小的、经过测试的部分来构建复杂的智能体,而不是每次都从零开始。

秒表与钱包:衡量效率

作者们同样关注效率。他们认为,仅仅因为一个智能体得到了正确答案并不意味着它是一个好的智能体;它可能尝试了 100 次并耗费了巨额的计算时间。MyAG 内置了一个秒表和钱包。

他们测量两个主要指标:

  • LLM 成本 (CLC_L): “大脑”的成本是多少。这是根据 AI 读取和写入的单词(token)数量来计算的。他们使用了一个加权输入和输出 token 的公式,允许用户根据 AI 模型的高昂程度来设置价格。
  • 环境成本 (CEC_E): “双手”的成本是多少。这衡量了在现实世界中执行任务所需的时间,比如等待网页加载或向下滚动页面。

通过追踪这些成本,研究人员可以观察性能与效率之间的权衡。例如,他们发现一种简单的“贪婪”(Greedy)策略(即只做脑子里第一个想到的事)是最快且最便宜的。然而,“回溯”(Rollback)策略(允许智能体回头重试)虽然可能稍微贵一点,但通常能获得更好的结果。“Best-of-N”策略(尝试多条路径并挑选最好的那条)可以非常精准,但也会非常缓慢且昂贵。

实验展示了什么

团队在两个现实任务上测试了 MyAG:回答复杂问题(使用 GAIA 基准测试)和网页导航(使用 Mind2Web-Live)。他们使用不同的策略运行了这些测试,以观察彼此的表现。

  • 速度 vs. 智力: 贪婪策略效率最高,因为它没有浪费时间检查替代方案,因此耗时最短,消耗的计算 token 最少。
  • 第二次机会的力量: 在给予足够时间的情况下,回溯策略整体表现最好。它允许智能体承认错误并重试,这带来了更高的准确率,尽管它在时间和 token 成本上稍高一些。
  • 复杂性的代价:Best-FirstBest-of-N 这样的策略可以提高性能,但代价高昂。它们需要更多的计算能力和时间。论文指出,这些复杂方法的成功高度依赖于是否有一个优秀的“评判者”来决定哪条路径是最好的。

他们还详细分解了时间都花在了哪里。对于网页导航,他们发现“滚动”出奇地便宜且快速,而“等待”页面加载则是最昂贵的动作,尽管发生的频率较低,但占据了巨大的时间份额。这种细致的分析有助于开发者准确知道在哪里优化他们的智能体。

总结

MyAG 并不是解决所有 AI 问题的魔杖,作者也明确表示,它是作为一种研究工具设计的,而非用于构建拥有数百万用户的商业应用的成品。它目前还不处理诸如安全性或分布式网络之类的问题。然而,它成功证明了将“谁”、“如何做”和“如果……怎么办”进行分离,会让设计、测试和理解 AI 智能体变得更加容易。通过为研究人员提供一种清晰的视觉化和测量方式,MyAG 帮助他们弄清楚如何构建更聪明、更快且更具成本效益的数字助手。论文表明,这种方法是使 AI 智能体系统变得更加透明和可控迈出的坚实一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →