What Should Agents Say? Action-state Communication for Efficient Multi-Agent Systems
本文介绍了 PACT,一种协议化的动作-状态通信框架,它将多智能体系统中的自由形式自然语言交互压缩为紧凑的记录,在显著降低 Token 使用量和推理成本的同时,在各种系统拓扑结构中保持或提升了任务性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是使用简单语言和日常类比对该论文进行的解释。
问题所在:“过度分享”的会议
想象一个侦探团队(智能体)正在试图破解一个谜团。在目前的系统中,每当一名侦探完成工作时,他们都会写一份冗长的报告,并将其粘贴到共享笔记本中供下一位侦探阅读。
这份报告包括:
- 最终答案。
- 他们发现的线索。
- 但同时也包括: 他们产生的每一个随机念头、探索过的每一个死胡同、每一次重新阅读线索的过程,以及一段关于自己“如何思考”的长篇大论。
问题在于:
随着调查的进行,这个共享笔记本变得越来越庞大。
- 成本高昂: 阅读一本 100 页的笔记本需要消耗大量的钱(在这种情况下,是指“Token”或计算能力)。
- 速度缓慢: 下一位侦探在看到新线索之前,必须先读完所有这些噪音。
- 令人困惑: 重要的事实被埋没在无数“我刚才想了这个,然后又想了那个”的文字之下。
该论文指出,我们目前的系统正让智能体“过度分享”他们的私人思考过程,从而堵塞了系统。
解决方案:PACT(“执行摘要”规则)
作者提出了一种名为 PACT(协议化动作-状态通信与传输)的新规则。
把 PACT 想象成对团队共享笔记本的一条严格规定:“禁止废话。”
智能体不再粘贴整个杂乱的草稿,而是必须在传递信息之前,将他们的工作转化为一个紧凑的三部分“动作-状态记录”:
- ACTION (动作): 我刚刚做了什么?(例如:“我搜索了数据库。”)
- STATE (状态): 我发现了什么证据?(例如:“我发现了一张 1995 年的收据。”)
- RESULT (结果): 有用的输出是什么?(例如:“这是收据的照片。”)
类比:
- 旧方式: 侦探 A 交给侦探 B 一本 50 页的日记,里面记录了他们一整天的生活,包括早餐吃了什么以及去商店路上产生的每一个念头。
- PACT 方式: 侦探 A 交给侦探 B 一张便利贴,上面写着:“我去了商店(动作),找到了一张蓝色汽车的收据(状态),这是照片(结果)。现在请你去查车辆登记表。”
他们的发现
研究人员通过两种不同的方式测试了这个想法:
- 证据拆分: 两名智能体需要通过分享线索来解开一个谜题。
- 流水线模式: 四名智能体排成一列工作(规划者 批判者 精炼者 求解者)。
他们将 PACT 与其他五种通信方式(如发送全文、仅发送结论或简短摘要)进行了对比。
结果:
- 并非“一招鲜吃遍天”: 他们发现,没有任何一种沟通方式能适用于所有场景。有时只发送结论效果最好;有时发送全文也没问题。
- PACT 脱颖而出: 然而,PACT 是最一致的获胜者。它在保持团队同样聪明甚至更聪明的同时,节省了大量的“钱”(Token)。
- 在测试中,PACT 平均减少了约 39% 的数据传输量。
- 在实际的编程工具(如 OpenHands 和 SWE-agent)中,它在没有破坏代码的前提下,将数据使用量降低了近 50%。
为什么有效
论文解释说,链条中的下一个智能体并不需要知道前一个智能体是如何思考的。他们只需要知道:
- 采取了什么动作。
- 当前的情况(状态)是什么。
- 结果是什么。
通过过滤掉“内心独白”(私人思考)并只分享“公开事实”,系统变得更快、更便宜,且不太容易耗尽内存。
核心结论
该论文得出结论:我们不应该仅仅让 AI 智能体进行自由形式、非结构化的段落对话。相反,我们应该强制要求它们遵循一套严格的“协议”,即只分享核心更新(动作、状态、结果)。这能将一场混乱、昂贵的对话转变为一场高效、高速的接力赛。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。