MPrune: Hierarchical Communication Graph Pruning for Efficient Multi-Modal Multi-Agent Retrieval-Augmented Generation
本文提出了 MPrune,一种新颖的分层通信图剪枝框架,通过系统地消除冗余的模态间与模态内边,来优化多模态多智能体检索增强生成,从而在保持或提高任务性能的同时,显著降低 Token 开销。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个计算机不仅仅是在阅读书籍或查看图片,而是真正能够通过“交谈”来解决问题的世界。这就是被称为多智能体系统(multi-agent systems)的激动人心的科学领域。把它想象成一个学习小组,每个学生都拥有一种超能力:一个是阅读巫师,另一个是视觉艺术家,第三个是逻辑天才。与其让一个学生独自尝试完成所有事情,不如让他们互相传递笔记,结合各自的技能来回答难题。这种被称为检索增强生成(Retrieval-Augmented Generation, RAG)的方法,让这些 AI “学生”能够从外部资源中获取信息,从而更好地思考。当我们将文本和图像混合到这个过程中时,就称为多模态 RAG(multi-modal RAG)。这里最关键的一点是,虽然这种团队协作方式非常聪明,但它也非常“话痨”。在数字世界里,每当学生们传递一次笔记,都会消耗金钱和时间。如果这个小组变得太大或者说话太多,整个系统对于现实世界的任务来说就会变得过于昂贵且缓慢。
于是,MPrune 登场了,这是一个旨在教导这些 AI 团队如何成为更好的倾听者和更高效的交谈者的全新框架。该论文背后的研究人员注意到,虽然拥有多个智能体进行通信非常强大,但目前的系统就像是一个每个人都在大声叫喊的拥挤派对。存在太多的“Token 开销”——这是一个高级说法,意思是指系统在不必要的闲聊上浪费了数字空间。为了解决这个问题,作者提出了一种“剪枝”(prune)或修剪掉通信网络中冗余连接的方法。
以下是 MPrude 的工作原理,我们用组织一个混乱的课堂项目来做类比。首先,系统分别观察“文本”学生和“图像”学生。它就像一位严格的老师,说道:“停止传递那些无关紧要的事情。只保留那些对于解决问题绝对关键的笔记。”这被称为模态内图稀疏化(intra-modal graph sparsification)。它剔除了每个小组内部的噪音。
接下来,系统观察文本组和图像组如何相互交流。系统并没有让每个文本学生都向每个图像学生大声喊叫,而是构建了一个动态通信拓扑结构(dynamic communication topology)。想象一下画一张教室地图,并且只保留那些连接了真正需要协作的学生之间的走廊。这就是模态间图稀疏化(inter-modal graph sparsification)。最后,系统更进一步,通过逐步修剪更多的边来创建一个**层级化(hierarchical)**结构。这可以被视为将一个混乱的连接网络转变为一个清晰、高效的指挥链,使信息能够顺畅流动而不会堵塞管道。
论文表明,这种方法创造了一个平衡点:AI 团队保持了与那些嘈杂、昂贵的版本同样聪明和强大的能力,但它使用显著更少的 Token(数字单词和数据)来完成工作。在各种基准测试中,作者发现 MPrune 一致地优于单智能体系统和其他稳健的多智能体设置。结果是,这个系统不仅运行得更快、成本更低,而且保持了高性能,证明了有时,说得少反而能让你理解得更多。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。