想象一下,你在一间庞大的公司工作,那里各种问题层出不穷:服务器崩溃、数据库冻结、客户无法登录。每当这些紧急情况发生,通常有一支由专家工程师组成的团队会立即介入修复。他们并不遵循单一、僵硬的规则手册;相反,他们依靠经验、直觉,以及一张“如果发生这种情况,就尝试那样做”的心理地图。
GraphMind 是一种全新的计算机系统,旨在向这些专家学习,构建一个自我完善的“数字地图”,用以指导如何解决问题,而无需人类编写指令。
以下是其工作原理,通过三个简单的部分,结合日常类比进行拆解:
1. 地图绘制者(离线构建)
问题: 公司拥有成千上万条关于专家如何修复过往问题的旧记录(日志)。但这些记录杂乱无章,就像一堆未分类的收据。
解决方案: GraphMind 扮演一位超级高效的图书管理员。它通读成千上万条这些杂乱的记录,并自动将它们整理成清晰、结构化的流程图。
- 工作原理: 它识别“问题”(例如“服务器变慢”)、“行动”(例如“检查内存使用情况”)和“结果”。它将这些点连接成一张巨大的网络。
- 神奇之处: 如果两位不同的专家用略有不同的措辞解决了同一个问题,GraphMind 会意识到它们是同一回事,并将它们合并。这防止了地图因重复内容而变得臃肿。
2. GPS 导航仪(在线遍历)
问题: 当新的紧急情况发生时,一个计算机代理需要在这张巨大的地图上找到正确的路径来解决问题。
解决方案: 代理不再仅仅阅读冗长的文档,而是像一位GPS 驾驶员在城市中导航。
- 工作原理: 代理从“问题”位置出发。它查看地图并问道:“哪条路能通向解决方案?”它结合逻辑(像人类思考一样)和地图的结构来决定下一步。
- 转折: 如果代理遇到死胡同,它不会放弃;它会掉头,尝试地图上的另一个区域。它会持续移动,直到找到解决方案或明确的建议。
3. “信息素”系统(自我演进)
问题: 在没有人类教师的情况下,系统如何随时间变得更好?
解决方案: 这是论文中最具创意的部分,灵感来源于蚂蚁。
- 类比: 当蚂蚁找到食物时,它们会在地面上留下一种化学气味(信息素)。其他蚂蚁闻到这种气味,会跟随最强烈的痕迹。如果某条路径通向死胡同,气味就会逐渐消散。
- GraphMind 如何实现:
- 成功: 当代理成功解决问题时,它会在所走的路径上“留下数字信息素”。这使得该路径变得“更粘”,下次更有可能被选中。
- 失败: 如果某条路径行不通,或者技术发生变化导致旧方案不再有效,该路径上的“气味”会慢慢消退(衰减)。
- 结果: 随着时间的推移,地图上的“高速公路”变成了最高效、经过验证的路线,而无用的道路则消失不见。系统实际上从自身的错误和成功中学习。
为什么这很重要?
该论文在真实的微软云数据库紧急事件中测试了此系统。以下是他们的发现:
- 更智能: 与仅搜索旧文本文档的系统(如基础谷歌搜索)相比,GraphMind 更频繁地找到解决方案,且错误更少。
- 更快速: 它能在相同的时间内运行更多的诊断检查。
- 自我完善: 系统使用得越多,表现就越好。“信息素”层使代理随着时间的推移变得更加自信和准确。
- 实际应用: 它实际上被真实工程师使用了一个月。在 97% 的案例中,它提供了有用的建议或解决方案,充当了得力的副驾驶,而非替代品。
简而言之: GraphMind 将人类修复问题的杂乱历史转化为一张智能、鲜活的地图,并利用一种“类蚂蚁”系统不断更新该地图,使整个团队每天在解决问题时都变得更聪明、更迅速。
技术摘要:GraphMind
问题陈述
企业环境中的复杂运营工作流——例如协调人员、工具和信息以处理事件管理任务——难以实现端到端自动化。现有解决方案面临四个主要局限:
- 高昂的编写成本:手动创建知识工件(剧本)需要深厚的领域专业知识。
- 维护负担:随着生产系统的演进,静态工件会迅速过时。
- 检索效率低下:非结构化或扁平化的检索方法消耗过多的上下文令牌,且无法捕捉因果关系。
- 缺乏适应性:现有系统无法从执行反馈中学习,以处理边缘情况或不断变化的运营条件。
尽管大语言模型(LLM)智能体重新引发了人们对自动化的兴趣,但纯粹基于提示的方法仍然脆弱。相反,运营轨迹(专家解决方案的历史记录)虽然丰富,但作为结构化、可重用的知识却未被充分利用。
方法论
GraphMind 是一个端到端系统,能够在无需人工干预的情况下构建、执行和演化以动作为核心的工作流图。它受蚁群优化(ACO)启发,通过三个核心支柱运行:
1. 离线图构建(预热启动)
此阶段将原始运营轨迹转化为结构化的、可查询的工作流图。
- 模式:系统定义了一个类型化图,包含三种实体类型(领域、问题、动作)和四种边关系(导致、解决、引出、属于)。
- 提取流水线:多智能体流水线处理异构来源(问题跟踪器、解决轨迹)。它利用 LLM 提取问题、动作和因果顺序,随后剪枝冗余节点。
- 增量构建:为应对数据的持续增长,系统采用去聚类与合并策略。新轨迹与现有数据合并,并通过轻量级的基于嵌入的凝聚聚类过程对节点进行去重(将语义相似的问题/动作分组),从而在不进行完全重建的情况下保持图的整洁。
- 效率:这种方法将在线检索简化为有界的图遍历,避免了处理原始日志或完全解析的以实体为中心的知识图谱的高昂成本。
2. 在线多智能体图遍历
在线引擎导航图以动态构建和执行工作流。
- 编排:一组智能体(例如协调智能体、执行智能体)在嵌套控制流中运行。外层循环管理全局调查上下文,内层循环执行迭代式图探索。
- 遍历算法:
- 图加载器:在每一步,LLM 确定相关的节点类型和查询。它通过向量相似度检索前 k 个根节点,并扩展 m 跳邻域。关键在于,边扩展是概率性的,受对数压缩的强化权重(log(1+ϕ(e)))偏置,以倾向于历史上成功的路径,同时允许探索。
- 动作规划器:LLM 基于调查上下文、提取的子图(可视化为带有强化权重的 Mermaid 图)以及系统指令来选择候选动作。
- 执行:专用智能体执行诊断动作(例如 KQL 查询)或提出缓解建议。
- 安全性:高影响力的缓解措施建议经人工批准,而诊断查询则自主执行。
3. 自适应遍历强化(ATR)
这种闭环机制使图能够基于执行结果进行自我优化。
- 强化沉积:遍历结束后,根据有用性、 groundedness( groundedness 指基于事实的程度)和用户反馈计算解决方案质量分数(Q)。如果 Q 超过阈值,则在遍历的节点和边上沉积强化。较短的成功路径获得更强的单元素强化。
- 时间衰减:为防止过时并鼓励适应新的故障模式,所有权重随时间衰减(ϕ(x)←(1−ρ)ϕ(x))。
- 边合成:当一次成功的遍历连续访问先前未链接的节点时,系统可以合成新的引出边,从而捕捉新颖的跨事件序列。
- 结果:随着时间的推移,图自我组织:成功的路径成为引导未来智能体的“高速公路”,而无效的路径则逐渐消失。
主要贡献
- 首个闭环系统:GraphMind 被提出为第一个能够从运营轨迹中自动构建、执行和演化以动作为核心的工作流图且无需人工编写的系统。
- 新颖的知识格式:它引入了一种基于图的格式,提供了存储效率(共享节点)、智能体友好的遍历以及持续的自我演化,解决了剧本、智能体技能和扁平化 Trace-RAG 的局限性。
- 自适应遍历强化(ATR):一种受蚁群优化启发的机制,允许工作流图从执行反馈中学习,强化成功路径并衰减过时元素,而无需显式的知识工程。
- 生产部署:该系统已部署于微软的四个生产云数据库服务中,用于事件调查。
结果
该系统在离线提取、受控在线遍历以及为期 35 天的实地研究的生产数据上进行了评估。
- 离线提取:该流水线在节点提取方面实现了 0.89 的 F1 分数,在边提取方面实现了 0.92 的 F1 分数。成本约为每个事件 0.22 美元。
- 在线遍历(与 Trace-RAG 对比):与 Trace-RAG 基线(检索 LLM 浓缩的事件摘要)相比,GraphMind 表现出:
- 缓解覆盖率:98.5% 对比 90.9%。
- ** groundedness**:96.2% 对比 77.3%。
- 有用性:3.49/5 对比 3.32/5。
- KQL 吞吐量:高出 4 倍(每个事件成功查询 10.0 次对比 2.5 次)。
- 专家评审:领域专家的盲评给 GraphMind 打出了 4.95/5(94.7% 完美)的分数,而 Trace-RAG 为 3.68。
- ATR 的影响:在 163 个事件上对比有无强化的运行结果显示,ATR 将 groundedness 提高了 2.7 个百分点(92.2% 对比 89.5%),并将 KQL 吞吐量提高了 14%(17.2 对比 15.1)。
- 实地研究:在为期 35 天、涵盖四个服务(88 次对话)的研究中,GraphMind 实现了:
- 可操作输出:97% 的对话产生了可操作的结果。
- 延迟:每轮中位延迟为 7.7 秒。
- 查询成功率:84% 生成的 KQL 查询返回了数据。
- 故障模式:失败主要归因于覆盖范围缺口(新服务)和遥测过期,而非系统设计缺陷。
意义与主张
该论文主张,GraphMind 证明了工作流图可以从大规模自主智能体执行中学习并改进。通过将静态知识工件转变为通过强化和衰减进行自我组织的“活”基础设施,该系统解决了当前 LLM 智能体的脆弱性以及手动剧本的维护负担。
作者强调,该系统独特地结合了:
- 通过共享图节点实现的存储效率。
- 通过图引导检索实现的智能体友好型遍历。
- 在编写或维护方面的零人工投入。
- 随运营轨迹增长的可扩展覆盖范围。
- 通过 ATR 层实现的持续自我演化。
这项工作表明,这种受群体智能启发的范式有潜力推广到事件管理之外的其他运营领域,如软件调试和临床决策支持,尽管当前的评估具体针对云数据库事件管理。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。