Safe and Adaptive Cloud Healing: Verifying LLM-Generated Recovery Plans with a Neural-Symbolic World Model
本文介绍了 PASE,这是一个神经符号自愈框架,它统一了基于大语言模型的规划合成、神经符号世界模型验证以及由深度强化学习驱动的提示词优化,与现有方法相比,显著降低了云系统的恢复时间并提高了故障检测准确率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一座由数字服务(如云服务器)构成的庞大且繁忙的城市。有时,城市的某些部分会发生故障——交通灯失效、电线断裂或建筑物起火。在过去,修复这些问题就像拥有一支只会几种特定招式的消防队:“如果火在这里,就把水喷在那里。”如果火出现在一个奇怪的新位置,他们就会束手无策。
这篇论文介绍了一个名为 PASE(规划感知语义自愈引擎,Planning-Aware Semantic self-hEaling engine)的新系统。你可以将 PASE 想象成不仅仅是一个拿着单根水管的消防员,而是一个集超级智能城市规划师、安全检查员和教练于一身的角色。
以下是 PASE 的工作原理,分为三个简单的角色:
1. 超级规划师(大语言模型 - LLM)
在旧系统中,计算机只是观察一个损坏的部分,然后从一份简短的预设选项列表中选择下一步动作。
PASE 则不同。 它使用大语言模型(LLM)——本质上是一种能像人类一样阅读并理解语言的高级人工智能。当发生故障时,PASE 不仅仅是选择一个动作,它还会编写一整个关于如何修复问题的“故事”。
- 类比: 规划师不再只是说“左转”,而是说:“首先,隔离损坏的路段,然后向下一街区派遣后援小组,最后重新规划交通路线。”它可以为从未见过的难题发明全新的、多步骤的计划。
2. 安全检查员(神经符号世界模型)
这里有一个棘手之处:有时,即使是超级聪明的规划师也可能出错。它可能会建议一个听起来不错但实际上会导致更大灾难的计划(比如试图通过关闭备用发电机来修复停电问题)。
PASE 内置了一个安全检查员。 在计划真正执行于真实的城市之前,这个检查员会运行一次模拟。
- 类比: 想象规划师画了一座新桥的蓝图。在他们浇筑任何混凝土之前,检查员会运行一次计算机模拟,以查看:“这座桥能承重吗?它会在暴风雨中坍塌吗?”如果模拟结果显示“不行,这很危险”,那么该计划就会被废弃。这阻止了系统犯下危险的错误。
3. 教练(元提示词优化器)
即使是最优秀的规划师也可能陷入僵局或写出令人困惑的指令。
PASE 有一位教练,负责观察规划师的表现。如果规划师不断制定糟糕的计划,教练不会重写整个规划器(因为那太耗时了)。相反,教练会给规划师一套更好的指令(即“提示词”),帮助它思考得更清晰。
- 类比: 想想一名棋手。如果他一直输球,你不会更换他的大脑,而是给他一个新的建议:“记住要先保护你的王。”教练通过试错法自动学习这些技巧,帮助规划师在处理新型故障时变得更聪明、更快速。
它们是如何协同工作的
论文描述了一个紧密的闭环:
- 推理: 系统观察混乱的情况(日志、错误、警报)并描述问题。
- 规划: 超级规划师编写一个分步修复方案。
- 验证: 安全检查员模拟修复过程,以确保其安全性。
- 适配: 教练调整下次执行时的指令,使规划师变得更好。
实验结果
作者在一个故意被破坏的真实云系统中测试了该系统(故障注入)。
- 速度: PASE 的修复速度比现有最优秀的方法快了 40%。
- 智慧: 它在弄清楚为什么发生故障以及创建针对奇特、新型故障的定制解决方案方面表现得出色得多,而旧系统无法处理这些问题。
- 安全性: 由于有了安全检查员,它极少尝试危险的修复方案。
简而言之,PASE 将云端修复从一种僵化的“如果灯 B 闪烁,就按按钮 A”的方法,转向了一种灵活的、思考型的方法,让系统能够像人类专家一样,通过规划、检查和学习来走出困境。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。