Causely: A Causal Intelligence Layer for Enterprise AI A Benchmark Study on SRE and Reliability Workflows
本文介绍了 Causely,这是一种因果智能层,能够将原始可观测性数据转化为结构化、可查询的模型,并通过基准实验证明,它通过缩短诊断时间、降低令牌消耗和成本,同时实现完美的根因定位准确率,显著提升了 AI 代理在站点可靠性工程(SRE)工作流中的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一名侦探,正试图在一座庞大而繁忙的城市(你的计算机系统)中解开一个谜团。这座城市拥有成千上万的建筑、道路,以及不断流动的人群。突然,发生了一起案件:一家商店停止销售商品。
旧方法(没有 Causely):
目前,当 AI 侦探试图解决计算机系统中的这些“案件”时,它们被给予一个巨大的、未经整理的原始证据箱。这个箱子里装满了数百万页的警方报告、监控录像、交通日志和电话记录(这些就是“原始遥测数据”,如日志和指标)。
为了找出罪魁祸首,AI 必须阅读箱子里的“所有内容”,尝试弄清楚建筑之间如何连接,猜测谁与谁交谈,并从头开始拼凑出一个故事。
- 问题所在: 这非常耗时。AI 会被海量的纸张搞得困惑不堪。它经常浪费时间去阅读与案件无关的内容。有时,它甚至会因为过于努力地在噪音中寻找模式,而编造出一桩从未发生过的案件。
- 代价: 由于 AI 必须阅读如此多的内容,它消耗了巨大的“脑力”(token),这既耗费金钱也耗费时间。
新方法(使用 Causely):
该论文介绍了 Causely,它就像一个实时更新的城市超级智能地图。Causely 不是将一箱原始文件交给侦探,而是递给他们一张清晰、带颜色编码的地图,这张地图已经展示了:
- 布局: 哪些建筑与哪些建筑相连。
- 关系: 如果建筑 A 发生故障,它会自动导致建筑 B 失效。
- 真相: “这就是此刻确切出问题的地方,以及原因。”
研究发现了什么:
研究人员通过创建一个包含 24 个不同“服务”(就像商场里的 24 家不同商店)的虚假计算机系统,然后破坏其中一个,来测试这种方法。他们让四种不同类型的 AI 侦探来解决问题:一些侦探使用原始文件箱,另一些则使用 Causely 地图。
以下是他们使用地图时发生的情况:
- 速度: 侦探们找出罪魁祸首的速度快了 63%。他们不再需要阅读 281 秒的文件,而是在 13 秒内就解决了问题。
- 准确性: 当系统确实发生故障时,没有地图的侦探只有 75% 的时间能找对。而有了地图,他们的准确率达到了100%。
- 更少的错误: 当系统实际上处于“健康”状态(没有案件)时,没有地图的侦探往往会惊慌失措,声称“我认为有案件发生!”(产生幻觉)。而地图则明确告诉他们“一切正常”,阻止了他们编造故事。
- 金钱: 由于侦探们不需要阅读那么多内容,他们使用的“脑力”(token)减少了 60%。这使得每次调查的成本降低了 57%。
“健康”状态的意外发现:
研究发现了一件有趣的事情:没有地图的侦探实际上花费了更多的时间和金钱去证明系统是健康的,而不是去发现真实的案件。为什么?因为如果没有地图,他们必须检查每一栋建筑,以确保没有任何问题。然而,地图可以立即说出“一切正常”,为他们节省了巨大的精力。
核心结论:
该论文认为,随着 AI 变得越来越昂贵(因为公司按读取的单词/token 收费),让 AI 阅读原始数据的旧方法正变得过于昂贵和缓慢。Causely 充当了一个翻译器,在 AI 开始思考之前,就将杂乱的数据转化为清晰、结构化的故事。这使得 AI 更快、更智能、更便宜,并且更少编造内容。
简而言之: 给 AI 一张预先画好的地图,远比让它自己在赛跑时自己画地图要好得多。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。