← 最新论文
🤖 AI

Agentic Observability: Automated Alert Triage for Adobe E-Commerce

本文提出了一种部署在 Adobe 电商基础设施中的智能体观测框架,该框架采用 ReAct 范式自主执行告警分诊,通过动态日志分析和上下文感知型行动规划,在保持诊断准确性的同时,实现了平均洞察时间(MTTI)降低 90% 的成果。

原作者: Aprameya Bharadwaj, Kyle Tu

发布于 2026-02-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Aprameya Bharadwaj, Kyle Tu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一个规模宏大、高速运转的电子商务商店(就像 Adobe 所运营的那样)就像一座巨大的、繁忙的城市。这座城市由数以千计微小的、相互连接的建筑(微服务)组成,它们不断进行通信以处理订单、管理订阅并展示产品。

在这座城市里,问题随时都在发生。水管可能爆裂,交通灯可能故障,或者电力可能会闪烁。在过去,当警报响起时,一名人类“消防员”(工程师)必须:

  1. 奔向警报现场。
  2. 拿取地图(日志)。
  3. 跑去五个不同的建筑检查它们的状态。
  4. 打电话给图书馆,查询该特定建筑的操作手册。
  5. 最后,弄清楚哪里坏了以及如何修复。

这个过程耗时很长(大约 18 到 33 分钟),而且消防员经常感到应接不暇,因为他们要同时处理太多的地图和工具。

新的解决方案:“超级侦探”团队

这篇论文介绍了一种被称为智能体可观测性(Agentic Observability)的新系统。请不要将其仅仅视为一个机器人,而是一个专门的侦探团队,他们在警报响起的一瞬间就会立即行动。他们不会等待人类指示去做什么;他们会立即投入战斗。

这个团队是如何构成的,我们可以使用一个简单的类比:

  • “侦察兵”(Splunk Agent): 一旦警报响起,这个智能体就会奔向现场。它从出错的具体位置抓取特定的“犯罪现场照片”(日志)。它会过滤掉噪音,并找到真正重要的线索(错误信息)。
  • “侦探”(Tools Agent): 这是行动的大脑。它观察侦察兵发现的线索。它会思考:“我们是不是刚改了水管?还是电网出问题了?”它会查阅城市的蓝图(运行手册/runbooks)和近期变更的历史(代码部署),以弄清楚为什么会发生这种情况。然后,它会制定一个分步修复计划。
  • “质量控制官”(Reflection Agent): 在团队向人类老板提交报告之前,这个智能体会对工作进行复核。它会自问:“我们漏掉了什么吗?这个解释合理吗?这个修复方案安全吗?”如果团队不是 100% 确定,它们会在尝试几次后停止,并告诉人类:“这是我们目前最好的猜测,但我们需要您的帮助。”

它是如何在现实中运作的

论文在测试这个团队时,针对了一个特定的问题:内容校验错误(Content Validation Errors)。想象这样一个场景:网站上的某个产品描述出现了拼写错误或格式损坏。在旧系统中,人类必须手动搜索数千行文本,以找到那个错别字,确定它是哪种语言版本,然后进行修复。每处理一个错误大约需要 13 分钟

有了这个 AI 团队:

  1. 警报响起。
  2. 侦察兵瞬间提取出显示损坏文本的具体日志。
  3. 侦探弄清楚到底是哪个产品以及哪个语言版本损坏了,并找到错误的准确行号。
  4. 质量控制官检查发现的结果。
  5. 团队向人类工程师发送一条消息:“错误出现在法语版的‘夏季促销’横幅中,第 42 行。这是修复方案。”

人类工程师只需点击“应用”即可完成修复。整个过程 AI 团队仅用了约 1.8 分钟

结果

论文声称,由于以下三个主要原因,这一新系统改变了游戏规则:

  1. 速度: 它将寻找问题的时间(平均调查时间/Mean Time to Insight)缩短了 90%。不再需要等待 18 分钟,答案在大约 2 分钟内就会送达。
  2. 准确性: 该 AI 团队在寻找正确原因方面的表现与专家级人类工程师不相上下(准确率约为 88%),但速度更快且更加一致。
  3. 减轻人类负担: 它自动化了人类原本需要手动执行的 65% 到 75% 的步骤。这意味着工程师可以将精力从寻找线索转向真正的修复城市。

局限性

论文坦诚地说明了其局限性。这个“超级侦探”团队的表现取决于它所能获取的信息。

  • 如果“电话线路”(API)因为同时响起的警报过多而拥堵,团队的速度可能会变慢。
  • 团队需要人类来教导它新建筑的规则(运行手册)。它无法凭空创造规则,只能遵循已被赋予的规则。
  • 对于危险的操作(比如关闭主电源开关),仍然需要人类给出最终的“批准”,以确保安全。

总结

简而言之,这篇论文描述了一个将响应式监控(等待人类去弄清楚出了什么问题)转变为主动式推理(一个能在警报响起时立即调查、推理并提出修复方案的 AI 团队)的系统。它将人类的角色从“侦探”转变为“监督者”,从而使企业能够更快地从故障中恢复。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →