← 最新论文
🤖 AI

Bian Que: An Agentic Framework with Flexible Skill Arrangement for Online System Operations

扁鹊是部署在快手搜索引擎上的智能体框架,通过引入统一的操作范式、面向动态数据与知识检索的灵活技能编排以及自进化机制,解决了大规模系统运维中的编排瓶颈,最终将告警量降低了 75%,并将平均修复时间缩短了 50% 以上。

原作者: Bochao Liu, Zhipeng Qian, Yang Zhao, Xinyuan Jiang, Zihan Liang, Yufei Ma, Junpeng Zhuang, Ben Chen, Shuo Yang, Hongen Wan, Yao Wu, Chenyi Lei, Xiao Liang

发布于 2026-04-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Bochao Liu, Zhipeng Qian, Yang Zhao, Xinyuan Jiang, Zihan Liang, Yufei Ma, Junpeng Zhuang, Ben Chen, Shuo Yang, Hongen Wan, Yao Wu, Chenyi Lei, Xiao Liang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一艘超高速巨型宇宙飞船的船长(就像快手搜索引擎),每天搭载数亿乘客。这艘飞船结构极其复杂,拥有成千上万个活动部件;工程团队每天都要对引擎、导航系统和生命维持系统进行数十次微调。

过去,确保这艘飞船安全运行曾是一场噩梦。每当工程师做出一次更改,警报就会大作。人类船员不得不四处奔忙,检查成千上万个仪表,阅读无尽的日志,并猜测问题出在哪里。这既令人筋疲力尽,又效率低下,而且往往导致错误,因为需要处理的信息量实在太大。

此时,扁鹊登场了。

请将扁鹊想象成并非单一机器人,而是你工程团队中一位超级智能、自我进化的“幕僚长”。它不仅仅是对问题做出反应,更能预测问题、诊断问题,并从每一次事件中学习,从而不断提升其工作能力。

以下是其工作原理,分解为三个简单概念:

1. 三道防线(“班次”)

扁鹊不像过去那样坐等灾难发生,而是将工作组织成三个特定的“班次”,就像医院一样:

  • 守门人(发布拦截):在新更新甚至尚未发布之前,该代理就会对其进行检查。它就像俱乐部门口严格的门卫,在你进入之前检查身份证件和随身物品。如果发现任何风险,它会立即阻止发布,从而在问题发生之前就将其扼杀。
  • 健康检查员(主动巡检):该代理会定期在飞船上巡视,即使警报未响,也会检查引擎温度和燃料水平。它能发现那些可能导致日后坠毁的“静默”问题,并在任何人意识到问题存在之前就将其修复。
  • 侦探(告警根因分析):如果警报真的响了,该代理就是侦探。它不会惊慌失措,而是立即收集正确的线索(日志、指标),并追问:“究竟哪里坏了?”它为人类船员提供清晰的答案,节省了数小时的猜测时间。

2. “灵活技能”系统(“工具箱”)

这是该论文最大的创新。过去,你必须为飞船的每一个部件手动编写规则手册。一旦飞船发生变化,规则手册就会失效。

扁鹊使用灵活技能。想象一个魔法工具箱,其中的每一件工具都确切知道它适用于什么工作。

  • 如果问题是“搜索引擎”出了故障,代理就会拿出“搜索工具”。
  • 如果问题是“视频播放器”出了故障,它就会拿出“视频工具”。

它是如何知道该使用哪种工具的?
它不依赖人类编写的静态手册。相反,AI 会根据具体情况自行编写指令

  • 生成:如果飞船增加了新部件,AI 会查看可用数据,并即时编写新的“技能”(一套指令)来处理它。
  • 修正:如果 AI 犯了错误,人类工程师只需用通俗的英语说:“嘿,你忘了检查燃料表。”AI 就会立即重写自己的指令,将这一步骤纳入下次操作。这就像一名学生在考试中收到更正后,立即更新自己的学习指南。

3. 自我进化循环(“记忆”)

大多数计算机系统是静态的;即使世界发生变化,它们也只会执行编程好的内容。扁鹊则不同,因为它拥有一个双重记忆系统,能从每一次事件中学习。

当工程师提供反馈(例如:“那个诊断是错误的”)时,扁鹊会利用这一条反馈,从两个方向同时改进:

  1. 更新知识库:它将学到的教训保存到关于飞船行为的永久“百科全书”中。
  2. 优化技能:它更新用于该工作的特定“工具”(技能),以确保不再犯同样的错误。

这就像一位厨师品尝菜肴。如果菜肴太咸,厨师不会直接把菜扔掉;而是会更新食谱(知识),并调整下次加盐的具体技巧(技能)。

成果:在快手发生了什么?

团队在快手的真实世界搜索引擎(一个拥有数亿用户的庞大平台)上测试了该系统。结果就像将混乱的急诊室变成了运转精良的机器:

  • 警报减少:实际需要人类关注的警报数量下降了75%。系统在噪音到达人类之前就将其拦截。
  • 误报减少:“噪音”(实际上是错误或无关紧要的警报)减少了约95%。人类仅在真正必要时才会收到通知。
  • 修复更快:当真正的问题发生时,解决时间(平均修复时间)缩短了**50%**以上。
  • 准确性:系统正确识别问题根源的比例达到了80%

为什么这很重要?

该论文认为,将 AI 用于运维最困难的部分,并非让 AI 在推理方面变得更“聪明”,而在于弄清楚应该喂给它什么信息。如果你把一切(所有日志、所有指标)都喂给 AI,它会感到困惑并产生幻觉。如果你什么都不喂给它,它就无法解决问题。

扁鹊通过充当智能过滤器解决了这一问题。它动态地决定针对特定问题究竟需要哪些数据和规则,并且每次人类给它一点提示时,它都能自学如何做得更好。

简而言之,扁鹊将一群过度劳累的工程师转变为一群高效的监督者,让 AI 承担数据排序和初步诊断的重任,而人类则专注于重大决策。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →