Ephemeral Subgraph Generation: Real-Time Knowledge GraphConstruction for Cross-System Investigation
本文提出了瞬态子图生成(Ephemeral Subgraph Generation, ESG),这是一种由大语言模型引导的实时方法,通过在异构工程系统中构建针对特定问题的临时知识图谱,旨在超越静态检索和固定跳数基准线,以进行跨系统调查,同时记录并解决评估过程中识别出的特定软件缺陷。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代软件工程领域,关键信息很少存在于单一之处。当服务发生故障或出现漏洞时,真相往往散落在十几个不同的数字孤岛中:记录问题初衷的工单系统、编写修复方案的代码仓库、事件管理仪表盘、文档维基以及内部聊天日志。这些系统中的每一个都持有拼图的一块,但没有一个能掌握全貌。传统上,工程师们试图通过构建一张庞大且永久的地图,预先连接来自所有系统的每一条数据来解决这个问题。这种方法构建成本高昂,难以随着底层系统的变化而保持更新,并且往往无法捕捉到导致解决方案的那些微妙且非显性的联系。
最近的研究描述了一种新的方法,建议用一种不同的方式来思考这个问题。该方法不再试图构建一张覆盖一切且持久存在的永久地图,而是在提出特定问题时,仅构建一张小型且临时的地图。这就像是派遣一支专门的小队去调查单起事故,只收集针对该特定案例所需的证据,并在找到答案后收拾好证据撤离。这种被称为“瞬时子图生成”(Ephemeral Subgraph Generation)的技术,允许人工智能系统在不同的软件平台之间跳转,追踪将工单与一行代码、或一条聊天消息与一个文档页面联系起来的线索,而无需预先存在一个包含所有可能连接的数据库。其目标是通过主动探索分散文档之间的关系来寻找问题的根本原因,而非仅仅在静态列表中搜索关键词。
这项研究背后的研究员萨凯特·贾恩(Saket Jain)旨在测试这种按需生成的临时地图是否能找到传统方法所遗漏的答案。为此,他创建了一个模拟真实工程组织的合成环境,其中包含分布在五个不同系统(事件管理器、工单系统、代码托管平台、维基和聊天平台)中的154条记录。随后,他向系统提出了35个具体问题,范围从“为什么登录服务失效了?”到“最近有哪些可能相关的变更?”系统被要求寻找能够回答这些问题的正确文档。研究员将这种新方法与两种更简单、更廉价的方法进行了对比。第一种是标准的搜索,它在不尝试将文档相互关联的情况下同时查看所有文档;第二种是稍先进一点的方法,它寻找直接的标识符(如工单编号),然后通过这些编号追踪到下一个文档,但仅限于固定的步数。
结果显示,临时地图方法具有明显的优势。在衡量系统找到正确文档的数量时,新方法的成功率接近97%。相比之下,简单的搜索仅能找到约58%的正确文档,而通过标识符追踪两步的方法则找到了约70%。这种差异不仅仅是多发现了一两个文档的问题;新方法找到了其他方法根本无法触及的联系。具体而言,在那些文档之间没有共同名称、工单编号或明显文本链接的情况下,新方法依然取得了成功。这些是“软性”连接,即问题与原因之间的联系仅存在于文本的叙述流或文件的元数据中,对于依赖于追踪已知标识符链条的方法来说是不可见的。研究表明,仅仅追踪已知的链接链条,无论链条有多长,都会遇到一个无法逾越的瓶颈;而新方法可以通过理解内容的含义来实现跨越式跳转。
然而,这种提升寻答能力的能力也带来了显著的代价。新方法运行所需的时间和资金都要多得多。虽然较简单的方法成本不到一美元且只需几分钟即可完成,但新方法处理每组问题大约需要六美元,并耗时约一小时才能完成整套问题。这是因为系统必须进行更多的调用,利用人工智能来决定一个文档是否相关、从文本中提取名称以及验证连接。研究员对这种权衡保持透明,指出较高的成本是为获取那些廉价方法无法捕捉到的隐秘联系所付出的代价。答案的精确度(即检索到的文档中有多少实际上是有用的)对于新方法来说略低,但研究员发现,这在很大程度上是因为系统找到了一些不在原始预期答案列表中的额外正确文档,而非找到了错误的信息。
在评估过程中,研究员还发现并修复了系统中的几处缺陷,将这一过程视为一项严谨的科学实验,而非仅仅是对成功的演示。其中一个问题是,系统最初仅仅因为文档包含搜索到的名称就接受该文档,即便该文档并不相关。这通过添加相关性检查得到了解决。另一个问题是,系统有时会因为响应空间不足而停止处理大量的潜在答案,导致其在无提示情况下拒绝了有效的文档。这通过增加允许的响应空间得到了解决。第三个更微妙的限制在于,系统在处理仅存在于文件结构化元数据而非文本本身中的连接时表现挣扎;针对这一特定情况,研究员决定完全跳过判断步骤。这些修正通过多次运行测试得到了验证,确认了系统的性能是稳定的,且改进是真实的。
研究结论认为,对于信息分散且联系不明显的复杂调查任务,构建一个针对特定问题的临时地图是一个强大的工具。它优于依赖固定标识符链条或简单关键词搜索的方法,尤其是在答案隐藏在文档间的微妙关系之中时。尽管成本更高,但其揭示问题全貌(包括没有任何单一系统知晓的部分)的能力表明,这种方法对于面临复杂多系统挑战的组织具有价值。研究员指出,这项工作是在合成数据集和特定的软件工程背景下进行的,因此对于该方法如何扩展到现实世界中杂乱的数据或其他领域(如欺诈检测)仍留有疑问。尽管如此,研究结果为需要跨碎片化数字景观调查问题的系统提供了一条清晰的路径,证明了有时寻找答案的最佳方式就是为每一个问题构建一张新地图。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。