← 最新论文
💻 computer science

DKSE: Automated Extraction of Structured Domain Ontologies from Software Requirement Documents via Large Language Models

本文介绍了 DKSE,这是一款基于 Rust 的工具,它利用大语言模型将中国银行业非结构化的软件需求文档自动转换为机器可读且具有溯源追踪能力的本体,并证明了其在测试生成和知识图谱构建等下游任务中的高准确性和实用价值。

原作者: Yahua Ruan

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Yahua Ruan

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正走进一座宏伟而古老的图书馆,其中的每一本书都用只有人类才能理解的语言编写而成。你可以阅读其中的故事、规则和指令,但如果你试图让机器人根据这些指令去寻找特定的事实、建造一台新机器,或者检查某项规则是否被遵守,机器人只会茫然地盯着你看。它看到的是段落文字,而不是它进行神奇运作所需的结构化数据。这就是软件工程领域的日常现状。几十年来,驱动业务运行的“源代码”——即它们的业务需求、规则和流程——一直被锁在像 Word 文件和 PDF 这样非结构化的文档中。虽然人工智能在阅读和编写代码方面已经变得极其出色,但在理解那些告诉它“应该构建什么”的杂乱自然语言文档方面,它仍然感到吃力。一个巨大的问题一直是:我们如何将这些人类的故事转化为机器可以真正用于思考、构建和验证的格式?

DKSE(领域知识结构化引擎)应运而生,它是一款充当超级翻译官和图书管理员的新型工具。把它想象成一个功能强大的扫描仪,它不仅仅是在阅读一份需求文档,它还能理解其中的故事,并瞬间将其重写为一份完美组织的、机器可读的蓝图。DKSE 不再将信息留作一堵文字之墙,而是将其分解为六个特定的、有用的类别:实体(故事中的角色,如“客户”或“账户”)、关系(它们如何连接,如“客户拥有账户”)、规则(宇宙的法则,如“如果余额过低,则拦截交易”)、流程(步骤化的舞蹈,如“如何审批贷款”)、API(数据进入或离开的门窗)以及词典(允许使用的单词和代码的官方列表)。

研究人员在大量真实的银行文档上测试了这个工具——大约 8 亿(注:原文为 800,000 中文字符,此处应为 80 万)汉字的复杂金融规则。结果令人印象深刻:DKSE 自动提取了 3,439 个不同的结构化知识点,包括 1,200 多条规则和近 600 个数据接口。当人类专家对工作进行检查时,发现其准确率高达 96%,且零“幻觉”(即 AI 凭空捏造内容)。但真正的魔力不仅在于提取,更在于接下来的应用。由于信息现在已经结构化,团队利用它瞬间生成了 1,214 个测试问题来检测其他 AI 模型,构建了一个约 200 万 token 的大规模训练数据集来教导新的 AI 大脑,甚至将其输入到一个知识图谱系统中,以帮助计算机精准地检索事实而不产生臆造。该论文将其呈现为针对银行业的一个成功的概念验证,表明我们终于可以将那些尘封的需求文档转化为驱动现代软件开发的、有生命力的“大脑”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →