💻 computer science
Read, Extract, Classify: A Tool for Smarter Requirements Engineering
本文介绍了 ReXCL,一种通过从半结构化文档中提取数据并利用预测建模和自适应微调对需求进行分类,从而增强需求工程、显著提升软件开发生命周期效率与准确性的自动化工具。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一位图书管理员,正试图整理一堆庞大而混乱的客户信件。有些信写在精美的信纸上,有些潦草地写在餐巾纸上,还有些只是冗长杂乱的段落。你的任务是阅读每一封信,找出哪部分是“主题行”,哪部分是“正文”,然后将它们分类到四个特定的箱子里:信息、标题、功能需求(产品必须做什么)和非功能需求(产品应如何表现)。
手工完成这项工作既缓慢又枯燥,还容易出错。这时,ReXCL工具就派上用场了。你可以把 ReXCL 想象成一个专为汽车行业设计的超级智能自动化机器人图书管理员。
其工作原理分为两个主要步骤:
步骤 1:“提取”机器人(清理与整理)
首先,机器人会处理一份杂乱的文档(如 PDF 或 Word 文件),并尝试理解其布局。
- 噪声过滤器:想象文档的顶部和底部到处都盖着页码、日期和“第 1 页,共 5 页”的印章。这些都是干扰项。机器人使用一个简单而快速的“大脑”(称为随机森林分类器)来识别这些重复模式并将其剔除,就像筛子将沙子与黄金分离一样。
- 结构构建器:一旦噪声被清除,机器人就会寻找文档的“骨架”。它会找到章节编号(如"1.1")和标题(如“主要任务”),然后抓取属于这些标题下的文本。
- 结果:它将杂乱的文档转化为整洁的结构化表格。这就像将一盒杂乱无章的乐高积木拼凑成一份清晰的说明书,其中每一块积木都有自己标好名称的插槽。
步骤 2:“分类”机器人(排序与标记)
现在文本已经清理并整理完毕,第二个机器人接手。这个机器人更加智能,并经过了专门训练。
- 专家训练:想象一位通用的语言专家(如标准的 BERT 模型),他精通英语但对汽车知之甚少。这个机器人会聘请这位专家,并通过阅读数千份未标记的汽车需求文档,为其提供“汽车术语”的速成课程。这被称为自适应微调。这就像让一位通用厨师在开始烹饪之前,通过品尝和研究数千份意大利食谱,从而专攻意大利菜系。
- 排序:现在,机器人阅读每一段文本并问道:“这是一个事实吗?这是一个标题吗?这是关于汽车必须做什么的规则(功能需求),还是关于它应该跑多快的规则(非功能需求)?”
- 结果:它为每个句子贴上数字标签。论文声称,这个机器人在准确性方面表现出色,尤其是在其他工具容易遗漏的棘手类别上。
验证:它奏效了吗?
研究人员将他们的机器人与人类专家进行了对比测试。
- 提取方面:三位专家检查了机器人在 445 个句子上的工作。机器人获得了4.45 分(满分 5 分)。它在识别并去除那些烦人的页眉和页脚方面,准确率达到了 96%。
- 分类方面:当机器人尝试对文本进行分类时,其表现相比未经训练的标准模型有了巨大提升。
- 标准模型表现挣扎,在困难类别上的得分低至0.22(满分 1.0)。
- 经过特殊训练的 ReXCL 机器人,得分在0.93 到 0.99之间。它在区分“功能需求”和“非功能需求”方面几乎完美。
全局视角
论文总结道,ReXCL 是一款自动化工具,可将杂乱的客户文档转化为干净、结构化的数据,从而消除那些枯燥且易出错的人工工作。
- 它能做什么:它接收原始文件,对其进行清理、结构化并打上标签。
- 它目前还做不到什么:它目前仅处理文本文档。作者提到,未来他们希望教会它理解图像、表格和电子表格,但目前它仍局限于文本。
- 输出结果:一旦机器人完成工作,你可以将结果下载为整洁的文件(如 Excel 或 CSV),并直接输入到 IBM DOORS 等专业工程工具中。
简而言之,ReXCL 是一个数字助手,它将一堆混乱的需求文档转化为一个完美有序、贴好标签的文件柜,从而为工程师节省数小时的手工排序时间。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。