ReqGenX: An Empirical Study of Atomic Decomposition, Artifact Regeneration, and Reconstruction for Legacy SRS Documents
本文介绍了 ReqGenX,这是一项实证研究,通过将遗留的软件需求规格说明(SRS)文档分解为具有可追溯性的原子语句,并将其重新生成为合成的 pre-SRS 人造制品,展示了如何实现对基于大语言模型(LLM)的 SRS 生成进行细粒度评估,同时揭示了忠实度、信息保留与人造制品完整性之间的关键权衡。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个聪明、反应极快的机器人如何为一款新游戏编写规则手册。你递给机器人一本来自 20 世纪 90 年代的、写满了模糊想法、涂鸦笔记和半成品思想的凌乱手写笔记本。你的目标是让机器人将那本凌乱的笔记本变成一份完美、专业的规则手册。但这里有个陷阱:机器人因为太渴望提供帮助,可能会不小心发明新的规则、遗忘旧的规则,或者把两个不同的想法混淆成一个令人困惑的句子。这就是编写软件需求规格说明书(SRS)的世界。在技术领域,SRS 是告诉工程师软件应该具体做什么的“主蓝图”。虽然大语言模型(LLMs)——也就是那些能写诗和回答问题的同类 AI——在编写这些蓝图方面变得越来越出色,但要检查它们到底是在陈述事实还是在胡编乱造,却极其困难。我们需要一种方法,能够将机器人写的每一句话都追溯回那本凌乱的原始笔记本,以观察它是忠于原著还是在产生“幻觉”。
这正是 ReqGenX 背后的研究人员致力于解决的问题。他们不仅仅是要求 AI 写一份新的规则手册;他们构建了一个聪明的、分步骤的“工厂”,来测试 AI 如何将旧的、凌乱的文档分解为微小的、不可辩驳的事实,将这些事实转化为特定类型的笔记(如“用户故事”或“质量检查”),并观察这些笔记是否可以被用来重建原始构思而不丢失任何内容。这就像是把一座复杂的乐高城堡拆解开,仔细地拆下每一块积木并贴上标签,将它们分类放入特定的盒子中,然后尝试仅使用这些分类好的盒子来重建城堡。研究人员想要知道:AI 能做到这一点而不丢失任何一块积木,也不凭空创造出原本不存在的新颜色吗?
工厂:ReqGenX
团队创建了一个名为 ReqGenX 的流水线,作为这项实验的受控实验室。他们没有让 AI 直接“写”一份新文档,而是强制它通过三个严格的阶段,在每一步都扮演质量控制检查员的角色。
第一阶段:原子化拆解
首先,AI 获取一段来自旧文档的文本,并尝试将其拆解为“原子”。想象一下这样一个句子:“该产品使用 Qt 库,并且必须在所有支持的操作系统上运行。”对人类来说,这是一句话。但对 AI 来说,这实际上是两个不同的想法揉在了一起。目标是将它们拆分为“原子语句”——即微小的、自包含的、无法进一步拆分的真相。一个原子变成了“该产品使用 Qt 库”,另一个变成了“该产品必须在所有支持的操作系统上运行”。研究人员发现,AI 在这方面表现得相当出色。当他们检查这些微小的原子是否忠实于原文时,得分非常高,通常在 0.96 到 0.99 之间(在以 1.0 为完美的量表中)。然而,他们也注意到,有时 AI 会表现得过于积极,从而丢弃了一些信息,或者相反,保留了一些过于模糊而无法使用的信息。
第二阶段:分拣帽
一旦文本被拆解为原子,AI 就必须决定每个原子属于哪种类型的笔记。这就像巫师学校里的分拣帽。这个事实属于“用户故事”(关于一个人想做什么的笔记)吗?它属于“质量笔记”(关于系统必须多快或多安全的规则)吗?或者它只是一个“系统上下文”笔记(背景信息)?研究人员使用了一个由不同 AI 模型组成的团队来对这些类别进行投票。他们发现,虽然 AI 在处理通用概念时很擅长,但在面对非常具体的专业标签时有时会遇到困难。例如,在尝试判断一个句子是“功能性需求”还是“质量需求”时,AI 模型之间的分歧很大,一致性得分在某些情况下甚至降至 0.31。这表明虽然 AI 能看到森林,但有时会对具体的树木类型感到困惑。
第三阶段:重构
最后,AI 拿起这些经过分类和标记的原子,尝试将它们编写成一份全新的、看起来很专业的文档。这是真相大白的时刻:AI 能否将这些微小的、分类好的事实重新组合成一个连贯的故事?研究人员通过提取 AI 生成的笔记,并要求另一个 AI 根据这些笔记重建原始文档来进行测试。他们发现,AI 确实可以重建文档,但它并不是一个完美的副本。其“语义相似度”(含义匹配程度)尚可,范围在 0.69 到 0.75 之间,但“事实支撑度”(新文本是否真的证明了旧事实)则表现得较为不稳定。
结论:忠实但有缺陷
那么,研究人员究竟发现了什么?
首先,他们证实了 AI 可以成为一名非常优秀的图书管理员。它可以将一份凌乱的旧文档拆解为微小的、真实的细节,且成功率极高。大多数情况下,它创建的原子对源文本的忠实度在 96% 到 99% 之间。这意味着 AI 不仅仅是在凭空捏造;它通常是在遵循剧本。
然而,他们也发现了几个重要的“但是”。
- “缺失积木”问题: 尽管 AI 是忠实的,但它并不完美地保留了所有内容。根据文档和所使用的 AI 模型不同,成功保留的原始信息量(覆盖率)差异很大,范围从 35.6% 到 93.5% 不等。这并不意味着 AI 在撒谎;这意味着对于某些文档,AI 认为原始文本中的大部分内容过于模糊、冗余或属于结构性内容,因此不适合作为独立的“原子”保留;而对于另一些文档,它则几乎保留了所有内容。
- “完美模板”陷阱: 当 AI 尝试将这些原子转化为特定类型的文档(如“质量笔记”)时,它有时会在不添加虚假细节的情况下填补空白时遇到困难。虽然 AI 几乎 100% 通过了基础的“评委”测试,但更严格、更挑剔的测试(称为 Prometheus)显示,只有 54.8% 到 97.1% 的人工制品是真正完整且高质量的。这表明 AI 可以让事物看起来“正确”,但有时会缺失真正发挥作用所需的深度细节。
- 重构差距: 当他们尝试从 AI 的笔记中重建原始文档时,新版本是一个“可追溯的草案”,而不是完美的副本。它捕捉到了主要观点,但在翻译过程中丢失了一些细微差别。
这对未来意味着什么
研究人员并不是在说 AI 已经解决了编写软件规则手册的问题。相反,他们是在说 AI 是一个强大的信息“检查”和“组织”工具,但它需要人类的引导。
他们发现,最大的瓶颈不在于 AI 的写作能力,而在于证据的粒度。如果原始文档过于模糊,或者将太多想法混在一起,AI 就会难以将其转化为清晰、可用的格式。AI 无法凭空创造缺失的上下文;它只能利用已有的素材进行工作。
最终,这项研究表明,我们可以利用 AI 来创建“可追溯的合成人工制品”——即能够链接回原始来源的数字笔记,这样我们就能清楚地看到每一个想法的来源。这是检查 AI 是否在说实话的一大进步。但这也提醒我们:仅仅因为 AI 生成了一份整洁、专业的文档,并不意味着它捕捉到了原始文档的所有细节。AI 是一个出色的助手,但它仍然需要人类来拿着地图,确保没有遗漏任何一块积木。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。